Cómo funciona un proyecto¶
Un proyecto parte de uno o dos archivos de datos:
- Archivo train — sus respuestas de encuesta reales, recolectadas en campo.
- Archivo predict (opcional) — la población para la que quiere generar respuestas sintéticas. Si no tiene un archivo separado, n-Infinite puede dividir automáticamente un único archivo en porciones de train y predict según dónde comienza el cuestionario (modo Swift), usando la misma estructura de respondentes en todo el archivo.
n-Infinite acepta los formatos habituales de encuestas y exportación de datos: CSV, Excel (XLSX/XLS), JSON, Parquet, Feather y SPSS (.sav) — incluyendo las etiquetas de variables de SPSS.
Una vez subido, el proyecto avanza por un pipeline claro: configuración inicial y validación, entrenamiento, predicción y finalización. En el camino puede pausarse, reanudarse o reiniciarse, y la plataforma registra el estado en cada paso.
Tipos de proyecto¶
| Caso de uso | Archivo train | Archivo predict | Comportamiento | Notas | |
|---|---|---|---|---|---|
| Single File | Boost de proyectos de campo, proyectos vía API | Datos de campo (encuestas completas) + datos de perfilado | — | Divide automáticamente el archivo en conjuntos de train y predict | Si la última pregunta no es obligatoria, agregue una columna Completed = Y para identificar respuestas completas |
| Split File | Boost de proyectos de campo: datos de campo + perfiles de stock | Datos de campo (encuestas completas) | Datos de perfilado | Predice todas las columnas objetivo. El archivo predict no debe contener los nombres de las columnas a predecir | La última columna no es requerida, incluso si es opcional — hay detección automática |
| Complete-the-Incomplete | Convertir abandonos en encuestas completas | Datos de campo (completas) + datos de campo (abandonos) | — | Lee las filas de derecha a izquierda para predecir datos faltantes; los datos existentes se usan para entrenar, incluso en filas incompletas | Si la última pregunta no es obligatoria, agregue una columna Completed = Y |
| Boost — Swift | Boost sin disponibilidad de perfiles. Ideal para B2B | Datos de campo (completas) | — | Agrega un número idéntico de filas sintéticas de predicción usando el perfilado existente. Requiere post-ponderación | Seleccione la pregunta inicial a predecir y los targets de ponderación deseados |
| Boost — Express | Boost sin disponibilidad de perfiles. Ideal para boosts grandes y B2C | Datos de campo (completas) | — | Agrega de 1× a n× filas de predicción; imputa perfiles reales desde datos censales nacionales (países precargados). Requiere post-ponderación | Seleccione la pregunta inicial y los targets de ponderación. Se requiere mapeo de columnas censales |
Estructura típica de archivo¶
Horizontalmente, un archivo típico de n-Infinite se organiza así:
- Datos de perfilado
- Identificación del respondente (
UserId,Id, …) - Demográficos: género, edad, residencia, etnia, …
- Perfilado extra: psicográficos (B2C) o firmográficos (B2B)
- Preguntas de screening (si prefiere dejarlas fuera de los datos de entrenamiento)
- Identificación del respondente (
- Datos de entrenamiento — las respuestas de campo.
Verticalmente:
- Archivo único: las filas de train y predict están mezcladas — filas completas vs. solo-perfil, o completas vs. incompletas.
- Archivos separados: los datos de entrenamiento van en el archivo train; en el archivo predict, elimine los nombres de columna de los campos a predecir.
Consejos para optimizar archivos¶
- Formatos admitidos: Excel (
.xlsx,.xls), separado por comas (.csv) y SPSS (.sav). - Nunca incluya nombres de campo duplicados.
- Elimine la información no perfilable salvo la identificación: checksums, timestamps, información personal.
- Evite campos de baja densidad (más del 90% de celdas vacías).
- Si es posible, incluya un campo llamado
Startcon un valor único (ej.Y) justo antes del comienzo de los datos de entrenamiento. - Si las columnas terminan de forma despareja (la última puede venir vacía),
incluya un campo
Endcon un valor único (ej.Y) al final del archivo.