Saltar a contenido

Cómo funciona un proyecto

Un proyecto parte de uno o dos archivos de datos:

  • Archivo train — sus respuestas de encuesta reales, recolectadas en campo.
  • Archivo predict (opcional) — la población para la que quiere generar respuestas sintéticas. Si no tiene un archivo separado, n-Infinite puede dividir automáticamente un único archivo en porciones de train y predict según dónde comienza el cuestionario (modo Swift), usando la misma estructura de respondentes en todo el archivo.

n-Infinite acepta los formatos habituales de encuestas y exportación de datos: CSV, Excel (XLSX/XLS), JSON, Parquet, Feather y SPSS (.sav) — incluyendo las etiquetas de variables de SPSS.

Una vez subido, el proyecto avanza por un pipeline claro: configuración inicial y validación, entrenamiento, predicción y finalización. En el camino puede pausarse, reanudarse o reiniciarse, y la plataforma registra el estado en cada paso.

Tipos de proyecto

Caso de uso Archivo train Archivo predict Comportamiento Notas
Single File Boost de proyectos de campo, proyectos vía API Datos de campo (encuestas completas) + datos de perfilado Divide automáticamente el archivo en conjuntos de train y predict Si la última pregunta no es obligatoria, agregue una columna Completed = Y para identificar respuestas completas
Split File Boost de proyectos de campo: datos de campo + perfiles de stock Datos de campo (encuestas completas) Datos de perfilado Predice todas las columnas objetivo. El archivo predict no debe contener los nombres de las columnas a predecir La última columna no es requerida, incluso si es opcional — hay detección automática
Complete-the-Incomplete Convertir abandonos en encuestas completas Datos de campo (completas) + datos de campo (abandonos) Lee las filas de derecha a izquierda para predecir datos faltantes; los datos existentes se usan para entrenar, incluso en filas incompletas Si la última pregunta no es obligatoria, agregue una columna Completed = Y
Boost — Swift Boost sin disponibilidad de perfiles. Ideal para B2B Datos de campo (completas) Agrega un número idéntico de filas sintéticas de predicción usando el perfilado existente. Requiere post-ponderación Seleccione la pregunta inicial a predecir y los targets de ponderación deseados
Boost — Express Boost sin disponibilidad de perfiles. Ideal para boosts grandes y B2C Datos de campo (completas) Agrega de 1× a n× filas de predicción; imputa perfiles reales desde datos censales nacionales (países precargados). Requiere post-ponderación Seleccione la pregunta inicial y los targets de ponderación. Se requiere mapeo de columnas censales

Estructura típica de archivo

Horizontalmente, un archivo típico de n-Infinite se organiza así:

  1. Datos de perfilado
    • Identificación del respondente (UserId, Id, …)
    • Demográficos: género, edad, residencia, etnia, …
    • Perfilado extra: psicográficos (B2C) o firmográficos (B2B)
    • Preguntas de screening (si prefiere dejarlas fuera de los datos de entrenamiento)
  2. Datos de entrenamiento — las respuestas de campo.

Verticalmente:

  • Archivo único: las filas de train y predict están mezcladas — filas completas vs. solo-perfil, o completas vs. incompletas.
  • Archivos separados: los datos de entrenamiento van en el archivo train; en el archivo predict, elimine los nombres de columna de los campos a predecir.

Consejos para optimizar archivos

  1. Formatos admitidos: Excel (.xlsx, .xls), separado por comas (.csv) y SPSS (.sav).
  2. Nunca incluya nombres de campo duplicados.
  3. Elimine la información no perfilable salvo la identificación: checksums, timestamps, información personal.
  4. Evite campos de baja densidad (más del 90% de celdas vacías).
  5. Si es posible, incluya un campo llamado Start con un valor único (ej. Y) justo antes del comienzo de los datos de entrenamiento.
  6. Si las columnas terminan de forma despareja (la última puede venir vacía), incluya un campo End con un valor único (ej. Y) al final del archivo.