Saltar a contenido

Pre-procesamiento

Las opciones de pre-procesamiento mejoran la calidad de un archivo de datos o lo preparan para el uso correcto por parte del sistema. Se eligen antes de iniciar el proyecto y se ejecutan en secuencia.

Opciones de pre-procesamiento

Clean & Reshape

Ajusta sus datos sin importar el formato de origen, en cuatro pasos:

1. Eliminación de filas

Elimine filas vacías, o la fila de encabezado duplicada cuando el archivo tiene dos filas de encabezado por columna — se recomienda conservar los encabezados codificados.

2. Definición del cuestionario

Indique dónde comienza y termina el cuestionario a los efectos del entrenamiento y la predicción de respuestas. Las columnas ubicadas después del final del cuestionario se mueven automáticamente antes de la primera pregunta.

Las filas completamente vacías se detectan como perfiles a predecir.

El interruptor Complete / Incomplete:

  • Activado — todas las filas subidas (salvo las completamente vacías) son filas válidas que cumplen la lógica de salto del cuestionario.
  • Desactivado — la herramienta asume que cualquier fila puede estar incompleta y predecirá hasta la última columna, usando los datos de las filas completas de cada columna para entrenar.

3. Eliminación de columnas

Elimine columnas que no sirven para perfilar ni predecir: checksums, horas de inicio/fin, otros identificadores de fila.

4. Auto Clean

Eliminación simplificada de columnas de perfilado sin diversidad (valores monolíticos) o de baja cobertura/densidad. Recomendamos procesar archivos con 50–100 columnas de perfilado como máximo.

Numeric Preprocessor

Analiza y ajusta columnas numéricas: redondee valores, o elimine valores que no se alinean con la lógica del cuestionario o con lo esperado para ese tipo de pregunta.

Open Text Normalizer

Normalizar las respuestas de texto es una prioridad en machine learning: distinguir uniformemente cada marca, o agrupar conceptos clave, permite que los modelos interpreten mejor cada dato. n-Infinite ofrece tres tipos de normalización:

  • Brands — agrupa todas las menciones de marca mitigando variaciones como errores de tipeo o mayúsculas/minúsculas. El botón AI Suggest genera etiquetas de categoría analizando las menciones existentes. Si una respuesta menciona varias marcas, se separan con el carácter ~. Se pueden concatenar varias columnas bajo el mismo criterio.
  • Concept — analiza cada respuesta y las agrupa conceptualmente, hasta un máximo de conceptos distintos definido por el usuario. AI Suggest ayuda a generar etiquetas a partir de una muestra de respuestas. Varios conceptos en una respuesta se separan con ~.
  • Sentiment Suite — descompone las respuestas en variables de sentimiento, palabras clave y elementos centrales, habilitando la predicción por ML y la regeneración de respuestas abiertas únicas y sensibles al contexto de cada panelista.

Opcionalmente, luego puede elegir las columnas que definen edad, género y país/región para enfocar el análisis.