Перейти к содержанию

Как устроен проект

Проект начинается с одного или двух файлов данных:

  • Train-файл — ваши реальные собранные ответы на опрос.
  • Predict-файл (опционально) — популяция, для которой нужно сгенерировать синтетические ответы. Если отдельного файла нет, n-Infinite может автоматически разделить один загруженный файл на train- и predict-части по месту начала анкеты (режим Swift), используя единую структуру респондентов.

n-Infinite принимает распространённые форматы опросов и выгрузок данных: CSV, Excel (XLSX/XLS), JSON, Parquet, Feather и SPSS (.sav) — включая метки переменных SPSS.

После загрузки проект проходит понятный конвейер: первичная настройка и валидация, обучение, предсказание, завершение. По пути его можно ставить на паузу, возобновлять и перезапускать; платформа отслеживает статус на каждом шаге.

Типы проектов

Сценарий Train-файл Predict-файл Поведение Примечания
Single File Расширение полевых проектов, проекты через API Полевые данные (завершённые анкеты) + профильные данные Автоматически делит файл на train- и predict-наборы Если последний вопрос не обязателен, добавьте колонку Completed = Y для маркировки завершённых анкет
Split File Расширение полевых проектов: полевые данные + готовые профили Полевые данные (завершённые анкеты) Профильные данные Предсказывает все целевые колонки. Predict-файл не должен содержать имена предсказываемых колонок Последняя колонка не обязательна, даже если вопрос опционален — поддерживается автоопределение
Complete-the-Incomplete Превращение прерванных анкет в завершённые Полевые данные (завершённые) + полевые данные (прерванные) Читает строки справа налево и предсказывает недостающие данные; существующие данные используются для обучения даже в неполных строках Если последний вопрос не обязателен, добавьте колонку Completed = Y
Boost — Swift Расширение без доступных профилей. Идеально для B2B Полевые данные (завершённые) Добавляет столько же синтетических строк предсказания, используя существующее профилирование. Требуется пост-взвешивание Выберите первый предсказываемый вопрос и целевые параметры взвешивания
Boost — Express Расширение без доступных профилей. Идеально для больших бустов и B2C Полевые данные (завершённые) Добавляет от 1× до n× строк предсказания; импутирует реальные профили из национальных данных переписи (есть предзагруженные страны). Требуется пост-взвешивание Выберите первый вопрос и цели взвешивания. Требуется сопоставление колонок с переписью

Типичная структура файла

По горизонтали типичный файл n-Infinite устроен так:

  1. Профильные данные
    • Идентификация респондента (UserId, Id, …)
    • Демография: пол, возраст, место жительства, этничность, …
    • Дополнительное профилирование: психографика (B2C) или фирмографика (B2B)
    • Скрининговые вопросы (если хотите держать их вне обучающих данных)
  2. Обучающие данные — полевые ответы.

По вертикали:

  • Один файл: строки train и predict перемешаны — завершённые против только-профильных или завершённые против неполных.
  • Раздельные файлы: обучающие данные лежат в train-файле; в predict-файле удалите имена колонок предсказываемых полей.

Советы по оптимизации файлов

  1. Допустимые форматы: Excel (.xlsx, .xls), CSV и SPSS (.sav).
  2. Никогда не допускайте дублирующихся имён полей.
  3. Удалите всё непрофильное, кроме идентификации: контрольные суммы, метки времени, персональные данные.
  4. Избегайте полей низкой плотности (более 90% пустых ячеек).
  5. По возможности добавьте поле Start с одним значением (например, Y) непосредственно перед началом обучающих данных.
  6. Если колонки заканчиваются неровно (последняя может быть пустой), добавьте поле End с одним значением (например, Y) в конец файла.