Как устроен проект¶
Проект начинается с одного или двух файлов данных:
- Train-файл — ваши реальные собранные ответы на опрос.
- Predict-файл (опционально) — популяция, для которой нужно сгенерировать синтетические ответы. Если отдельного файла нет, n-Infinite может автоматически разделить один загруженный файл на train- и predict-части по месту начала анкеты (режим Swift), используя единую структуру респондентов.
n-Infinite принимает распространённые форматы опросов и выгрузок данных: CSV, Excel (XLSX/XLS), JSON, Parquet, Feather и SPSS (.sav) — включая метки переменных SPSS.
После загрузки проект проходит понятный конвейер: первичная настройка и валидация, обучение, предсказание, завершение. По пути его можно ставить на паузу, возобновлять и перезапускать; платформа отслеживает статус на каждом шаге.
Типы проектов¶
| Сценарий | Train-файл | Predict-файл | Поведение | Примечания | |
|---|---|---|---|---|---|
| Single File | Расширение полевых проектов, проекты через API | Полевые данные (завершённые анкеты) + профильные данные | — | Автоматически делит файл на train- и predict-наборы | Если последний вопрос не обязателен, добавьте колонку Completed = Y для маркировки завершённых анкет |
| Split File | Расширение полевых проектов: полевые данные + готовые профили | Полевые данные (завершённые анкеты) | Профильные данные | Предсказывает все целевые колонки. Predict-файл не должен содержать имена предсказываемых колонок | Последняя колонка не обязательна, даже если вопрос опционален — поддерживается автоопределение |
| Complete-the-Incomplete | Превращение прерванных анкет в завершённые | Полевые данные (завершённые) + полевые данные (прерванные) | — | Читает строки справа налево и предсказывает недостающие данные; существующие данные используются для обучения даже в неполных строках | Если последний вопрос не обязателен, добавьте колонку Completed = Y |
| Boost — Swift | Расширение без доступных профилей. Идеально для B2B | Полевые данные (завершённые) | — | Добавляет столько же синтетических строк предсказания, используя существующее профилирование. Требуется пост-взвешивание | Выберите первый предсказываемый вопрос и целевые параметры взвешивания |
| Boost — Express | Расширение без доступных профилей. Идеально для больших бустов и B2C | Полевые данные (завершённые) | — | Добавляет от 1× до n× строк предсказания; импутирует реальные профили из национальных данных переписи (есть предзагруженные страны). Требуется пост-взвешивание | Выберите первый вопрос и цели взвешивания. Требуется сопоставление колонок с переписью |
Типичная структура файла¶
По горизонтали типичный файл n-Infinite устроен так:
- Профильные данные
- Идентификация респондента (
UserId,Id, …) - Демография: пол, возраст, место жительства, этничность, …
- Дополнительное профилирование: психографика (B2C) или фирмографика (B2B)
- Скрининговые вопросы (если хотите держать их вне обучающих данных)
- Идентификация респондента (
- Обучающие данные — полевые ответы.
По вертикали:
- Один файл: строки train и predict перемешаны — завершённые против только-профильных или завершённые против неполных.
- Раздельные файлы: обучающие данные лежат в train-файле; в predict-файле удалите имена колонок предсказываемых полей.
Советы по оптимизации файлов¶
- Допустимые форматы: Excel (
.xlsx,.xls), CSV и SPSS (.sav). - Никогда не допускайте дублирующихся имён полей.
- Удалите всё непрофильное, кроме идентификации: контрольные суммы, метки времени, персональные данные.
- Избегайте полей низкой плотности (более 90% пустых ячеек).
- По возможности добавьте поле
Startс одним значением (например,Y) непосредственно перед началом обучающих данных. - Если колонки заканчиваются неровно (последняя может быть пустой), добавьте
поле
Endс одним значением (например,Y) в конец файла.