Предобработка¶
Опции предобработки улучшают качество файла данных или готовят его к корректному использованию системой. Они выбираются до запуска проекта и выполняются последовательно.

Clean & Reshape¶
Приводит данные в порядок независимо от исходного формата, в четыре шага:
1. Удаление строк¶
Удалите пустые строки или дублирующую строку заголовков, когда в файле по две строки заголовков на колонку — рекомендуется оставлять кодированные заголовки.
2. Определение анкеты¶
Укажите, где анкета начинается и заканчивается для обучения и предсказания ответов. Колонки, расположенные после конца анкеты, автоматически переносятся перед первым вопросом.
Полностью пустые строки распознаются как профили для предсказания.
Переключатель Complete / Incomplete:
- Включён — все загруженные строки (кроме полностью пустых) считаются валидными и соответствующими логике переходов анкеты.
- Выключен — инструмент считает, что любая строка может быть неполной, и будет предсказывать до последней колонки, используя для обучения данные завершённых строк в каждой колонке.
3. Удаление колонок¶
Удалите колонки, не нужные ни для профилирования, ни для предсказания: контрольные суммы, время начала/окончания, прочие идентификаторы строк.
4. Auto Clean¶
Упрощённое удаление профильных колонок без разнообразия (монолитные значения) или с низким покрытием/плотностью. Рекомендуем обрабатывать файлы, содержащие не более 50–100 профильных колонок.
Numeric Preprocessor¶
Анализирует и корректирует числовые колонки: округляйте значения или удаляйте те, что не соответствуют логике анкеты или ожиданиям для данного типа вопроса.
Open Text Normalizer¶
Нормализация текстовых ответов — приоритет в машинном обучении: единообразное распознавание каждого бренда и группировка ключевых концептов позволяют моделям лучше интерпретировать каждую запись. n-Infinite предлагает три типа нормализации:
- Brands — группирует все упоминания брендов, сглаживая вариации вроде
опечаток и регистра. Кнопка AI Suggest генерирует метки категорий,
анализируя существующие упоминания. Если в одном ответе упомянуто несколько
брендов, они разделяются символом
~. Несколько колонок можно объединить по одному критерию. - Concept — анализирует каждый ответ и группирует их по смыслу, до
заданного пользователем максимума различных концептов. AI Suggest
помогает создать метки категорий по выборке ответов. Несколько концептов в
одном ответе разделяются
~. - Sentiment Suite — раскладывает ответы на переменные тональности, ключевые слова и смысловое ядро, позволяя предсказывать их моделями и регенерировать уникальные открытые ответы с учётом контекста каждого панелиста.
Затем опционально можно выбрать колонки, определяющие возраст, пол и страну/регион, чтобы сфокусировать анализ.