Перейти к содержанию

Предобработка

Опции предобработки улучшают качество файла данных или готовят его к корректному использованию системой. Они выбираются до запуска проекта и выполняются последовательно.

Опции предобработки

Clean & Reshape

Приводит данные в порядок независимо от исходного формата, в четыре шага:

1. Удаление строк

Удалите пустые строки или дублирующую строку заголовков, когда в файле по две строки заголовков на колонку — рекомендуется оставлять кодированные заголовки.

2. Определение анкеты

Укажите, где анкета начинается и заканчивается для обучения и предсказания ответов. Колонки, расположенные после конца анкеты, автоматически переносятся перед первым вопросом.

Полностью пустые строки распознаются как профили для предсказания.

Переключатель Complete / Incomplete:

  • Включён — все загруженные строки (кроме полностью пустых) считаются валидными и соответствующими логике переходов анкеты.
  • Выключен — инструмент считает, что любая строка может быть неполной, и будет предсказывать до последней колонки, используя для обучения данные завершённых строк в каждой колонке.

3. Удаление колонок

Удалите колонки, не нужные ни для профилирования, ни для предсказания: контрольные суммы, время начала/окончания, прочие идентификаторы строк.

4. Auto Clean

Упрощённое удаление профильных колонок без разнообразия (монолитные значения) или с низким покрытием/плотностью. Рекомендуем обрабатывать файлы, содержащие не более 50–100 профильных колонок.

Numeric Preprocessor

Анализирует и корректирует числовые колонки: округляйте значения или удаляйте те, что не соответствуют логике анкеты или ожиданиям для данного типа вопроса.

Open Text Normalizer

Нормализация текстовых ответов — приоритет в машинном обучении: единообразное распознавание каждого бренда и группировка ключевых концептов позволяют моделям лучше интерпретировать каждую запись. n-Infinite предлагает три типа нормализации:

  • Brands — группирует все упоминания брендов, сглаживая вариации вроде опечаток и регистра. Кнопка AI Suggest генерирует метки категорий, анализируя существующие упоминания. Если в одном ответе упомянуто несколько брендов, они разделяются символом ~. Несколько колонок можно объединить по одному критерию.
  • Concept — анализирует каждый ответ и группирует их по смыслу, до заданного пользователем максимума различных концептов. AI Suggest помогает создать метки категорий по выборке ответов. Несколько концептов в одном ответе разделяются ~.
  • Sentiment Suite — раскладывает ответы на переменные тональности, ключевые слова и смысловое ядро, позволяя предсказывать их моделями и регенерировать уникальные открытые ответы с учётом контекста каждого панелиста.

Затем опционально можно выбрать колонки, определяющие возраст, пол и страну/регион, чтобы сфокусировать анализ.