Greenbook: почему модель внутри synthetic research инструмента имеет значение
Рынок синтетических исследований развивается быстро. Польза очевидна: более короткие сроки, меньшие затраты, отсутствие необходимости в рекрутинге участников. Но по мере того как команды специалистов по инсайтам всё активнее включают AI-сгенерированные данные в свои рабочие процессы, неизбежно возникают критические вопросы: какой тип модели следует использовать? Что именно делает модель, когда генерирует ответ, и как эти ответы калибруются? От ответов зависит качество результатов.
Где универсальные AI-модели не справляются с синтетическими исследованиями
Универсальная LLM — технология, лежащая в основе таких инструментов, как ChatGPT, Gemini или Claude, — генерирует ответы, предсказывая наиболее вероятный текст для заданного входного запроса. Когда вы просите её симулировать респондента («отвечай как 28-летний мужчина, работающий в производстве на Среднем Западе»), она выдаёт ответы, отражающие культурные паттерны и лингвистические нормы, заложенные в обучающих данных — а для универсальных моделей это преимущественно интернет. Результат выглядит правдоподобно, и для качественной разведки и раннего формирования гипотез он действительно может быть полезен. Проблема возникает, когда исследователи пытаются использовать эти данные для количественного анализа.
Реальные выборки дают данные с естественной дисперсией: несоответствия между декларируемыми и выводимыми предпочтениями, нелинейные паттерны ответов, распределённый шум, который фактически отражает, как люди принимают решения в условиях неопределённости. Универсальные модели стремятся сгладить эту дисперсию, генерируя ответы, которые кластеризуются вокруг того, что персона «обычно» думает, а не распределяются так, как это делает реальная выборка. Поверхностно результат выглядит структурированным, но зачастую таковым не является.
Когда подобные данные прогоняют через более сложные исследовательские методы — факторный анализ, кластеризацию, анализ ключевых драйверов, conjoint-анализ — данные нередко лишены структурной целостности, которой эти методы требуют. Универсальные модели создавались для написания писем, резюмирования документов и ответов на открытые вопросы. Они не предназначены для симуляции статистического поведения респондентов опросов. Просить их об этом — значит пренебрегать категориальным несоответствием, и недостатки проявляются именно тогда, когда анализ становится наиболее значимым.
Три основных подхода к генерации синтетических данных и их компромиссы
Большинство synthetic research инструментов на рынке сегодня относятся к одной из трёх неравнозначных категорий.
Prompt-engineered персоны инструктируют универсальную LLM отвечать как определённый сегмент аудитории через системные инструкции и пользовательские запросы. Эти инструменты действительно полезны для ранней качественной разведки и генерации гипотез. Их ограничение — в количественной симуляции: без более глубокой кастомизации модели ответы кластеризуются вокруг культурных архетипов, а не отражают аутентичную дисперсию реальной популяции. Данные, выглядящие структурированными на первый взгляд, не выдерживают статистической проверки.
RAG (Retrieval-Augmented Generation)-based digital twins идут дальше, заземляя модель в курируемой базе данных документов, транскриптов интервью или данных предыдущих исследований. Это даёт более разнообразные и реалистично выглядящие результаты и особенно полезно для нишевой аудитории, где реальные данные могут точнее анкеровать ответы. Ограничение состоит в том, что любое смещение, присутствующее в базе данных для извлечения, переносится в синтетический результат. Как и prompt engineering, RAG добавляет слой специфичности без изменения базовой модели.
Fine-tuned LLMs устроены иначе. Вместо того чтобы формировать универсальную модель через инструкции или дополнительные данные, fine-tuning переобучает её на реальном поведении людей при прохождении опросов — фундаментально меняя то, как она генерирует ответы. В итоге получается не модель, симулирующая то, что персона «сказала бы», а модель, научившаяся воспроизводить статистическое поведение реальных респондентов.
Подход Qualtrics к синтетической модели
Fine-tuning — это инвестиция, которую Qualtrics сделала до того, как предложила синтетические аудитории клиентам. Вместо адаптации универсальной модели через prompt engineering или RAG в одиночку команда разработала базовую модель, обученную специально на анонимизированных данных маркетинговых исследований и оптимизированную для генерации ответов на опросы, выдерживающих строгую статистическую проверку. Независимое тестирование показало, что модель Qualtrics в 12 раз точнее универсальных LLM в прогнозировании ответов людей на вопросы опросов.
Fine-tuning формирует ядро архитектуры — дополняя другие методы, а не заменяя их. Поверх этого prompt engineering направляет взаимодействие модели с каждым инструментом опроса, сохраняя соответствующий контекст и характеристики персоны на протяжении сбора данных. RAG может применяться для заземления результатов в актуальной рыночной информации, а не только в исторических обучающих данных. Каждый слой решает разную задачу.
Для руководителей исследовательских направлений, испытывающих давление в пользу ускорения без потери строгости, от которой зависит их авторитет, качество базовой модели важнее, чем интерфейс, построенный поверх неё. Синтетические данные, не выдерживающие статистической проверки, не ускоряют исследовательские процессы ни в каком значимом смысле — они просто переносят расплату вниз по воронке, добавляя риск к и без того сложным решениям. Инвестиции в разработку базовой модели — более трудный путь, но именно он делает результаты достаточно надёжными для использования.