Skip to content
Новость Switas Consultancy авг. 2026 г.

Switas: AI в пользовательских исследованиях — что работает, что нет и где проходит граница

AI в пользовательских исследованиях — что работает, что нет

Узкое место было не в интервью

Каждая статья об AI и пользовательских исследованиях начинается одинаково: исследования — это медленно, AI делает их быстрее. Такая формулировка не ошибочна, но она недостаточно точна, чтобы быть полезной, когда нужно решить, что конкретно изменить в понедельник утром.

Вот более точная версия. Проведение модерируемого интервью занимает шестьдесят минут и всегда будет занимать шестьдесят минут — потому что человеку нужно разговаривать шестьдесят минут. Раньше четыре дня уходило на всё вокруг: транскрибирование, разметку, поиск момента, когда трое участников сказали одно и то же разными словами, и превращение этого в нечто, с чем product manager успеет поработать до закрытия спринта.

Именно там уходило время — и именно там языковые модели сильны. Они находят паттерны в тексте. Research synthesis — это задача поиска паттернов в тексте. Совпадение реальное.

Но то же свойство, которое делает их хорошими инструментами синтеза, делает их в нём опасными. Модель, которая ищет паттерны, найдёт паттерны — независимо от того, существуют они на самом деле или нет, — и опишет придуманные ею так же уверенно, как настоящие. В исследованиях уверенная неправильная тема хуже, чем отсутствие темы вообще, потому что по неправильной теме начнут строить.

Поэтому вопрос не в том, использовать ли AI в пользовательских исследованиях. Все уже используют. Вопрос в том, какие части процесса передавать, что проверять перед тем, как довериться результату, и от чего отказываться автоматизировать вовсе. Именно об этом статья.

Где AI реально окупается

Мы соотносим AI с этапами исследовательского процесса, а не рассматриваем его как единое решение. У разных этапов очень разные профили риска.

ЭтапЧто AI делает хорошоЧто делает неправильноНаше правило
Рекрутинг и скринингЧерновики скринеров, выявление противоречий в ответах скринера, маркировка вероятных «профессиональных респондентов»Перефильтровывает в пользу артикулированных участников; отсеивает раздражённых пользователей, которые нужнее всегоТолько ассистирование. Финальный состав панели утверждает человек.
Discussion guideГенерация первого черновика из исследовательского вопроса, предложение follow-up проб, проверка на наводящие вопросыПроизводит универсальные гайды, тестирующие то, что и так известноИнструмент для черновика. Исследователь переписывает как минимум половину.
МодерацияВедение заметок в реальном времени, live-разметка, предложение проб человеку-модераторуНе может считать колебание, дискомфорт или паузу перед вежливой ложьюНикогда автономно. Вспомогательный инструмент для человека-модератора.
ТранскрибированиеРазделение спикеров, тайм-коды, первичная очисткаТочность транскрибирования турецкой речи резко падает при отраслевом жаргоне, названиях брендов и code-switchingАвтоматизировать, затем точечно проверить 10% по аудио.
Кодирование и разметкаПоследовательное применение существующей кодовой книги к сотням транскриптовИзобретение новых кодов в середине корпуса; схлопывание разных проблем в один удобный ярлыкАвтоматизировать с фиксированной, написанной человеком кодовой книгой.
СинтезКластеризация, выявление паттернов между участниками, черновик первого нарративаПутает частоту с важностью; сглаживает несогласного участникаТолько черновик. Каждая тема прослеживается до источника, прежде чем попасть в отчёт.
Анализ непрерывной обратной связиОтзывы в app store, тикеты поддержки, вербатимы NPS, логи чатов в объёмах, которые ни одна команда не осилит вручнуюКлассификация тональности плохо работает с сарказмом и культурной косвенностьюАвтоматизация с высокой отдачей и выборочными проверками.
Построение артефактовПерсоны, карты пути, деревья возможностей на основе верифицированных данныхПроизводит правдоподобные артефакты из тонких или отсутствующих доказательствТолько из верифицированных исследований, никогда из собственных знаний модели.

Две строки в этой таблице стоят больше остальных вместе взятых.

Кодирование в масштабе. Если у вас есть кодовая книга, написанная человеком, последовательное применение её к 40 транскриптам — это именно тот вид монотонной, основанной на правилах работы, в которой модели надёжны. Именно здесь сосредоточено большинство восстановимого времени.

Анализ непрерывной обратной связи. Большинство компаний сидят на тысячах отзывов из app store, тикетов поддержки и вербатимов опросов, которые никто не читал с момента поступления. Это применение AI с наибольшей отдачей и наименьшим риском во всей дисциплине, потому что вы не заменяете исследования, которые велись, — вы читаете данные, которые выбрасывались.

Четыре режима сбоев, которые мы регулярно замечаем

Это не теоретические риски. Это конкретные вещи, которые идут не так в реальных проектах, примерно в порядке убывания частоты.

1. Частота, маскирующаяся под важность

Попросите модель резюмировать двадцать интервью — она выдвинет на первый план то, что говорилось чаще всего. Но ценность исследования обычно не в модальном ответе. Она в одном участнике, который полностью прервал флоу, или в двух, независимо описавших один и тот же workaround, или в сегменте, который так и не добрался до шага, который обсуждали все остальные.

Модель, резюмирующая исследование оформления заказа, расскажет вам, что прозрачность стоимости доставки упоминалась часто. Она не скажет, что два единственных участника, завершивших покупку, оба были уже залогинены — а это и есть настоящая находка, которая присутствует в корпусе только как отсутствие.

Наша проверка: мы явно запрашиваем позицию меньшинства. «Какой участник не согласился с формирующимся консенсусом и что он сказал?» Если модель не может назвать конкретного — мы считаем резюме неполным, а не доказательством согласия.

2. Беглое изобретение

Модели воспроизводят цитаты, которые звучат в точности как то, что мог бы сказать участник, — приписывая их участнику, который этого не говорил. Не часто. Но достаточно часто. И сбой невидим при проверке, потому что сфабрикованная цитата читается лучше реальной — реальные люди говорят фрагментами.

Наша проверка: каждая цитата, которая попадает в клиентскую презентацию, содержит ссылку на транскрипт и тайм-код. Если её нельзя найти в исходном аудио — она не попадает в отчёт. Это механическое правило, не суждение, потому что именно суждение здесь отказывает.

3. Льстивый синтез

Дайте модели вашу гипотезу, а потом ваши данные — и синтез поддержит гипотезу. Дайте ей те же данные с противоположной гипотезой — и синтез поддержит её. Это единственный самый дорогой режим сбоя в консалтинговом контексте, потому что он производит именно тот deliverable, которого хотел клиент, разрушая при этом причину, по которой клиент вас нанял.

Наша проверка: промпты для синтеза никогда не содержат гипотезу. Модель получает корпус и исследовательский вопрос — и больше ничего. Когда нужно проверить гипотезу, мы запускаем её как отдельный adversarial проход: «найди в этом корпусе самые сильные доказательства против следующего утверждения».

4. Синтетические пользователи

Наиболее уверенно продаваемое и наименее защищаемое применение: генерация симулированных участников и проведение с ними интервью вместо реальных людей. Это производит правдоподобные транскрипты быстро, и правдоподобие — именно проблема. Модель, обученная на интернете, расскажет вам, как звучит персона, — что является резюме того, как о таких людях пишут, а не как они ведут себя, когда форма валидации в третий раз отвергает их адрес.

Синтетические пользователи полезны для одного: репетиции discussion guide до того, как вы потратите на него реального участника. Мы используем их для этого. Мы не используем их как доказательства и не представляем их вывод как результаты исследования. Если поставщик предлагает вам исследовательскую программу без реальных участников — он продаёт вам очень дорогой способ подтвердить то, во что вы уже верите.

Наш рабочий протокол

Это реальная последовательность, не идеализированная.

  1. Люди сначала пишут кодовую книгу. До того как какая-либо модель коснётся транскрипта, исследователь читает три-пять интервью и вручную строит кодировочную рамку. Рамка берётся из данных этого исследования, а не из универсальной UX-таксономии. Всё последующее наследует качество этого шага — вот почему это шаг, который мы никогда не сжимаем.

  2. Модель применяет рамку — и только рамку. Фиксированная кодовая книга, никаких новых категорий в середине прогона. Когда модель встречает что-то, что рамка не покрывает, она помечает это как неклассифицированное, а не подгоняет под существующую категорию. Неклассифицированная куча часто оказывается самым интересным результатом всего прогона.

  3. Двойное кодирование 15% выборки. Те же транскрипты независимо кодируются человеком и моделью, и мы измеряем уровень расхождения. Меньше 10% — продолжаем. Больше 20% — кодовая книга неверна, а не модель; возвращаемся к шагу первому. Уровень расхождения — это диагностика рамки, и такое отношение к нему сэкономило нам больше, чем отношение к нему как к показателю качества инструмента.

  4. Черновик синтеза без гипотезы в промпте. Модель получает корпус и исследовательский вопрос. Она выдаёт кластеры и первый нарратив.

  5. Проверка трассируемости. Каждое утверждение в черновике привязывается как минимум к двум участникам с тайм-кодами. Утверждения, которые нельзя отследить, удаляются, а не смягчаются. Утверждение, поддержанное ровно одним участником, обозначается как единственное наблюдение — что является законным и часто ценным результатом, — но не как тема.

  6. Триангуляция с поведенческими данными. Декларируемое поведение и наблюдаемое постоянно расходятся. Мы сверяем выводы интервью с записями сессий и данными тепловых карт — rage clicks, dead clicks, точки выбывания — прежде чем что-либо дойдёт до клиента. Когда участники говорят, что фильтр в порядке, а записи показывают, что они бросают его, — записи побеждают.

  7. Человек пишет рекомендацию. Находки можно собирать с помощью ассистента. Что с ними делать — в этой организации, с этими ограничениями и этой дорожной картой — это суждение, которое выносит тот, кто сидел на интервью.

Что мы не автоматизируем

Короткий список, и мы держимся за него твёрдо.

  • Модерация интервью с уязвимыми или находящимися в стрессе пользователями. Здравоохранение, финансовые трудности, исследования доступности. Роль модератора там частично — долг заботы, и это не делегируется.
  • Рекомендация. См. шаг седьмой.
  • Оценка доступности. Автоматизированные инструменты — включая наш собственный инструмент аудита WCAG — выявляют примерно треть проблем WCAG. Остальное требует ручного тестирования со вспомогательными технологиями. Любой поставщик, утверждающий полное автоматизированное покрытие, описывает сканирование, не аудит.
  • Решение о том, что не исследовать. Скоупинг — место, где создаётся или уничтожается большинство ценности исследования, — это стратегический разговор, а не задача резюмирования.

О турецкоязычных исследованиях

Большинство опубликованных руководств по AI-ассистированным исследованиям написаны и верифицированы на английском, и разрыв в производительности реален и слабо обсуждается.

Точность транскрибирования турецкой речи заметно падает при названиях брендов, отраслевом жаргоне и code-switching между турецким и английским — что совершенно нормально в командах, работающих над продуктами и e-commerce в Стамбуле. Классификация тональности плохо справляется с турецкой косвенностью: вежливая оговорка, предшествующая серьёзной жалобе, часто читается классификатором, обученным преимущественно на английском, как нейтральная или позитивная. Агглютинативная морфология также означает, что частотные подходы к открытым вопросам опросов систематически занижают результаты, потому что одно понятие появляется в дюжине флективных форм, которые токенайзер считает несвязанными.

Практические следствия: поднимите долю точечных проверок транскрибирования выше 10%, которые использовались бы для английского, никогда не полагайтесь на автоматизированную тональность как самостоятельный сигнал в турецких корпусах и верифицируйте любой классификатор на вручную размеченной турецкой выборке до того, как доверять его результатам в объёме.

Как понять, что это работает

Скорость — неверная метрика. Все ускоряются; вопрос в том, выдержит ли результат контакт с реальностью. Три показателя, которые мы реально отслеживаем:

Выживаемость инсайтов. Какая доля выводов, представленных в исследовательском отчёте, через шесть месяцев всё ещё считается валидной? Это неудобно измерять, и оно стоит каждой единицы этого неудобства.

Уровень расхождения между человеком и моделью. Из шага третьего выше. Отслеживайте его во времени. Растущее расхождение обычно означает, что предметная область исследования сдвинулась, а кодовая книга — нет.

Время от последнего интервью до первой проверяемой гипотезы. Это число AI реально двигает. Если синтез занимал восемь дней, а теперь занимает два, — это два дополнительных цикла экспериментов в квартал, что и является реальным бизнес-кейсом. Он просто не тот, который приводит большинство поставщиков.

Часто задаваемые вопросы

Может ли AI полностью заменить пользовательские интервью? Нет. Он может заменить часть работы вокруг интервью — транскрибирование, кодирование, первичный синтез — и помочь лучше их подготовить. Он не может генерировать свидетельства о том, как люди ведут себя, потому что не имеет доступа к их поведению. Симулированные участники рассказывают вам, как такие люди описаны в текстах, — что является другой вещью и нередко вводящей в заблуждение.

Сколько времени реально экономит AI-ассистированное исследование? По нашему опыту, экономия концентрируется почти полностью в синтезе и кодировании, где она существенна. Полевая работа, рекрутинг и выравнивание стейкхолдеров остаются без изменений. Реалистичное ожидание для модерируемого исследования — что постполевая фаза значительно сжимается, а общая длительность проекта падает намного меньше, потому что полевая работа всегда была самой долгой частью.

Бывают ли синтетические пользователи легитимны? Как репетиционный инструмент для discussion guide и способ проверить формулировки опросника — да. Как доказательство в исследовательской находке — нет. Различие важно: одно — вспомогательный инструмент подготовки, другое — сфабрикованные данные с исследовательским ярлыком.

В чём наибольший риск? Уверенный, беглый, неправильный результат — и конкретно та его версия, которая соглашается с тем, во что команда уже верила. Сфабрикованные цитаты выявляются правилами трассируемости. Льстивый синтез труднее, потому что он производит deliverable, которым все довольны. Единственная надёжная защита — отделить гипотезу от промпта синтеза и провести явный adversarial проход.