Skip to content
Новость arXiv авг. 2026 г.

ArXiv: когда интервьюер — это бот. Поведение, сбои и доверие в интервью с MLLM

Диаграмма рабочего процесса InterviewBot: настройка, проведение интервью с ботом, рефлексивное интервью с человеком, синтез инсайтов

Аннотация

Полуструктурированные интервью — один из основных методов качественных исследований, однако они по-прежнему требуют значительных временны́х и трудовых ресурсов. Авторы сообщают об эмпирическом исследовании того, что происходит, когда в роли интервьюера выступает готовая к использованию мультимодальная языковая модель реального времени (MLLM). Была создана система InterviewBot — голосовой инструмент для проведения интервью, обёртывающий MLLM реального времени поверх авторского гайда, — которая применялась не как новая архитектура, а как исследовательский инструмент для наблюдения за поведением MLLM в роли интервьюера по умолчанию.

В пилотном исследовании (N=15) участники провели интервью под руководством бота, а затем рефлексивную сессию с исследователем-человеком. Исследование вносит три вклада: (i) пословный анализ поведения MLLM-интервьюера (N=428 реплик), показывающий, что бот склонен к обильному подтверждению, но редко задаёт уточняющие вопросы (углубляющие зонды составляют лишь 4,9% всех реплик), а 28,7% реплик с вопросами содержат несколько вопросов сразу, несмотря на явную инструкцию задавать по одному; (ii) индуктивный каталог четырёх типов сбоев при сборе данных (потеря информации, преждевременное завершение, задержка, перебивание); (iii) три социальные динамики, выявленные в ходе рефлексий участников: калибровка самораскрытия, институциональная легитимность и разговорная «заземлённость».

1. Введение

Качественные интервью — один из самых распространённых методов сбора данных, сочетающий структурированный подход с гибкостью открытых неструктурированных исследований. Однако они трудоёмки и нередко зависят от характеристик интервьюера. В то время как ранние автоматизированные системы опирались на жёсткие шаблоны, последние исследования LLM-систем показали, что AI способен генерировать вопросы и уточняющие реплики, значительно более похожие на человеческие, лингвистически разнообразные и контекстуально релевантные.

На практике исследователи нуждаются в инструментах, сохраняющих контроль человека, обеспечивающих прозрачность и органично встраивающихся в существующие рабочие процессы — а не в системах, нацеленных на полную замену исследователей-людей. Эти требования обусловлены тем, что интервью — это социальный акт, формируемый доверием, властными отношениями, уважением и ответственностью, а не просто процедура извлечения информации. К ним добавляются специфические проблемы, связанные с использованием AI: галлюцинации, этические риски и потенциальное влияние на качество интервью.

Чтобы понять, как автоматизированные интервьюеры ведут себя на практике и каков опыт участников, авторы представляют InterviewBot — голосовую систему реального времени, проводящую полуструктурированные интервью по авторскому гайду. В пилотном исследовании с N=15 участниками изучались пословное поведение системы и то, как пользователи воспринимают интервью под руководством бота.

2. Предпосылки: AI в поддержке интервью

До появления генеративных моделей вычислительная поддержка интервью в основном опиралась на достижения в области NLP: Transformers, BERT, BART и T5, которые позволили реализовать автоматическую генерацию вопросов, правилоориентированный дизайн вопросов и скриптованные диалоговые системы. Параллельно HCI-исследования изучали воплощённые агенты, виртуальных интервьюеров, опросы с поддержкой чат-ботов и разговорные зонды.

Более поздние AI-системы с поддержкой LLM ввели генерацию уточняющих вопросов в реальном времени и зондирование на основе теорий, демонстрируя потенциал для повышения эффективности и последовательности. Вместе с тем они поставили вопросы о контроле интервьюера, раппорте и этической ответственности. Последние достижения в LLM расширили роль AI в качественных исследованиях через техники структурированных промптов, chain-of-thought промптов, retrieval-augmented generation и RLHF. Anthropic Interviewer, например, продемонстрировал возможность многоязычных, масштабных AI-опросов с преобразованием открытых ответов в более структурированные и поддающиеся анализу форматы.

3. InterviewBot как исследовательский инструмент

InterviewBot — система на основе MLLM, проводящая полуструктурированные интервью, балансируя между предопределённым гайдом и динамически генерируемыми уточняющими вопросами. Она поддерживает естественное голосовое взаимодействие для участников, предоставляя исследователям текстовый интерфейс для настройки, управление сессией в реальном времени и живую транскрипцию.

В данной работе «бот» функционирует как голосовой программный агент без физического или антропоморфного воплощения — специально, чтобы минимизировать непреднамеренное социальное давление и эффект атрибуции. Это позволило изолировать реакцию участников на сам процесс AI-опроса, а не на симулируемую личность гуманоидного агента.

3.1. Интерфейс и конфигурация

InterviewBot предоставляет интерфейс для исследователей: создание персон и гайдов, задание временны́х ограничений сессии, выбор языка и роли, а также запуск, остановка и экспорт сессии с живой транскрипцией. Структурное свойство данного дизайна, общее для большинства развёрнутых обёрток для интервью: единственный способ исследователя формировать ход интервью — это гайд и системный промпт, созданные заранее. Как только сессия начинается, механизма для вмешательства, перенаправления или коррекции не существует.

3.2. Как работает InterviewBot

InterviewBot проводит полуструктурированные интервью, используя авторский гайд как направляющий каркас и динамически генерируя вопросы и уточнения из текущего диалога. В типичной сессии бот инициирует интервью следующим пунктом гайда, участник отвечает в естественной форме. Поскольку система работает в режиме диалога реального времени, InterviewBot настроен на barge-in: когда участник начинает говорить, бот должен прекращать свою речь. На практике, однако, детектирование голосовой активности базового API не всегда надёжно различало реплики участников и паузы, и некоторые участники воспринимали бота как перебивающего.

Затем InterviewBot использует накопленный контекст диалога для генерации уточняющих вопросов, опирающихся на только что сказанное участником. Для обеспечения прогресса в сессии с ограниченным временем бот также отслеживает сигналы убывающей информационной отдачи — например, когда участник начинает повторять схожие тезисы, — и в таких случаях переходит к следующему вопросу гайда или переключается на другой угол зрения, сохраняя общую структуру, заданную исследователем.

3.3. Конфигурация InterviewBot в исследовании

InterviewBot работал на базе OpenAI Realtime API (gpt-4o-realtime-preview-2025-06-03). Бот получил инструкцию: «Вы — AI-интервьюер, проводящий исследование об опыте людей с использованием AI-инструментов (например, ChatGPT). Следуйте структуре интервью ниже и адаптируйте уточняющие вопросы органично. Используйте чёткий и неформальный язык, избегая технических терминов, если только участник сам их не употребляет. Задавайте по одному вопросу за раз и опирайтесь на ответы участника.» Гайд структурировал интервью по трём темам: (i) текущее использование AI, (ii) AI в учёбе, (iii) AI и рынок труда, с завершающим вопросом для рефлексии. Авторы намеренно ограничились одним, минимально инженеризированным системным промптом, чтобы зафиксировать поведение MLLM по умолчанию. Именно этот выбор оказался показательным: несмотря на явную инструкцию «задавать по одному вопросу», 28,7% реплик с вопросами содержали несколько вопросов одновременно, — что свидетельствует о том, что один промпт недостаточен для соблюдения протокола интервью.

4. Пилотное исследование

В исследовании участвовали 15 человек (средний возраст 21,53 года, SD = 8,24), набранных через профессиональные сети исследователей и методом снежного кома. Все участники проходили обучение в исследовательском университете США; один был аспирантом, остальные — студентами бакалавриата. По завершении исследования каждый получил подарочную карту номиналом $10. Все сессии проводились дистанционно через Zoom. Перед началом исследования от всех участников было получено информированное согласие. Для организации взаимодействия с ботом исследователь демонстрировал свой экран с включённым системным звуком, позволяя участникам слышать InterviewBot напрямую.

Каждая сессия состояла из трёх фаз: (1) краткое введение от исследователя-человека (около 3–5 минут); (2) основное интервью под руководством бота по полуструктурированному гайду об опыте участников с AI-инструментами (около 15–30 минут); (3) рефлексивная сессия с исследователем-человеком об опыте взаимодействия с InterviewBot (около 20 минут).

Участники были рекрутированы с описанием сессии как исследовательского интервью об их опыте с AI-инструментами, которое проводит AI-интервьюер, после чего следует беседа с исследователем-человеком. Введение исследователя объясняло трёхфазную структуру, сообщало, что основное интервью ведёт бот, и подтверждало согласие на запись. Никаких упоминаний о найме, оценке или аттестации не было; участники были предупреждены, что правильных ответов не существует.

5. Анализ взаимодействия

Чтобы выйти за рамки иллюстративных фрагментов и оценить, как InterviewBot фактически проводил полуструктурированные интервью, авторы закодировали каждую реплику бота по всем 15 интервью (N=428 реплик). Анализ охватывал только фазу под руководством бота.