Skip to content
Новость arXiv авг. 2026 г.

arXiv: Когда интервьюер — бот: поведение, сбои и доверие в интервью под управлением MLLM

Логотип arXiv — препринт исследования о боте-интервьюере на основе MLLM

Когда интервьюер — бот: поведение, сбои и доверие в интервью под управлением MLLM

Хэ Чжан, Камбинаки Чукуума, ЧанМин Ким, Джон М. Кэрролл — Университет Пенсильвания Стейт, 2026.

Опубликовано в arXiv (2608.10412). Принято к публикации в сборнике HCOMP 2026 (ACM Conference on Human-AI Complementarity and Alignment, 27–30 сентября 2026, Александрия, штат Вирджиния, США).

Аннотация

Полуструктурированные интервью — один из базовых методов качественного исследования, однако они остаются трудоёмкими. В этой работе авторы сообщают об эмпирическом исследовании того, что происходит, когда интервьюером является готовая к использованию мультимодальная LLM (MLLM) в режиме реального времени. Авторы создали InterviewBot — голосовую систему для проведения интервью, которая оборачивает real-time MLLM вокруг подготовленного исследователем плана, и развернули её не как новую архитектуру, а как исследовательский инструмент для наблюдения за поведением MLLM-интервьюера по умолчанию. В практическом исследовании (N=15) участники прошли интервью под управлением бота, а затем — сессию рефлексии под управлением человека.

Авторы вносят три вклада: (i) поуровневый поведенческий анализ MLLM-интервьюера (N=428 реплик), который показывает, что бот часто даёт подтверждения, но редко задаёт уточняющие зонды (deepening probes составляют 4,9% всех реплик), а 28,7% содержащих вопросы реплик включают несколько вопросов одновременно — несмотря на явную инструкцию «один вопрос за раз»; (ii) каталог четырёх типов сбоев при сборе данных (потеря информации, преждевременное завершение, задержка и прерывание), выявленных в развёрнутой, а не смоделированной системе; (iii) три социальные динамики по данным рефлексий: калибровка раскрытия (сниженное социальное давление совпадало с менее глубокой разработкой ответов), институциональная легитимность (доверие определялось воспринимаемыми ставками и тем, что делегирование AI сигнализировало об организаторе, а не о разговорной компетентности бота) и разговорное заземление (то, что участники воспринимали как «слушание», — это содержательная перефразировка, а не общие социальные реакции). Статья завершается импликациями для дизайна в области контроля глубины, прозрачной передачи управления и нешаблонных механизмов слушания в автоматизации интервью, ориентированной на человека.

Ключевые слова: автоматизированное интервью, AI-опосредованный сбор данных, сотрудничество человека и AI, полуструктурированные интервью, MLLM-интервьюирование, пользовательский опыт.

1. Введение

Качественные интервью — один из наиболее распространённых методов сбора данных, сочетающий структурированный подход с гибкостью открытой неструктурированной исследования (Roulston, 2010). Вместе с тем они требуют значительных временных и трудовых затрат и нередко определяются факторами, связанными с интервьюером (Flick, 2006; Marshall and Rossman, 1995; Adams, 2015). Если ранние автоматизированные системы опирались на жёсткие шаблоны (Hu et al., 2024; Inoue et al., 2020; Hoque et al., 2013), то недавние исследования систем на основе больших языковых моделей (LLM) показали, что AI может генерировать вопросы интервью и уточняющие реплики, значительно более похожие на человеческие, лингвистически разнообразные и контекстуально релевантные (Zhang et al., 2025; Leong et al., 2024; Spangher et al., 2025; Liu et al., 2025). На практике, однако, исследователям нужны инструменты, сохраняющие контроль человека, обеспечивающие прозрачность и органично встраивающиеся в существующие рабочие процессы, а не системы, стремящиеся полностью заменить интервьюера-человека. Это требование определяется тем, что интервью является социальным взаимодействием, формируемым доверием, властными отношениями, уважением и ответственностью, а не простой процедурой извлечения информации (Kvale, 2006; Karnieli-Miller et al., 2009), а также рядом рисков применения AI, включая галлюцинации, этические риски и возможное влияние на качество интервью (Liu et al., 2023; Yadav et al., 2023; Biswas et al., 2024).

Чтобы понять, как ведут себя автоматизированные интервьюеры на практике и как участники переживают интервью с ботом, авторы представляют InterviewBot — голосовую систему реального времени для проведения полуструктурированных интервью по составленному исследователем плану. В практическом исследовании с N=15 участниками авторы изучили поведение системы на уровне реплик и опыт пользователей в ходе интервью под управлением бота.

Вклад и позиционирование

Авторы намеренно уточняют, на что претендует и на что не претендует статья. InterviewBot не является техническим вкладом: это намеренно тонкая обёртка над коммерческой real-time MLLM, и ценность системы здесь — как инструмента, позволяющего наблюдать за тем, что исследователь получит от такой модели «из коробки». Вклад авторов двоякий — эмпирический. Поведенчески авторы характеризуют профиль диалоговых актов и режимы отказа развёрнутого (а не Wizard-of-Oz) MLLM-интервьюера на уровне отдельных реплик. Социально — авторы характеризуют, как интервью с ботом перестраивает у участников ощущение обязательства, доверия и смысла интервью — динамику, которую, в отличие от чистой разговорной беглости, следующий релиз модели вряд ли устранит. Конкретные пропорции, приведённые в статье, авторы рассматривают как снимок одной версии модели, а не стабильное свойство MLLM в целом. Раздел 5 устанавливает, что делал бот; раздел 6, который авторы считают основным вкладом статьи, устанавливает, что значило быть проинтервьюированным им.

2. Контекст: AI-поддержка интервью

До появления генеративных моделей, таких как LLM, вычислительная поддержка интервью преимущественно опиралась на достижения в области NLP — в частности, Transformers, BERT, BART и T5, которые позволили вести ранние работы по автоматической генерации вопросов, проектированию вопросов на основе правил и скриптованным диалоговым системам (Jain, 2021; Lewis et al., 2020; Raffel et al., 2020; Heilman and Smith, 2010; Debnath and Spoletini, 2020; SB et al., 2020; Hu et al., 2024; McTear, 2002). Параллельно исследования в области HCI изучали воплощённых агентов, виртуальных интервьюеров, опросы с помощью чат-ботов и разговорные зонды как способы структурирования и опосредования практики интервью (Hoque et al., 2013; Cha et al., 2021; Clark et al., 2019; Young et al., 2024; Zhou et al., 2019; Xiao et al., 2020a, b; Han et al., 2021). Более поздние системы на основе AI ввели генерацию уточняющих вопросов в реальном времени и теоретически обоснованное зондирование, демонстрируя потенциал повышения эффективности и согласованности — при этом поднимая вопросы о контроле со стороны интервьюера, раппорте и этической ответственности (Inoue et al., 2020; Biswas et al., 2024; Liu et al., 2023; Yadav et al., 2023). Тем не менее на всех этих этапах существующие системы в целом испытывали затруднения с динамическим и чувствительным к контексту характером реальных интервью, а ограничения в пользовательском опыте остаются очевидными даже в широко распространённых разговорных системах — например, телефонных платформах обслуживания клиентов (Qin et al., 2025; Adam et al., 2021).

Последние достижения в области LLM расширили роль AI в качественных исследованиях с помощью таких техник, как structured prompting, chain-of-thought prompting, retrieval-augmented generation и RLHF, которые улучшают контекстуальную заземлённость и надёжность ответов (Bai et al., 2022; Liu et al., 2024; Zhang et al., 2025; Amarnath and Nagarajan, 2024; Gao et al., 2024). Исследователи начали изучать LLM в контекстах, напоминающих интервью, где модели могут генерировать уточняющие вопросы, — однако важные вопросы о потоке интервью, авторитете интервьюера, доверии, тайминге и ответственности в гибридном интервью человека и AI остаются открытыми (Liu et al., 2025; Leong et al., 2024; Spangher et al., 2025). Эта область исследований начала консолидироваться в практические рекомендации для исследователей, применяющих поддержку LLM в качественном рабочем процессе (Zhang et al., 2026a). Она также выявила риски, исходящие от интервьюеров, а не от участников: в Wizard-of-Oz-исследовании с LLM в контуре, где со-интервьюер передавал уточняющие вопросы, сгенерированные AI, в ходе живых сессий, интервьюеры высказывали опасения относительно вредоносных или дискриминационных формулировок, рассеянности внимания и пропущенных невербальных сигналов, подрывающих ощущение уважения у интервьюируемых, неравного участия, ответственности при причинении вреда и конфиденциальности, когда AI-система слушает и транскрибирует (Zhang et al., 2026b). Данное исследование подходит к той же ситуации с другой стороны: как участники переживают интервью с такой системой, развёрнутой без человека-посредника.

Важно отметить: существующая литература в основном оценивает результаты автоматизированного интервью — администрируемые через чат-бот опросы получают более информативные ответы на открытые вопросы, чем стандартные веб-формы (Xiao et al., 2020b), а современные интервьюеры на основе LLM получают ответы, сопоставимые с ответами при интервью с человеком, но при значительно меньших затратах (Chopra and Haaland, 2023). AI-поддержка интервью также приобрела видимость в масштабе: Anthropic Interviewer, например, продемонстрировал возможность многоязычного масштабного AI-опосредованного интервьюирования с преобразованием ответов на открытые вопросы в более структурированные и поддающиеся анализу данные (Huang et al., 2026). Менее изученным остаётся поведение интервьюера — диалоговые акты, посредством которых интервью реально осуществляется, — и социальный смысл, который участники придают тому, что их интервьюируют именно таким образом. Именно этим двум пробелам и посвящена статья.

3. InterviewBot как исследовательский инструмент

InterviewBot — система на основе MLLM, проводящая полуструктурированные интервью посредством баланса между предопределённым планом и динамически генерируемыми, озвучиваемыми уточняющими вопросами. Система поддерживает естественное голосовое взаимодействие для участников, предоставляя исследователям текстовый интерфейс конфигурирования, управление сессией в реальном времени и live-транскрипцию.

В данной работе «бот» действует исключительно как разговорный голосовой программный агент. Авторы намеренно отказались от физических или антропоморфных аватаров, чтобы минимизировать непреднамеренное социальное давление и эффекты приписывания. Отсутствие воплощения обеспечивает изоляцию реакции участников на процесс AI-опосредованного интервью как таковой, а не на смоделированную личность человекоподобного агента.

3.1. Интерфейс и конфигурация

InterviewBot предоставляет интерфейс для исследователей для создания персонажей интервьюера и планов интервью, установки временных ограничений сессии, выбора языка и роли, а также запуска, остановки и экспорта сессии с live-транскрипцией. Авторы описывают интерфейс кратко, поскольку он не является объектом данного исследования. Для анализа важно структурное свойство данного дизайна, общее для большинства развёрнутых оберток интервьюирования: единственный способ исследователя формировать интервью — план и системный промпт, написанные заранее. После начала сессии механизма вмешательства, перенаправления или исправления не существует. Раздел 5 показывает, чем это ограничение оборачивается.

3.2. Как работает InterviewBot: интервьюирование, управляемое планом, в реальном времени

InterviewBot проводит полуструктурированные интервью, используя написанный исследователем план как направляющий каркас и одновременно динамически генерируя вопросы и уточнения по ходу разговора. В типичной сессии InterviewBot начинает интервью со следующего пункта плана, и участник отвечает в естественной манере. Поскольку система развёрнута в режиме разговора реального времени, InterviewBot настроен на barge-in: когда участник начинает говорить, предполагается, что бот должен прекратить свою речь, позволяя участнику прерываться для уточнения, исправления или дополнения без явных команд управления очерёдностью. На практике, однако, детектирование голосовой активности используемого real-time API не всегда надёжно различало реплики участников и паузы, и ряд участников воспринял бота как перебивающего (раздел 6.3) — это пример разрыва между задуманным свойством дизайна и его реализованным поведением, к которому авторы возвращаются в обсуждении. Затем InterviewBot использует накопленный контекст разговора для генерации уточняющих вопросов, опирающихся на сказанное участником, стремясь поддерживать связность и одновременно адаптировать траекторию интервью. Для обеспечения продвижения в ограниченной по времени сессии InterviewBot также отслеживает сигналы снижения информационной отдачи — например, когда участник начинает повторять схожие тезисы — и в таких случаях переходит к следующему вопросу плана или меняет угол для привлечения дополнительных точек зрения, сохраняя при этом общую структуру, заданную исследователем.

3.3. Конфигурация InterviewBot в данном исследовании

InterviewBot работал на основе OpenAI Realtime API (gpt-4o-realtime-preview-2025-06-03), обеспечивающего разговорное интервьюирование в реальном времени с live-транскрипцией и экспортом транскрипта. Боту была задана следующая инструкция: «Вы — AI-интервьюер, проводящий исследование об опыте людей с AI-инструментами (такими как ChatGPT). Следуйте приведённой ниже структуре интервью и адаптируйте уточняющие вопросы естественным образом. Используйте чёткий и разговорный язык, избегая технических терминов, если сам участник их не использует. Задавайте один вопрос за раз и опирайтесь на ответы участника». План охватывал (i) текущее использование AI, (ii) AI в учёбе и (iii) AI и работу, завершаясь рефлексивным вопросом. Авторы намеренно опирались на единственный, минимально доработанный системный промпт, а не на обширную инженерию промптов, чтобы охарактеризовать поведение по умолчанию, которое исследователь получит от готовой real-time MLLM. Этот выбор сам по себе показателен: несмотря на явную инструкцию «задавать один вопрос за раз», 28,7% содержащих вопросы реплик бота оказались многочастными (раздел 5) — это говорит о том, что инструкции на уровне промпта сами по себе не достаточно обеспечивают соблюдение протокола интервью в оберточном развёртывании.

4. Практическое исследование

Авторы провели практическое исследование с 15 участниками (средний возраст 21,53 года, стандартное отклонение 8,24). Участники были рекрутированы через профессиональные сети исследователей и снежный ком. Все участники обучались по образовательным программам в исследовательском университете США: один — аспирант, остальные — студенты бакалавриата. По завершении исследования каждый участник получил подарочную карту на $10 в знак признательности. Все сессии проводились удалённо через Zoom. Перед началом исследования все участники дали информированное согласие. Для обеспечения взаимодействия с ботом исследователь транслировал экран с включённым компьютерным аудио, позволяя участникам слышать InterviewBot непосредственно, сохраняя визуальный фокус на общем интерфейсе, а не на лице человека. Каждая сессия состояла из трёх этапов: (1) краткое введение исследователя-человека (≈ 3–5 минут), (2) основное интервью под управлением бота, построенное по полуструктурированному плану об опыте участников с AI-инструментами (≈ 15–30 минут), и (3) рефлексивная сессия под управлением исследователя, посвящённая опыту взаимодействия с InterviewBot (≈ 20 минут). Исследование проводилось для понимания того, как участники переживают полуструктурированное интервью под управлением бота и какие требования возникают при проектировании автоматизации интервью как рабочего процесса сотрудничества человека и AI. Исследование было одобрено институциональным советом по этике IRB учреждения первого автора.

Фреймирование и настройка участников

Участников рекрутировали с описанием сессии как исследовательского интервью об их опыте с AI-инструментами, которое проводит AI-интервьюер, после чего следует разговор с исследователем-человеком об этом опыте. Исследователь объяснил трёхэтапную структуру, сообщил, что бот будет вести основное интервью, и подтвердил согласие на запись. Ни найм, ни оценка, ни аттестация не упоминались; участникам сообщили, что правильных ответов не существует.

Протокол рефлексивного интервью

Рефлексивная сессия проводилась тем же исследователем, который представил исследование, и использовала полуструктурированное руководство, охватывающее четыре области: (i) общее впечатление от сессии и всё, что показалось заметным или неожиданным; (ii) отличались ли ответы участника от того, что они сказали бы интервьюеру-человеку, и почему; (iii) моменты, когда взаимодействие давало сбой или казалось неловким, и реакция участника; (iv) где, если вообще, автоматизированное интервьюирование было бы уместным или неуместным. Уточняющие вопросы задавались без скрипта. Руководство не называло никакой области применения и спрашивало об уместности в общих чертах, не упоминая найм, рекрутинг, здравоохранение или иные конкретные контексты.

Поскольку ни введение, ни руководство не поднимали эту тему, сценарии с собеседованием при найме, которые обсуждали несколько участников (разделы 6.2 и 6.4), были предложены ими добровольно, а не в ответ на подсказку. Авторы расценивают это как свидетельство того, что «AI-интервьюер» в настоящее время интерпретируется по умолчанию через схему найма — само по себе это находка о том, как подобные системы, вероятно, будут восприниматься, — однако не исключают, что фреймирование исследовательского интервью оставило участникам свободу привносить сценарии с более высокими ставками, которых они лично не переживали. Их высказывания о найме следует поэтому читать как проспективные суждения об автоматизированном интервьюировании в целом, а не как отчёты о самой сессии.

5. Анализ взаимодействия

Чтобы выйти за рамки иллюстративных фрагментов и оценить, как InterviewBot фактически проводил полуструктурированные интервью, авторы закодировали каждую реплику бота по всем 15 интервью под управлением бота (N=428 реплик). Этот анализ охватывает только этап под управлением бота. Последующая сессия под управлением исследователя была рефлексивным интервью об опыте участников с ботом, а не повторным сбором данных по той же теме, и не рассматривается как условие сравнения.


Данный перевод охватывает опубликованные разделы 1–5 оригинальной статьи (введение, контекст, описание системы, дизайн исследования и начало анализа взаимодействия). Полный текст, включая раздел 6 (социальные динамики) и выводы для дизайна, доступен по ссылке на оригинал.