Skip to content
Новость ACL Anthology июль 2026 г.

RAND Corporation: Muse — система для качественного кодирования с участием ИИ, представленная на ACL 2026

Первая страница статьи RAND Corporation о системе Muse для качественного кодирования с участием ИИ

На 64-й ежегодной конференции Ассоциации компьютерной лингвистики (ACL 2026), проходившей 2–7 июля, исследователи из RAND Corporation опубликовали статью «Development and Benchmarking of a Blended Human-AI Qualitative Research Assistant». В ней описана система Muse — интерактивный ассистент для качественного исследования, позволяющий выявлять темы в текстовых данных и аннотировать наборы данных. Согласованность оценок Muse с оценками людей-кодировщиков достигает Cohen’s κ = 0,7 для чётко сформулированных кодов.

Контекст

Качественное кодирование — трудоёмкий процесс: исследователи нередко тратят недели и месяцы на итеративные циклы чтения, кодирования, обсуждения и уточнения аналитических рамок. Попытки автоматизировать этот процесс традиционно наталкивались на скептицизм: вычислительные методы не воспроизводили нюансы, контекстную чувствительность и интерпретационную глубину человеческого анализа.

Авторы статьи отмечают, что LLM открывают новые возможности для автоматизации отдельных аспектов качественного анализа при сохранении исследовательской строгости. Muse разработана именно для этого: система не заменяет исследователя, а встраивается в его рабочий процесс, поддерживая высокий уровень управляемости на каждом этапе.

Дизайн системы

Проектирование Muse опиралось на экспертные интервью с более чем сотней качественных исследователей и серию опросов. Выборка охватывала специалистов разного уровня: 48% занимали старшие позиции, 28% — средний уровень, 14% — должности ассоциатов. 80% респондентов имели более пяти лет опыта в качественных методах, 58% — более десяти. По специализации ведущую группу составили аналитики и исследователи в области политики (41%), за ними следовали поведенческие и социальные учёные (17%).

На основе этих данных в систему были заложены три ключевых инструмента.

Генерация кодбука. Алгоритм сегментирует корпус документов и поручает LLM выявить от nmin до nmax тем в каждом сегменте. Пользователь задаёт естественно-языковые инструкции, направляющие систему к понятиям, соответствующим конкретной исследовательской задаче. Предварительные кодбуки объединяются через процесс конденсации с использованием второй LLM, формируя единую аналитическую рамку. Затем система генерирует родительские темы: LLM определяет связи между дочерними кодами и группирует их в более высокоуровневые концепции. На завершающем этапе проводится иерархическое уточнение — семантически избыточные коды объединяются, излишне широкие расщепляются.

Применение кода (apply code). Документы разбиваются на фрагменты примерно по 80 слов; LLM определяет, релевантен ли каждый фрагмент заданному коду. Система принимает имя кода, его определение, критерии включения и исключения, а также few-shot примеры.

Распределение кода (distribute code). Модификация предыдущего инструмента: вместо одного кода LLM одновременно получает набор кодов и распределяет фрагменты между ними. Этот режим нередко обеспечивает меньшие задержки по сравнению с пошаговым применением.

Исследователи также предусмотрели механизмы обратной связи: пользователи могут вносить позитивные или негативные оценки аннотаций LLM через элементы интерфейса, и эти примеры затем используются как few-shot контекст в последующих сессиях кодирования.

Оценка и результаты

Для бенчмаркинга авторы сформировали выборку из одиннадцати публично доступных наборов данных с разметкой людей. Наборы охватывают разные форматы (социальные сети, интервью, опросы) и предметные области (расстройства пищевого поведения, политическая напряжённость, устойчивое развитие).

Генерация кодбука тестировалась на наборе arXiv Categories. LLM-метод Muse показал результаты, сопоставимые с оптимизированным базовым методом BERTopic (~0,90–0,91 схожести), при этом сохраняя значительно большую управляемость.

Применение кода оценивалось через показатель межэкспертной согласованности (IRR) — конкретно коэффициент Cohen’s κ. Авторы последовательно подбирали конфигурации гиперпараметров: тип вывода (бинарный да/нет или дискретная шкала 1–10), chain-of-thought prompting, размер батча и количество few-shot примеров.

Оптимальной оказалась комбинация: CoT prompting + дискретная оценка 1–10 + наличие позитивных примеров. На этой конфигурации система достигла κ = 0,545 в ненастроенном режиме. При настройке порога уверенности для каждого кода (code-tuned) показатели заметно возрастали.

Сравнение языковых моделей показало, что GPT-4.1 достиг наилучшего результата в настроенном режиме (κ = 0,593), незначительно опередив o3 (κ = 0,590). Следует отметить, что разброс между моделями относительно невелик: большинство протестированных LLM демонстрировали κ в диапазоне 0,54–0,59 в настроенном режиме. На момент публикации система в производственной среде насчитывала более 600 проектов и более 400 пользователей.

Ключевые выводы для практиков

Авторы обращают внимание на несколько прикладных наблюдений. Бинарный вывод не позволяет исследователям после кодирования скорректировать порог чувствительности, тогда как дискретная шкала 1–10 оставляет эту возможность открытой. Это важно, поскольку разные исследователи устанавливают разные пороги значимости для одного и того же кода — даже при совпадающей формулировке. Системы, не учитывающие эту вариативность, рискуют давать неприемлемые результаты для части пользователей.

Для интеграторов, строящих собственные LLM-системы качественного кодирования, авторы выпустили на GitHub набор данных для оценки: eleven размеченных людьми наборов данных, охватывающих разные форматы и предметные области.

Muse как система демонстрирует практическую достижимость research-grade кодирования с помощью LLM — с оговоркой, что качество существенно зависит от точности формулировки кода и настройки порогов. Хорошо специфицированные коды с явными критериями включения и исключения позволяют достичь κ = 0,7, что находится в зоне «существенного согласия» по принятой в области классификации.