Skip to content
Новость Theory and Society июль 2026 г.

Theory and Society: LLM-расширенная вычислительная обоснованная теория и триадная динамика взаимодействия человека, ИИ и общества

Диаграмма пятифазного процесса LLM-расширенной вычислительной обоснованной теории

Статья опубликована 20 июля 2026 года в журнале Theory and Society (Springer) в открытом доступе. Авторы предлагают теоретический вклад — триадную модель взаимодействия человека, ИИ и общества — и методологическую инновацию для её поддержки: пятифазный фреймворк LLM-расширенной вычислительной обоснованной теории (LLM-enhanced CGT).

Аннотация

Авторы утверждают, что развитие ИИ представляет собой не однонаправленный конвейер от проектирования к использованию, а рекурсивную систему обратных связей между тремя взаимозависимыми сферами: practitioner-AI (проектные решения), user-AI (практики применения) и society-AI (оценка и управление). Для разработки этой теории предложен фреймворк LLM-enhanced CGT, в котором LLM выступают аналитическими инструментами в рамках человеко-ориентированного рабочего процесса. Фреймворк включает пять фаз: конструирование данных, LLM-ассистированная генерация тем, совместное уточнение тем человеком и LLM, вычислительное подтверждение и генерация теории.

Фреймворк операционализирован через кейс-стади публичного дискурса о ChatGPT в Twitter (теперь X): проанализировано 584 160 твитов на английском языке за первые три месяца после выхода модели. Эмпирический анализ выявил 10 тем и 54 подтопика, которые сгруппированы в три паттерна взаимодействия, соответствующих триадному фреймворку.

Теоретический вклад включает три аспекта: переосмысление взаимодействия человека с ИИ как неустранимо триадного, а не диадического; спецификацию механизмов рекурсивных обратных связей (проектирование активирует использование, использование генерирует оценку, оценка влияет на проектирование); выявление временных асимметрий (адаптация пользователей занимает часы, корпоративная реакция — дни, управление — годы) как структурного признака AI-социотехнических систем. В методологическом плане исследование демонстрирует, как LLM могут поддерживать оценку теоретического насыщения в масштабных датасетах при сохранении интерпретативной строгости.

Введение

Стремительное развитие больших языковых моделей (LLM), таких как ChatGPT, Mistral и DeepSeek, сигнализирует о сдвиге в методах работы исследователей с генеративным ИИ. LLM продемонстрировали высокую производительность в задачах генерации текста, аннотирования, сложного рассуждения и анализа тональности. Эти возможности позиционируют LLM как потенциально значимые инструменты для исследований в социальных и гуманитарных науках. В таких областях, как здравоохранение, образование, медиастудии и политическая наука, LLM всё активнее применяются для автоматизации качественного кодирования, аннотирования политического дискурса и анализа нарративных структур.

Эти тенденции отражают более широкий вычислительный поворот в социальных науках. В условиях цифрового общества, когда объёмы и скорость данных растут, исследователи сталкиваются с устойчивой дилеммой: как анализировать масштабные корпусы без потери интерпретативной глубины и как использовать вычислительные инструменты без утраты чувствительности к смыслу. Эти противоречия особенно остро проявляются при применении обоснованной теории (grounded theory, GT) к крупным цифровым данным.

Обзор литературы

Обоснованная теория, вычислительный сдвиг и устойчивые проблемы

Обоснованная теория (GT), разработанная Глейзером и Страуссом (1967), остаётся фундаментальным методологическим подходом в качественных исследованиях. Через итеративное кодирование, постоянное сравнение, теоретическую выборку и стремление к насыщению GT позволяет формировать концептуальные категории из эмпирических данных. Однако метод создавался в эпоху небольших и ручных датасетов. В сегодняшних условиях исследователи работают с миллионами постов в социальных сетях, и традиционный рабочий процесс GT сталкивается с двумя критическими вызовами.

Во-первых, трудоёмкость ручного кодирования делает практически невозможным анализ больших датасетов без ущерба для глубины, порождая опасения по поводу предвзятости выборки и неполноты анализа. Во-вторых, ключевой принцип GT — насыщение — сложно операционализировать в контексте «больших данных», когда датасет сам по себе превышает возможности человеческой обработки. В результате исследователи снова и снова сталкиваются с противоречием между глубиной и охватом.

В ответ учёные предложили вычислительную обоснованную теорию (computational grounded theory, CGT), которая интегрирует вычислительное обнаружение паттернов с человеческой интерпретацией. CGT использует методы тематического моделирования для выявления латентных структур в крупных датасетах. При этом CGT вводит новые ограничения: тематические модели, такие как LDA и BERTopic, нередко порождают деконтекстуализированные кластеры ключевых слов, которым не хватает семантической нюансировки и которые с трудом поддаются интерпретации, упуская иронию, культурные референции или прагматические значения.

Помимо этого, выбор параметров, решения в области предобработки и маркировка тем остаются глубоко субъективными. Что особенно важно, CGT нередко отодвигает на второй план принцип теоретического насыщения данных, ослабляя претензии на объяснительную строгость.

LLM как методологическое расширение GT и CGT

LLM потенциально устраняют ограничения традиционной GT, в которой ручное кодирование трудоёмко, требует значительного времени и когнитивных ресурсов. Исследователи вынуждены итеративно просматривать данные, присваивать коды и разрабатывать концепции, сохраняя при этом согласованность — задачи, уязвимые к усталости и когнитивным искажениям. Хотя вычислительные подходы, такие как CGT, обеспечивают крупномасштабную обработку, методы типа LDA нередко дают деконтекстуализированные кластеры, лишённые семантической нюансировки. LLM помогают преодолеть этот разрыв, сочетая вычислительную масштабируемость с лучшей чувствительностью к контекстуальному смыслу.

Вместе с тем некритичная опора на автоматизацию способна ослабить интерпретативное ядро качественных исследований. LLM могут упускать культурные нюансы, сглаживать двусмысленность или упрощать сложные нарративы. Эти ограничения параллельны устойчивым вызовам в GT и CGT: даже в вычислительных подходах суждение исследователя остаётся центральным для выбора предобработки, спецификации модели и интерпретации результатов.

Для решения этих проблем авторы предлагают фреймворк LLM-enhanced CGT, который позиционирует LLM как совместных аналитических партнёров, а не замену экспертной интерпретации. В предложенном рабочем процессе LLM генерируют тематические кандидаты для последовательных выборок; итерация продолжается до стабилизации результатов и минимального появления новых кодов, что указывает на практическое насыщение. Затем исследователи независимо аннотируют ту же выборку, получая параллельный набор кодов для сравнения с результатами модели и консолидации предварительных паттернов.

Авторы сохраняют человеческих коддеров в своём рабочем процессе по двум причинам, которые LLM в настоящее время не могут полностью воспроизвести. Первая — интерпретативный авторитет и ответственность: в качественных исследованиях кодирование — это не просто техническое сопоставление паттернов, а интерпретативный акт, основанный на теоретической чувствительности, предметной экспертизе и рефлексивном взаимодействии с данными. LLM лишены способности к подлинной рефлексивности. Вторая — способность к построению теории: GT нацелена не только на описание, но и на порождение теоретических концепций через постоянное сравнение и осевое кодирование. Этот процесс требует абдуктивного мышления, аналогического рассуждения и творческого синтеза. Концептуальный скачок от кодов к теории остаётся фундаментально человеческим актом.

Фреймворк LLM-расширенной вычислительной обоснованной теории

Фреймворк LLM-enhanced CGT спроектирован для поддержки оценки насыщения кодов и смыслов, а также для связи выборочно управляемой генерации меток с триангуляцией всего корпуса. Он включает пять последовательных фаз: конструирование данных, генерация тем, уточнение тем, подтверждение тем и генерация теории.

Фаза 1: конструирование данных. Исследователи собирают данные с учётом исследовательского вопроса. В кейс-стади была применена API X Academic для сбора 584 160 твитов о ChatGPT за первые три месяца после запуска (ноябрь 2022 — январь 2023).

Фаза 2: LLM-ассистированная генерация тем. LLM получает выборку текстов и генерирует предварительные темы. Ключевой момент: выборки обрабатываются итеративно до достижения стабилизации — нового проявления когда-либо достигается лишь минимальный прирост новых кодов. Это обеспечивает практическую форму кодового или смыслового насыщения.

Фаза 3: совместное уточнение тем. Человеческие коддеры независимо аннотируют ту же выборку и сравнивают свои коды с результатами LLM. Разногласия обсуждаются, категории консолидируются, а концептуальная согласованность повышается через итеративные циклы.

Фаза 4: вычислительное подтверждение. Предварительные темы триангулируются на уровне всего корпуса с использованием количественных методов (BERTopic и корреляционный анализ тем). Это позволяет оценить статистическую согласованность тем и устойчивость паттернов.

Фаза 5: генерация теории. На основе уточнённых и подтверждённых тем исследователи строят теоретические концепции. В данной работе это привело к разработке триадного фреймворка взаимодействия.

Фреймворк намеренно является модельно-агностичным: может использоваться любая LLM с достаточными возможностями для тематической экстракции, однако конкретные детали реализации (дизайн промптов, настройки параметров, версия модели) должны документироваться прозрачно.

Кейс-стади: публичный дискурс о ChatGPT

Для операционализации LLM-enhanced CGT было проведено кейс-стади публичного дискурса вокруг ChatGPT в Twitter/X: проанализировано 584 160 твитов на английском языке, опубликованных в первые три месяца после релиза ChatGPT (с 30 ноября 2022 по 28 февраля 2023 года). Датасет открывает окно в процесс осмысления публикой возникновения генеративного ИИ.

Через итеративный анализ выборки из 1700 твитов для насыщения и корпусную триангуляцию по всему датасету было выявлено 10 тем и 54 подтопика. Они организованы в три группы, ориентированные на стейкхолдеров: practitioner-AI (проектирование), user-AI (применение) и society-AI (оценка).

Авторы подчёркивают, что в кейс-стади применялась конкретная LLM (ChatGPT/GPT-3.5-turbo) в рамках более широкого фреймворка LLM-enhanced CGT. Сам фреймворк не ограничен ChatGPT: на его место можно подставить другие LLM (Claude, Llama, Mistral, GPT-4), хотя для оценки межмодельной согласованности необходимы репликационные исследования.

Триадный фреймворк взаимодействия

Эмпирические находки привели к формулировке триадного фреймворка взаимодействия человека, ИИ и общества. В его основе лежит переосмысление развития ИИ: не как однонаправленного конвейера от разработчиков к пользователям, а как рекурсивной системы обратных связей между тремя взаимозависимыми сферами.

Сфера practitioner-AI охватывает дизайн-решения разработчиков и практиков. Решения в этой сфере формируют возможности систем ИИ и ограничения их применения. Сфера user-AI охватывает практики применения конечными пользователями. Она порождает эмпирический опыт, отзывы и адаптационные паттерны. Сфера society-AI охватывает оценку ИИ со стороны общества и управление им, включая регуляторные ответы, медиапокрытие и нормативные дискуссии.

Ключевое теоретическое утверждение состоит в том, что эти три сферы связаны рекурсивными механизмами: проектирование активирует использование, использование генерирует оценку, а оценка поступает обратно в проектирование. Авторы также выявляют временны́е асимметрии, не учтённые в предшествующих моделях: пользователи адаптируются к новым возможностям ИИ в течение часов, корпоративный ответ занимает дни, тогда как механизмы управления и нормотворчества разворачиваются в течение лет. Эта асимметрия создаёт структурные пробелы в управлении.

Теоретические и методологические импликации

Авторы выдвигают три аргумента против того, чтобы рассматривать LLM как «объективных» аналитиков. Во-первых, LLM лишены подлинной рефлексивности. Во-вторых, они не обладают теоретической чувствительностью — способностью распознавать концептуальную значимость данных на основе предметных знаний. В-третьих, они не могут брать на себя ответственность за интерпретативные решения.

Вместе с тем авторы не утверждают превосходства человеческих коддеров во всех отношениях. Напротив, они отстаивают принцип дополнительности: люди превосходят LLM в интерпретации, рефлексивности и построении теорий; LLM превосходят людей в масштабируемости, согласованности и скорости. Рабочий процесс намеренно позиционирует человеческих коддеров как интерпретативные якоря и ключевых принимающих решения, тогда как LLM выполняют роль аналитических инструментов, ускоряющих кодирование и поддерживающих оценку насыщения.

Исследование открывает несколько направлений для дальнейшей работы: репликационные исследования с другими LLM для оценки межмодельной согласованности; применение фреймворка к другим крупным качественным датасетам; лонгитюдные исследования динамики AI-дискурса; а также уточнение операционализации теоретического насыщения в контекстах больших данных.


Журнал: Theory and Society, том 55, статья 66 (2026)
DOI: 10.1007/s11186-026-09734-7
Тип доступа: открытый доступ (CC BY)