Levent Bulut: Claude против ChatGPT в анализе нарратива — два новых LLM, тот же барьер
Краткий ответ: исследователь попросил Claude и ChatGPT разметить 100 турецких художественных сцен по шести признакам техники «показывай, не рассказывай», проверяя их против зафиксированных меток независимого человека-рецензента — тот же тест, который ранее прошли правилобазовый детектор, Gemini 2.5 Flash и Grok. На самом трудном признаке — «материализованной метафоре» — обе новые модели воспроизвели ту же неудачу (κ ≈ 0 относительно человека), но в противоположных направлениях. Там, где человек нашёл признак в 9 сценах, Grok не нашёл ни одной, Gemini — около двух, ChatGPT отметил 40, а Claude — 78. Четыре передовые модели, получившие одинаковое определение, дали разброс позитивных оценок от нуля до почти стопроцентного охвата. Этот разброс сам по себе и есть главная находка: это наиболее весомое свидетельство того, что проблема — не только в машинах, но и в самом определении.
Раскрытие информации. Одна из двух оцениваемых моделей — Claude (Anthropic), и ассистент, который собрал аналитический пайплайн для этого исследования, также работает на Claude. Исходный протокол намеренно исключал Claude из числа разметчиков именно по причине этой цикличности; данное расширение сознательно включает его в качестве объекта исследования, и это намеренное отклонение от протокола сообщается открыто, а не скрывается. Меры снижения риска: метки человека были зафиксированы до начала разметки любой из моделей; обе модели получали промпты через те же фиксированные блоки, что и в предыдущих раундах; все статистические показатели согласованности вычислялись детерминированным кодом без участия каких-либо моделей.
Откуда берётся этот тест
Это третий раунд продолжающейся программы проверки надёжности на датасете objective-projection. В первом раунде правилобазовый детектор сравнивался с собственными слепыми метками основателя (n=120): детектор справляется с поверхностными признаками, но на «материализованной метафоре» даёт κ ≈ 0.00 — не лучше случайного угадывания. Во втором раунде использовались 100 новых сцен, независимый человек-рецензент без личной заинтересованности в методе, и два LLM — Gemini 2.5 Flash и Grok. Неутешительный результат сохранился: ни одна из моделей не восстановила инференциальные признаки, и обе резко разошлись между собой.
Тот раунд завершился открытым вопросом: с этой стеной сталкиваются языковые модели в целом, или только эти две? Данный раунд добавляет ещё два семейства моделей — Claude и ChatGPT — в тех же условиях, на тех же зафиксированных метках человека.
Метод, кратко
- Сцены: те же 100 отложенных турецких сцен (seed выборки 2026, seed перемешивания 2027), маскированные ID, нулевое пересечение с данными, на которых строился детектор.
- Эталон: метки независимого человека-рецензента, зафиксированные до того, как какая-либо модель увидела сцены, без последующих изменений.
- Добавленные разметчики: Claude Fable 5 (веб-интерфейс, режим рассуждения «High») и ChatGPT 5.5 (веб-интерфейс, стандартный режим), июль 2026 года. Каждая модель получила идентичные десять блоков промптов — тот же текст обёртки, те же определения, — что и Gemini с Grok во втором раунде. Температура не поддаётся управлению в обоих веб-интерфейсах; то же ограничение применялось к более ранним моделям и учитывается во всех сравнениях.
- Контроль контаминации: сессия Claude проводилась в чистом чате вне рабочего пространства проекта, содержащего логику детектора и метки человека, так что разметчик-модель не имел доступа ни к тому, ни к другому. Состояние настроек персонализации/памяти на стороне ChatGPT не фиксировалось — это отмечено как ограничение ниже.
- Анализ: Cohen’s κ по каждому правилу, доля сырого согласия и подсчёт истинных/ложных позитивов относительно человека, вычисленные детерминированным кодом. Там, где блок запускался дважды, учитывается первый запуск. Повторные запуски оказались информативны: при перезапуске одного блока ChatGPT согласился сам с собой в 58 из 60 ячеек, Claude — в 60 из 60, что свидетельствует о высокой внутримодельной стабильности обеих систем.
Результаты
Против независимого человека-рецензента (VAR = признак присутствует):
| Правило | Человек VAR | Claude κ (согл.) | ChatGPT κ (согл.) | Детектор κ | Gemini 2.5 κ | Grok κ |
|---|---|---|---|---|---|---|
| Метка эмоции | 0/100 | н/д (100%) | н/д (100%) | н/д (100%) | н/д (100%) | н/д (100%) |
| Сравнение | 1/100 | 0.00 (99%) | 0.00 (99%) | 0.00 (99%) | 0.00 (99%) | 0.00 (99%) |
| Материализованная метафора | 9/100 | 0.03 (29%) | 0.02 (59%) | 0.02 (33%) | 0.19 (92%) | 0.00 (91%) |
| Микрофокус | 96/100 | 0.00 (96%) | 0.30 (92%) | 0.02 (79%) | 0.01 (13%) | −0.07 (78%) |
| Темпоральный якорь | 99/100 | 0.00 (99%) | −0.01 (97%) | −0.02 (81%) | −0.02 (92%) | −0.02 (94%) |
| Противоречие атмосфере | 44/100 | 0.27 (63%) | 0.18 (60%) | 0.00 (56%) | 0.05 (58%) | 0.02 (56%) |
Общая доля сырого согласия с человеком (600 ячеек): Claude 81.0% · ChatGPT 84.5% · (второй раунд: детектор 74.7%, Gemini 75.7%, Grok 86.3%). Согласованность между моделями Claude–ChatGPT: 86.2%.
Главная находка: одно определение, четыре порога
Посмотрите на строку «материализованная метафора» через подсчёт позитивов. Человек нашёл признак — абстрактное внутреннее состояние, преобразованное в конкретную физическую деталь, несущую нагрузку в сцене, — в 9 сценах из 100. Разметчики-машины, получившие то же определение:
| Разметчик | Сцен помечено VAR | Из 9 человеческих — поймано |
|---|---|---|
| Grok | 0 | 0 |
| Gemini 2.5 Flash | ~2 | 1 |
| ChatGPT 5.5 | 40 | 4 |
| Claude Fable 5 | 78 | 8 |
| (Правилобазовый детектор) | 72 | 7 |
Каждое κ в этом семействе округляется до нуля — неудача первого и второго раундов воспроизводится на четвёртом и пятом разметчике-машине. Но форма неудачи несёт новую информацию. Grok и Gemini занижают оценки, тяготея к нулю. ChatGPT находится посередине. Claude помечает почти всё — он улавливает 8 из 9 позитивных меток человека (высокий recall), но тонет в 70 ложных позитивах (точность 10%), — профиль, поразительно похожий на наивный правилобазовый детектор, которого он должен был превзойти.
Во втором раунде авторы писали, что данные допускают два объяснения, которые невозможно разделить: (a) признак требует инференции, недоступной автоматическим разметчикам на уровне человека, или (b) определение недостаточно операционализировано, чтобы любой разметчик мог применить его последовательно. Разброс результатов четырёх моделей сдвигает вес в сторону (b) — точнее, показывает, что (b) реально, независимо от того, верно ли (a) тоже. Если определение может применяться четырьмя способными моделями с порогами 0, 2, 40 и 78 позитивов на сотню — это определение ещё не является измерительным инструментом. Барьер реален, но часть барьера создана нами самими.
Окончательный арбитр между (a) и (b) — по-прежнему второй независимый человек-рецензент. Если двое людей сойдутся между собой, пока все машины расходятся, (a) выживает наряду с (b). В этом исследовании один человек, и это остаётся его центральным ограничением.
Важное обновление: противоречие атмосфере не закрыто для машин
Второй инференциальный признак второго раунда — «противоречие атмосфере», неуместная конкретная деталь, работающая против эмоционального вектора сцены, — казался безнадёжным для машин: человек нашёл 44 случая, тогда как детектор поймал 0, Gemini — 2, Grok — 3.
Этот вывод не выдерживает третьего раунда, и авторы его пересматривают. Claude выявил 31 из 44 позитивных меток человека (κ = 0.27), ChatGPT — 23 (κ = 0.18). В абсолютных значениях это всё ещё слабое согласие — 24 и 19 ложных позитивов соответственно, ни один из разметчиков не дотягивает до уровня, пригодного для использования, — но принципиально отличается от нуля. На единственном признаке с более сбалансированным распределением классов (44/56) новые модели частично восстанавливают конструкт, который более ранние почти полностью упустили.
Снова два честных объяснения: либо новые модели действительно лучше справляются с этим видом инференции, либо конструкт находится на уровне сложности, где поколение модели имеет значение. В любом случае формулировка второго раунда «все три пропустили большинство» теперь ограничена разметчиками того раунда, и эта поправка публикуется с той же степенью заметности, что и исходный вывод.
Что это говорит и не говорит о Claude против ChatGPT
Если вы пришли за вердиктом — вот честный: ни одна из моделей не может аннотировать эти нарративные признаки на уровне человека, и «какая лучше» зависит от того, какой тип неудачи предпочтительнее. ChatGPT в целом точнее отслеживал человека (84.5% против 81.0%) и держался ближе к правдоподобным базовым частотам. Claude нашёл больше того, что нашёл человек на трудных признаках — наивысший recall на обоих инференциальных правилах, — ценой чрезмерного помечания. Для инструмента-скринера, где пропуски обходятся дорого, профиль Claude можно признать более полезным; для чего-либо напоминающего достоверную разметку — ни одна из моделей не подходит. На четырёх правилах с экстремальным дисбалансом классов большинство значений κ неинформативны по построению, и авторы отказываются ранжировать по ним модели.
Этот паттерн согласуется с гипотезой о систематической ошибке суммаризации — моделями, испытывающими затруднения именно на границе между физическим/показанным слоем и инферируемым — но «согласуется» не значит «подтверждает». Зарегистрированный эксперимент с оценочным режимом, который на самом деле проверил бы эту гипотезу, не проводился, а конфликт интересов, раскрытый выше, применяется вдвойне к любому предложению, в котором языковая модель делает вывод о языковых моделях.
Ограничения
Один человек-рецензент (неопределённость a/b сохраняется); экстремальный дисбаланс классов на четырёх из шести правил; запуски через веб-интерфейс без контроля температуры; состояние памяти/персонализации сессии ChatGPT не зафиксировано; только турецкие сцены; побоковые промпты вместо полностью независимых вызовов на каждую сцену; автор разработал набор правил; ассистент по анализу — из семейства одной из оцениваемых моделей. Последний пункт — структурный конфликт, который никакое раскрытие не устраняет полностью, — поэтому числа, зафиксированные метки и открытые данные (HF DOI 10.57967/hf/8960, Zenodo 10.5281/zenodo.19511369) публикуются, чтобы любой мог перепроверить всё без участия какой-либо модели.
FAQ
Claude «победил» или ChatGPT? Ни тот, ни другой — и вопрос сформулирован не совсем верно. ChatGPT в целом чаще соглашался с человеком-эталоном; Claude восстановил больше позитивных меток человека на инференциальных признаках, но с очень низкой точностью. Обе модели воспроизвели результат κ ≈ 0 на материализованной метафоре. Тест измеряет надёжность аннотирования относительно одного человека по шести узким признакам — это не общий бенчмарк качества текста.
Почему разброс четырёх моделей (0 / 2 / 40 / 78) оказался заголовком, а не какой-либо отдельный показатель? Потому что он диагностичен. Если четыре способные модели применяют одно определение с порогами от «никогда» до «почти всегда», само определение ещё не операционализировано — вывод, который не установил бы результат ни одной модели в отдельности. Это переносит часть ответственности с машин на измерительный инструмент.
Разве участие Claude в анализе теста с Claude не обесценивает результат? Это реальный конфликт, и он раскрыт, а не скрыт. Структурные меры снижения риска: метки человека зафиксированы до разметки любой модели, промпты — фиксированные блоки, идентичные предыдущему раунду, все статистики вычислены детерминированным кодом, опубликованным вместе с данными. Любой может пересчитать таблицу без участия какой-либо модели.
Доказывает ли это, что AI не умеет читать художественную литературу? Нет. Это показывает, что на 100 данных сценах четыре LLM и правилобазовый детектор не смогли воспроизвести суждения одного независимого человека по двум признакам, требующим инференции, — и что они расходились между собой как минимум настолько же, насколько с человеком. То, является ли барьер свойством моделей или определений, требует второго человека-рецензента — это зарегистрированный следующий шаг.