Skip to content
Новость Levent Bulut июль 2026 г.

Levent Bulut: Claude против ChatGPT в анализе нарратива — два новых LLM, тот же барьер

Кристаллическая структура нейронной сети — визуальная метафора границы между человеческим и машинным пониманием текста

Краткий ответ: исследователь попросил Claude и ChatGPT разметить 100 турецких художественных сцен по шести признакам техники «показывай, не рассказывай», проверяя их против зафиксированных меток независимого человека-рецензента — тот же тест, который ранее прошли правилобазовый детектор, Gemini 2.5 Flash и Grok. На самом трудном признаке — «материализованной метафоре» — обе новые модели воспроизвели ту же неудачу (κ ≈ 0 относительно человека), но в противоположных направлениях. Там, где человек нашёл признак в 9 сценах, Grok не нашёл ни одной, Gemini — около двух, ChatGPT отметил 40, а Claude — 78. Четыре передовые модели, получившие одинаковое определение, дали разброс позитивных оценок от нуля до почти стопроцентного охвата. Этот разброс сам по себе и есть главная находка: это наиболее весомое свидетельство того, что проблема — не только в машинах, но и в самом определении.

Раскрытие информации. Одна из двух оцениваемых моделей — Claude (Anthropic), и ассистент, который собрал аналитический пайплайн для этого исследования, также работает на Claude. Исходный протокол намеренно исключал Claude из числа разметчиков именно по причине этой цикличности; данное расширение сознательно включает его в качестве объекта исследования, и это намеренное отклонение от протокола сообщается открыто, а не скрывается. Меры снижения риска: метки человека были зафиксированы до начала разметки любой из моделей; обе модели получали промпты через те же фиксированные блоки, что и в предыдущих раундах; все статистические показатели согласованности вычислялись детерминированным кодом без участия каких-либо моделей.

Откуда берётся этот тест

Это третий раунд продолжающейся программы проверки надёжности на датасете objective-projection. В первом раунде правилобазовый детектор сравнивался с собственными слепыми метками основателя (n=120): детектор справляется с поверхностными признаками, но на «материализованной метафоре» даёт κ ≈ 0.00 — не лучше случайного угадывания. Во втором раунде использовались 100 новых сцен, независимый человек-рецензент без личной заинтересованности в методе, и два LLM — Gemini 2.5 Flash и Grok. Неутешительный результат сохранился: ни одна из моделей не восстановила инференциальные признаки, и обе резко разошлись между собой.

Тот раунд завершился открытым вопросом: с этой стеной сталкиваются языковые модели в целом, или только эти две? Данный раунд добавляет ещё два семейства моделей — Claude и ChatGPT — в тех же условиях, на тех же зафиксированных метках человека.

Метод, кратко

  • Сцены: те же 100 отложенных турецких сцен (seed выборки 2026, seed перемешивания 2027), маскированные ID, нулевое пересечение с данными, на которых строился детектор.
  • Эталон: метки независимого человека-рецензента, зафиксированные до того, как какая-либо модель увидела сцены, без последующих изменений.
  • Добавленные разметчики: Claude Fable 5 (веб-интерфейс, режим рассуждения «High») и ChatGPT 5.5 (веб-интерфейс, стандартный режим), июль 2026 года. Каждая модель получила идентичные десять блоков промптов — тот же текст обёртки, те же определения, — что и Gemini с Grok во втором раунде. Температура не поддаётся управлению в обоих веб-интерфейсах; то же ограничение применялось к более ранним моделям и учитывается во всех сравнениях.
  • Контроль контаминации: сессия Claude проводилась в чистом чате вне рабочего пространства проекта, содержащего логику детектора и метки человека, так что разметчик-модель не имел доступа ни к тому, ни к другому. Состояние настроек персонализации/памяти на стороне ChatGPT не фиксировалось — это отмечено как ограничение ниже.
  • Анализ: Cohen’s κ по каждому правилу, доля сырого согласия и подсчёт истинных/ложных позитивов относительно человека, вычисленные детерминированным кодом. Там, где блок запускался дважды, учитывается первый запуск. Повторные запуски оказались информативны: при перезапуске одного блока ChatGPT согласился сам с собой в 58 из 60 ячеек, Claude — в 60 из 60, что свидетельствует о высокой внутримодельной стабильности обеих систем.

Результаты

Против независимого человека-рецензента (VAR = признак присутствует):

ПравилоЧеловек VARClaude κ (согл.)ChatGPT κ (согл.)Детектор κGemini 2.5 κGrok κ
Метка эмоции0/100н/д (100%)н/д (100%)н/д (100%)н/д (100%)н/д (100%)
Сравнение1/1000.00 (99%)0.00 (99%)0.00 (99%)0.00 (99%)0.00 (99%)
Материализованная метафора9/1000.03 (29%)0.02 (59%)0.02 (33%)0.19 (92%)0.00 (91%)
Микрофокус96/1000.00 (96%)0.30 (92%)0.02 (79%)0.01 (13%)−0.07 (78%)
Темпоральный якорь99/1000.00 (99%)−0.01 (97%)−0.02 (81%)−0.02 (92%)−0.02 (94%)
Противоречие атмосфере44/1000.27 (63%)0.18 (60%)0.00 (56%)0.05 (58%)0.02 (56%)

Общая доля сырого согласия с человеком (600 ячеек): Claude 81.0% · ChatGPT 84.5% · (второй раунд: детектор 74.7%, Gemini 75.7%, Grok 86.3%). Согласованность между моделями Claude–ChatGPT: 86.2%.

Главная находка: одно определение, четыре порога

Посмотрите на строку «материализованная метафора» через подсчёт позитивов. Человек нашёл признак — абстрактное внутреннее состояние, преобразованное в конкретную физическую деталь, несущую нагрузку в сцене, — в 9 сценах из 100. Разметчики-машины, получившие то же определение:

РазметчикСцен помечено VARИз 9 человеческих — поймано
Grok00
Gemini 2.5 Flash~21
ChatGPT 5.5404
Claude Fable 5788
(Правилобазовый детектор)727

Каждое κ в этом семействе округляется до нуля — неудача первого и второго раундов воспроизводится на четвёртом и пятом разметчике-машине. Но форма неудачи несёт новую информацию. Grok и Gemini занижают оценки, тяготея к нулю. ChatGPT находится посередине. Claude помечает почти всё — он улавливает 8 из 9 позитивных меток человека (высокий recall), но тонет в 70 ложных позитивах (точность 10%), — профиль, поразительно похожий на наивный правилобазовый детектор, которого он должен был превзойти.

Во втором раунде авторы писали, что данные допускают два объяснения, которые невозможно разделить: (a) признак требует инференции, недоступной автоматическим разметчикам на уровне человека, или (b) определение недостаточно операционализировано, чтобы любой разметчик мог применить его последовательно. Разброс результатов четырёх моделей сдвигает вес в сторону (b) — точнее, показывает, что (b) реально, независимо от того, верно ли (a) тоже. Если определение может применяться четырьмя способными моделями с порогами 0, 2, 40 и 78 позитивов на сотню — это определение ещё не является измерительным инструментом. Барьер реален, но часть барьера создана нами самими.

Окончательный арбитр между (a) и (b) — по-прежнему второй независимый человек-рецензент. Если двое людей сойдутся между собой, пока все машины расходятся, (a) выживает наряду с (b). В этом исследовании один человек, и это остаётся его центральным ограничением.

Важное обновление: противоречие атмосфере не закрыто для машин

Второй инференциальный признак второго раунда — «противоречие атмосфере», неуместная конкретная деталь, работающая против эмоционального вектора сцены, — казался безнадёжным для машин: человек нашёл 44 случая, тогда как детектор поймал 0, Gemini — 2, Grok — 3.

Этот вывод не выдерживает третьего раунда, и авторы его пересматривают. Claude выявил 31 из 44 позитивных меток человека (κ = 0.27), ChatGPT — 23 (κ = 0.18). В абсолютных значениях это всё ещё слабое согласие — 24 и 19 ложных позитивов соответственно, ни один из разметчиков не дотягивает до уровня, пригодного для использования, — но принципиально отличается от нуля. На единственном признаке с более сбалансированным распределением классов (44/56) новые модели частично восстанавливают конструкт, который более ранние почти полностью упустили.

Снова два честных объяснения: либо новые модели действительно лучше справляются с этим видом инференции, либо конструкт находится на уровне сложности, где поколение модели имеет значение. В любом случае формулировка второго раунда «все три пропустили большинство» теперь ограничена разметчиками того раунда, и эта поправка публикуется с той же степенью заметности, что и исходный вывод.

Что это говорит и не говорит о Claude против ChatGPT

Если вы пришли за вердиктом — вот честный: ни одна из моделей не может аннотировать эти нарративные признаки на уровне человека, и «какая лучше» зависит от того, какой тип неудачи предпочтительнее. ChatGPT в целом точнее отслеживал человека (84.5% против 81.0%) и держался ближе к правдоподобным базовым частотам. Claude нашёл больше того, что нашёл человек на трудных признаках — наивысший recall на обоих инференциальных правилах, — ценой чрезмерного помечания. Для инструмента-скринера, где пропуски обходятся дорого, профиль Claude можно признать более полезным; для чего-либо напоминающего достоверную разметку — ни одна из моделей не подходит. На четырёх правилах с экстремальным дисбалансом классов большинство значений κ неинформативны по построению, и авторы отказываются ранжировать по ним модели.

Этот паттерн согласуется с гипотезой о систематической ошибке суммаризации — моделями, испытывающими затруднения именно на границе между физическим/показанным слоем и инферируемым — но «согласуется» не значит «подтверждает». Зарегистрированный эксперимент с оценочным режимом, который на самом деле проверил бы эту гипотезу, не проводился, а конфликт интересов, раскрытый выше, применяется вдвойне к любому предложению, в котором языковая модель делает вывод о языковых моделях.

Ограничения

Один человек-рецензент (неопределённость a/b сохраняется); экстремальный дисбаланс классов на четырёх из шести правил; запуски через веб-интерфейс без контроля температуры; состояние памяти/персонализации сессии ChatGPT не зафиксировано; только турецкие сцены; побоковые промпты вместо полностью независимых вызовов на каждую сцену; автор разработал набор правил; ассистент по анализу — из семейства одной из оцениваемых моделей. Последний пункт — структурный конфликт, который никакое раскрытие не устраняет полностью, — поэтому числа, зафиксированные метки и открытые данные (HF DOI 10.57967/hf/8960, Zenodo 10.5281/zenodo.19511369) публикуются, чтобы любой мог перепроверить всё без участия какой-либо модели.

FAQ

Claude «победил» или ChatGPT? Ни тот, ни другой — и вопрос сформулирован не совсем верно. ChatGPT в целом чаще соглашался с человеком-эталоном; Claude восстановил больше позитивных меток человека на инференциальных признаках, но с очень низкой точностью. Обе модели воспроизвели результат κ ≈ 0 на материализованной метафоре. Тест измеряет надёжность аннотирования относительно одного человека по шести узким признакам — это не общий бенчмарк качества текста.

Почему разброс четырёх моделей (0 / 2 / 40 / 78) оказался заголовком, а не какой-либо отдельный показатель? Потому что он диагностичен. Если четыре способные модели применяют одно определение с порогами от «никогда» до «почти всегда», само определение ещё не операционализировано — вывод, который не установил бы результат ни одной модели в отдельности. Это переносит часть ответственности с машин на измерительный инструмент.

Разве участие Claude в анализе теста с Claude не обесценивает результат? Это реальный конфликт, и он раскрыт, а не скрыт. Структурные меры снижения риска: метки человека зафиксированы до разметки любой модели, промпты — фиксированные блоки, идентичные предыдущему раунду, все статистики вычислены детерминированным кодом, опубликованным вместе с данными. Любой может пересчитать таблицу без участия какой-либо модели.

Доказывает ли это, что AI не умеет читать художественную литературу? Нет. Это показывает, что на 100 данных сценах четыре LLM и правилобазовый детектор не смогли воспроизвести суждения одного независимого человека по двум признакам, требующим инференции, — и что они расходились между собой как минимум настолько же, насколько с человеком. То, является ли барьер свойством моделей или определений, требует второго человека-рецензента — это зарегистрированный следующий шаг.