Skip to content
Новость Sprig Blog июль 2026 г.

Sprig: три слоя стека исследований — и только один принадлежит вам

Три слоя стека исследований: механический, интерпретационный и слой суждения

В первый раз, когда я передал AI кусок настоящего мышления, я ожидал вернуть себе вторую половину дня. Не получилось.

AI вёл себя как полезный собеседник, задавая вопросы, которые я сам себе не задавал. Но я помню, как в середине сессии поймал себя на мысли: если бы я мог просто созвониться с коллегой на пятнадцать минут, мы пришли бы к ответу быстрее, чем я тратил время, скармливая контекст машине. Инструмент работал именно так, как было заявлено — он просто не делал то, что я молча от него ожидал.

Этот зазор между тем, что инструмент делает, и тем, что мы от него ожидали, — именно там живёт большинство откатов от AI в исследованиях. И таких откатов в этом году было немало. Никто не публикует пост о рабочем процессе, который они свернули, — но если поговорить с достаточным количеством руководителей исследовательских команд, всплывает одна и та же история.

Инструменты не подводят — они дрейфуют в работу, которой никогда не должны были владеть, и никто этого не санкционировал.

Большинство команд, с которыми я сейчас говорю, планируют сократить стек исследовательских инструментов, объединив четыре-пять точечных решений в одно-два, которые реально обмениваются данными между собой. Закупки устали, и так же устали все, кто вынужден помнить, в каком инструменте хранится какое исследование. Консолидация — правильный инстинкт, и она вынуждает команды разобраться с тем, какая ответственность за принятие решений на самом деле должна принадлежать каждому инструменту.

Три слоя в каждом стеке исследований

Механический слой — это работа, которая всегда шла медленно: транскрибация, очистка данных, дедупликация, починка сломанного SQL-запроса, проверка перевода на нескольких рынках, очередное переформатирование одного и того же вывода для четвёртого стейкхолдера. Всё это можно полностью отдать AI.

Интерпретационный слой — это первичная работа с паттернами: кластеризация открытых ответов, выявление кандидатов в темы, обозначение сегментов с отклонениями. AI здесь реально хорош, но неполон — а это сложнее управлять, чем откровенно плохим результатом. AI уверенно вытащит одну тему и тихо упустит три другие, и опасность в том, что вывод читается одинаково в обоих случаях.

Слой суждения — это то, что считается доказательством: достаточно ли сильна находка, чтобы показать её руководству, и что бизнес должен с ней делать. Этот слой полностью ваш. Это единственный слой, где ошибиться одновременно дорого и невидимо.

Откаты случаются именно тогда, когда инструмент поднимается на уровень выше без разрешения.

Самые распространённые паттерны откатов

Чаще всего AI смещается на уровень выше из-за отсутствия ограничений или небрежных инструкций. Самый соблазнительный шаг в стеке — и тот, от которого команды отказываются быстрее всего, — это направить AI напрямую на сырые исследовательские данные и попросить вывод. Результат — не плохой ответ, а беглый. Я слышал похожую историю не раз: исследователь ловит сфабрикованную цитату, просит модель её исправить и получает вторую сфабрикованную цитату. Ошибка была поймана только потому, что этот исследователь знал датасет наизусть — а это оставляет большое слепое пятно в тех исследованиях, где никто не знает.

То, что один руководитель метко назвал «dumps из волшебной палочки», — это загрузить весь опрос без инструкций, без контекста и посмотреть, что выйдет. Это кажется использованием инструмента, но на деле это отречение от интерпретационного слоя в надежде на ясный и точный результат.

Ещё один паттерн — не то, что команды делают сами с собой: стейкхолдеры загружают колоду презентации команды в модель, чтобы получить собственный executive summary. Вы теряете контроль над интерпретацией после передачи материала — это новая проблема, которую никакие внутренние ограничения не решают.

Что делает всё это по-настоящему опасным — сбой невозможно обнаружить при чтении. Сфабрикованная цитата и настоящая отформатированы одинаково. Тема, которую модель изобрела, и тема, которую она нашла, — одинаковое количество слов, в одинаковом уверенном регистре, в одном и том же bullet-пункте. Во всех остальных частях исследования плохая работа выглядит плохо: наводящий вопрос слышно, тонкую выборку видно. AI — это первый инструмент, где качество вывода невидимо на поверхности, а весь наш профессиональный инстинкт для обнаружения проблем — визуальный.

Это не аргумент против инструмента. Это аргумент в пользу понимания того, на каком слое он работает.

Цена, которая никогда не попадает в бизнес-кейс

Три вещи беспокоят меня сильнее, чем галлюцинации, потому что все три происходят медленно.

  1. Первая — атрофия. Один исследователь сказал мне, что после двух лет активного использования AI заметно потерял в остроте, и конкретное, что он потерял, — это интуиция синтеза. Это реальные потери, которые не отражаются ни в одной метрике эффективности. Синтез — это мышца. Она реагирует на бездействие так же, как мышцы реагируют на него.

  2. Второе — кадровый конвейер для джуниоров. Старшие исследователи могут распознать ошибочный синтез, потому что провели годы на выматывающей ручной версии. Если кто-то, входящий в профессию, никогда не делает эту версию, — откуда берётся интуиция?

  3. Некоторые организации не просто «добавили» AI к своим исследовательским командам — они сократили команду и купили инструмент. Вот что должно вызывать дискомфорт у тех, кто делал этот обмен: команда из MIT Project NANDA сообщила в прошлом году, что 95% корпоративных развёртываний GenAI не принесли измеримой отдачи — при более чем $30 млрд затрат. Эту цифру активно критиковали, и обоснованно: успех определялся узко — как влияние на P&L, измеренное через шесть месяцев после пилота, выборка составляла 153 руководителя, набранных на отраслевых конференциях, и многое из реальной ценности никогда не фиксируется таким образом. Поэтому я не буду опираться на эту цифру. Но направление серьёзных возражений не вызывает: купить инструмент и получить от него ценность — это два разных проекта, и большинство компаний сделали только первый. Срезать слой суждения ради оплаты механического слоя — это путь в большинство.

Что на самом деле отсутствует в стеке

Одни и те же пробелы всплывают снова и снова.

Нет верификационного слоя: каждый исследовательский инструмент сейчас создан для производства вывода. Почти ничего не создано для его проверки. Вся нагрузка валидации лежит на человеке, который читает внимательно, — а именно это разрушается, когда работа ускоряется.

Нет происхождения данных: доверие к синтезу должно проверяться одним кликом, а не приниматься на веру. Когда отчёт говорит, что участники испытывали трудности на этапе оформления заказа, хочется кликнуть и попасть на четыре ответа, из которых это взято — не ссылку, а сами сырые данные.

Согласованность между сессиями ненадёжна. Если запустить один и тот же анализ дважды, получатся два разных типа ответов. Память перетекает между сессиями способами, которые сложно предсказать и ещё сложнее объяснить стейкхолдеру, читавшему первую версию.

Последняя миля почти не инструментализирована: мы автоматизируем дизайн исследований и синтез, но потом все равно открывают Google Slides и вручную собирают колоду. Разрыв между завершённым анализом и решением, которое стейкхолдер реально примет, — это место, где выигрывается или проигрывается влияние исследования, и это наименее автоматизированный этап во всём рабочем процессе.

Управление приходит после внедрения. Почти каждая команда, с которой приходится разговаривать, сначала купила инструменты и потом написала правила — если написала вообще. Это задом наперёд, и это та же ошибка, которую исследовательские команды совершили с демократизацией исследований десять лет назад.

Слой Sprig

Годы ушли на то, чтобы собрать этот исследовательский стек вручную: банки вопросов в вики, шаблоны в папке, процесс проверки, держащийся на Slack и доброй воле. Теперь я работаю в компании, которая строит это как программное обеспечение.

Design Agent работает на механическом уровне конструирования исследований: логика, ветвление, нейтральные формулировки, проверка на предвзятость. Это та часть, где неспециалист надёжнее всего ломает исследование — и та часть, где машина может держать стандарт лучше, чем занятой человек.

Field Agent проводит исследование и адаптируется к каждому участнику в реальном времени, вместо того чтобы гнать всех через одну статичную форму. Механическая работа, которая раньше была невозможной, а не просто медленной.

Synthesize Agent работает на интерпретационном уровне и на последней миле одновременно, сохраняя доказательную базу прикреплённой. Находка, которую можно отследить, — это находка, которую можно защитить.

Sprig MCP существует потому, что слой суждения не живёт в продукте. Он живёт в голове исследователя, в Claude, в документе, где происходит настоящее мышление. Подтягивать реальные данные исследований в эту среду лучше, чем просить людей думать внутри чужого дашборда.

Ничто из этого не выводит вас из цикла. Смысл хорошего стека не в том, чтобы вы перестали проверять. Смысл в том, чтобы вы точно знали, где проверка важна, вместо того чтобы проверять всё случайным образом и называть это строгостью.

Проведите границу до того, как она понадобится

Команды, справляющиеся с этим хорошо, — не те, у кого лучшие инструменты. Это те, кто заранее и вслух решил, на каком слое каждый инструмент имеет право работать и кто принимает решение, когда что-то смещается.

Запишите свои три слоя. Назовите, что механическое, что интерпретационное — и будьте беспощадны в том, что остаётся суждением. Потом автоматизируйте рутину без извинений.

Стек стал быстрым в этом году — но то, что он не изменил, — это место, где вы нужны в нём. Это по-прежнему ваша работа.