Skip to content
Новость UXPA Magazine июль 2026 г.

UXPA Magazine: UX-методы для AI-систем, которые обучаются

График изменения четырёх измерений доверия пользователей к агентной AI-системе за 12 недель

Проблема исследований-снимков

Недавно я завершил исследование агентного персонализированного новостного агрегатора на основе AI. Мои результаты показали, что, хотя участники высоко ценили разнообразие и редакционную независимость инструмента, спустя три месяца AI скорректировал свою модель на основе паттернов взаимодействия пользователей — и начал отфильтровывать уникальные точки зрения, которые участники изначально высоко ценили. Это указывает на критическую методологическую проблему: большинство UX-исследований предполагают, что система остаётся неизменной, однако поведение агентного AI — движущаяся цель, и снэпшот-выводы устаревают по мере того, как система адаптируется.

Агентные AI-системы опровергают предположение о том, что система ведёт себя предсказуемо между релизами. Они выстраивают уникальные рабочие отношения с каждым пользователем, которые формируются под влиянием истории взаимодействий этого пользователя. Квартальный прогноз, который AI-агент формирует сегодня, может мало напоминать прогноз, который он сформирует через шесть месяцев, освоив реальный способ работы пользователя.

Отзывчивость к реальному использованию системы — это ценностное предложение агентного AI; уникальное преимущество такой системы заключается в её растущей полезности со временем по мере того, как она усваивает контекст, предпочтения и нетипичные ситуации пользователя. Но для тех, кто изучает эти системы, это создаёт проблему, с которой стандартные методы не справляются. Опыт, протестированный в прошлом квартале, — это уже не тот опыт, с которым пользователь взаимодействует сегодня.

Проблема становится острой, когда важнейшим UX-результатом является доверие. Доверие по своей природе имеет продольное измерение во времени. Снэпшот-исследование, фиксирующее только текущий момент, почти ничего не говорит о том, как меняется взаимодействие, — а значит, упускает эволюционирующую дугу отношений.

Нам нужны методы, которые отслеживают отношения по мере их развития. При этом не нужно изобретать новые методы — достаточно адаптировать уже существующие в нашей области, дополнив их психологическими фреймворками, основанными на десятилетиях исследований человеческих отношений.

В следующих разделах я представляю три подхода, которые использую или активно разрабатываю в своей работе с корпоративным AI. Ни один из методов не является законченным, однако все они, на мой взгляд, указывают направление, в котором должна развиваться исследовательская практика.

Модифицированные дневниковые исследования для меняющегося AI

В традиционном дневниковом исследовании участник фиксирует, что он делал и как себя чувствовал, — однако для агентного AI исследователь должен также отслеживать, что в это время делала система. Поведение агентного AI могло измениться так, что пользователь это заметил, но не сформулировал. Структурирование записей вокруг двух параллельных временны́х линий позволяет исследователям видеть, когда настроение пользователя и поведение AI расходятся или сходятся, — что создаёт аналитическую ценность, недостижимую в однолинейном дневнике.

Триггерные записи по отклонениям наряду с плановыми

Дневниковые исследования, как правило, используют фиксированные интервалы: участники делают запись каждый день или через несколько дней по расписанию. Для агентного AI самые информативные моменты часто оказываются неожиданными. Когда AI делает что-то удивительное — положительно или отрицательно, — реакция пользователя в этот момент более информативна, чем любая запланированная рефлексия.

Я начал встраивать событийно-триггерные записи в свои дизайны исследований наряду с регулярными интервальными записями. Инструкция проста: если AI сделал что-то неожиданное, найди момент, чтобы зафиксировать это. Порог «неожиданного» намеренно занижен, чтобы уловить небольшие моменты удивления наряду с драматическими. Доверие формируется через накопление небольших сигналов, а не только через редкие значительные события.

Фиксируйте, что реально делал AI

Эта модификация требует взаимодействия с инженерной командой. Чтобы понять эволюционирующий пользовательский опыт, необходимы данные об эволюции поведения AI. В ходе исследования фиксируйте, что AI рекомендовал или генерировал для пользователя через регулярные промежутки времени, обеспечивая при этом надлежащий контроль конфиденциальности. Без поведенческих данных системы исследователь может сформировать лишь субъективное впечатление, лишённое доказательной базы.

Конкретная схема логирования для данных AI

Работа с инженерной командой по сбору системных данных обеспечивает необходимый контекст для качественных выводов. При настройке продольного исследования запросите схему логирования, которая фиксирует следующие конкретные точки данных в точное время записи дневника участника.

  • Сырой вывод. Точные артефакты, которые AI представил пользователю. В исследовании новостного агрегатора это означает логирование конкретных заголовков и аннотаций статей, отображённых на дашборде пользователя.
  • Распределение вывода. Категориальная разбивка рекомендаций. Лог может показать, что фид состоял из 60% местных новостей, 30% национальной политики и 10% международных финансов.
  • Уровни достоверности. Внутренняя вероятностная оценка системы для её рекомендаций. Низкие оценки достоверности нередко соотносятся с моментами, когда пользователи сообщают о снижении предсказуемости.
  • Веса признаков. Базовые переменные, определяющие вывод. Что приоритизировала система: недавнюю историю кликов пользователя, явно заявленные предпочтения или глобально трендовые темы?

Просмотр этого лога вместе с транскриптом интервью с участником точно показывает, почему воспринимаемая доброжелательность или предсказуемость системы меняется со временем.

Продолжительность исследования

Практическое замечание о продолжительности: для значимой адаптации AI исследователям обычно нужно не менее 4–6 недель. Всё, что короче, и исследование, скорее всего, охватывает относительно статичную версию системы. Для более глубоких вопросов о развитии доверия и формировании навыков 8–12 недель предпочтительнее. Длинные исследования требуют тщательного внимания к тому, чтобы избежать усталости участников: используйте более лёгкие записи, гибкие ритмы и чёткие стимулы. Я обнаружил, что небольшие еженедельные чекины эффективнее объёмных ежедневных дневников в исследованиях длительностью более месяца.

Дневниковые исследования позволяют наблюдать повседневный пользовательский опыт, но их недостаточно для понимания более глубокого ощущения доверия. Чтобы по-настоящему отслеживать эти отношения, необходимо также измерять доверие как многомерный конструкт.

Продольное измерение доверия

Исследования неизменно показывают, что доверие — многомерный конструкт. Мета-анализ Хэнкока и соавторов (2023), охвативший более 300 опубликованных исследований, установил, что доверие как многомерный конструкт часто разбивается на такие ключевые компоненты, как компетентность, доброжелательность и предсказуемость. Этот фреймворк, прослеживаемый у Зодерна и Хертеля, применялся к человеческим организациям и рабочим отношениям. Он служит полезной призмой для оценки взаимодействий пользователя и AI-агента. Понимание этих измерений важно, поскольку они развиваются с разной скоростью и на них влияют различные взаимодействия пользователя с системой.

Четыре измерения доверия

Чтобы лучше понять нюансы этих отношений, можно разбить доверие на четыре отдельных компонента. Каждый из них развивается по-своему и даёт более чёткое представление о том, как эволюционирует уверенность пользователя.

Компетентное доверие оценивает, справляется ли AI с задачей. Это измерение формируется быстро: пользователи строят или теряют его на основе наблюдаемых результатов и корректируют свою оценку с каждым взаимодействием. Несколько удачных рекомендаций от AI укрепляют компетентное доверие. Явная ошибка суждения может обнулить его. Это измерение, которое большинство команд уже измеряет, даже если называет его точностью, удовлетворённостью или иначе.

Доброжелательное доверие касается того, действует ли AI в интересах пользователя. Это измерение развивается медленнее всего и, будучи раз подорванным, труднее всего поддаётся восстановлению.

Предиктивное доверие — это понимание пользователем логики AI. Отсутствие понимания создаёт некомфортную зависимость: пользователь полагается на систему, которую не может объяснить или предвидеть. Предиктивное доверие формируется медленно и легко разрушается.

Обоснованность данными оценивает степень, в которой пользователь может верифицировать информацию, предоставляемую AI. Агент может последовательно давать точные ответы, укрепляя компетентное доверие. Если система не может показать пользователю, на каких именно документах или наборах данных основываются ответы, доверие быстро разрушается. Обоснованность требует от AI цитировать источники, обеспечивать аудиторские следы и закреплять вывод в верифицируемых фактах. Например, менеджер по логистике, проверяющий рекомендацию по цепочке поставок, хотел бы видеть конкретные инвентарные отчёты, лежащие в основе логики системы.

Измерение доверия как движущейся цели

Как только исследователи начинают трактовать доверие как четыре измерения, а не одно, подход к измерению меняется. Практическая структура включает краткие pulse-опросы через регулярные промежутки времени в сочетании с периодическими полуструктурированными интервью. Pulse-опросы дают количественный сигнал, который можно отображать на графике во времени. Интервью показывают рассуждения за числами.

Pulse-опросы должны охватывать уверенность в точности, понимание логики AI, воспринимаемое соответствие целям пользователя и лёгкость верификации исходных данных.

Ритм измерений важен. Мне подошло следующее: еженедельные pulse-опросы в первый месяц, затем двухнедельные. Более редкие pulse-опросы рискуют упустить быстрое раннее калибрование; более частые — провоцируют механические ответы без глубины.

Наиболее ценная точка данных в исследовании доверия — это изменение показателя до и после конкретного события. Эти до-и-после замеры показывают динамику восстановления и разрушения доверия так, как никакой одиночный снимок не покажет.

Измерение доверия как единого показателя скрывает важные детали. В продольном наблюдении за 12 недель за пользовательским доверием к агентной AI-системе воспринимаемая доброжелательность и обоснованность данными остаются стабильными, тогда как компетентность неуклонно растёт по мере того, как система осваивает ежедневные рутины пользователя. На 4-й неделе необъяснённое фоновое обновление резко снижает предиктивное доверие. Раздельное отслеживание этих измерений точно показывает, как скрытые обновления системы нарушают ментальную модель пользователя — даже когда реальная компетентность инструмента продолжает расти.

Исследование дуги отношений

Этот метод концептуально заимствован из исследований межличностных отношений в психологии — у Кнаппа, Вэнджелисти и Кафлина. Предпосылка такова: отношения пользователя с AI-агентом следуют предсказуемой дуге, которую можно изучать по этапам. Если исследование набирает участников в момент первого знакомства с агентной системой, а затем наблюдает за ними на протяжении нескольких месяцев, оно способно отобразить, как развиваются эти отношения, где они застревают и что заставляет их углубляться или распадаться.

Четыре этапа отношений

Адаптируя фреймворк Кнаппа для UX-исследований, я сосредотачиваюсь на четырёх отдельных этапах отношений, которые пользователи выстраивают с AI-инструментами. Такое различение позволяет точечно формулировать вопросы и уточнять понимание того, на каком этапе развития отношений находится пользователь.

Встреча — первый этап. Пользователь только познакомился с AI. Какие ожидания он привносит и какая ментальная модель формируется на основе начальных взаимодействий?

Исследование — второй этап. Пользователь многократно взаимодействует с AI, зондируя его возможности и ограничения. Он замечает, когда AI оправдывает или опровергает его ожидания. Формируются обходные пути и ранние привычки доверия или скептицизма.

Калибровка — третий и самый важный этап. Пользователь вырабатывает рабочую модель реальных возможностей и ограничений AI. Если калибровка проходит неудачно, пользователь либо доверяет слишком много (что рано или поздно разрушает отношения), либо слишком мало (и отказывается от полезного инструмента).

Установление или разрыв — финальный этап. Пользователь пришёл к стабильным отношениям: либо продуктивно интегрировал AI в свою работу, либо дистанцировался от него. Изучение этого этапа показывает, как выглядит успешное долгосрочное сотрудничество человека и AI — и каковы его режимы сбоя.

Проектирование расписания исследования

Практическое отличие от календарного продольного исследования в том, что расписание интервью согласуется с переходами между этапами, а не с произвольными интервалами. Интервью нужны не на 1-й, 4-й, 8-й и 12-й неделях — они нужны на этапе встречи, при входе в исследование, в момент формирования калибровки и когда отношения либо установились, либо распались.

Продольное исследование требует разработки индикаторов переходов между этапами. Одни носят поведенческий характер — например, пользователь начинает осознанно принимать решения о том, что делегировать. Другие являются лингвистическими: пользователи переходят от оценочных конструкций третьего лица к совместным конструкциям первого лица или к пассивному, выражающему капитуляцию языку.

Разные пользователи проходят этапы с разной скоростью: одни ускоряются, другие застревают, третьи возвращаются назад. Например, обновление системы, изменяющее ожидания пользователя от поведения AI, может отбросить установившегося пользователя обратно к этапу исследования.

Исследователи отслеживают эти поведенческие маркеры через ежедневные дневниковые записи и интервью с пользователями, чтобы точно определить текущий этап участника. Ниже — таблица четырёх основных этапов взаимодействия человека с AI и соответствующих лингвистических сигналов.

Этап отношенийУстановка пользователяПоведенческие и лингвистические индикаторы
ВстречаФормирование начальных ожиданийИспользует оценочный язык третьего лица
ИсследованиеЗондирование возможностей и ограниченийВырабатывает ранние обходные пути и привычки
КалибровкаФормирование рабочей модели AIПринимает осознанные решения о делегировании; использует совместные конструкции первого лица
Установление / разрывПродуктивная интеграция инструмента или отказ от негоПродуктивное сотрудничество или язык капитуляции

Как это работает на практике

Начните со снэпшот-исследований, но планируйте продольные. Традиционное usability-исследование или концепт-тест агентного AI-продукта полезны для начальной валидации. Критическое изменение — с самого начала встроить продольные точки контакта в план исследования. Даже лёгкий ежемесячный pulse-опрос, добавленный поверх снэпшот-работы, даёт представление о том, как эволюционирует опыт системы. Ежемесячный pulse может стать системой раннего предупреждения для моментов, когда снэпшот-выводы начинают расходиться с реальным пользовательским опытом.

Работа с инженерами по логированию изменений поведения AI с интервалами, согласованными с расписанием исследования, трансформирует то, что поддаётся анализу. Стремитесь коррелировать изменения в пользовательском опыте с изменениями в выводе системы. Без этого результаты остаются догадками.

Представляйте выводы как траектории, а не статичные числа. Отображение показателей доверия во времени смещает разговор от «Работает ли это?» к «Как развиваются отношения?» — а это и есть вопрос, который действительно важен для агентных продуктов.

Взгляд вперёд

UX-исследования продуктов с AI находятся на переломном этапе. Методы, которым обучали большинство из нас, были созданы для статичных систем, в которых артефакт, лежащий в основе исследования, достаточно долго остаётся неизменным для оценки. Агентный AI работает иначе, и разрыв между системами, которые мы сейчас исследуем, и методами, которые мы используем для этого, продолжает расти.

Методы, описанные в этой статье, — это отправные точки, которые будут развиваться по мере зрелости исследований агентного AI. Нам необходимо расширять уже имеющиеся навыки: слушать, наблюдать и фиксировать опыт в системах, требующих более длительного горизонта.

Быстрый старт: первое продольное AI-исследование

  • Логируйте AI, а не только пользователя. Взаимодействуйте с инженерами для захвата системных выводов наряду с дневниками пользователей.
  • Триггерные записи по неожиданным событиям. Просите пользователей делать запись в момент, когда система сделала что-то неожиданное.
  • Измеряйте четыре измерения доверия. Отслеживайте компетентность, предсказуемость, доброжелательность и обоснованность данными по отдельности.
  • Картируйте этапы отношений. Проводите интервью, когда пользователи переходят между этапами встречи, исследования, калибровки и установления.

Литература

Amershi, Saleema, Dan Weld, Mihaela Vorvoreanu et al. 2019. “Guidelines for Human-AI Interaction.” Proceedings of the 2019 CHI Conference on Human Factors in Computing Systems: 1–13.

Hancock, P. A., Theresa T. Kessler, Alexandra D. Kaplan et al. 2023. “How and Why Humans Trust: A Meta-Analysis and Elaborated Model.” Frontiers in Psychology 14: 1081086.

Knapp, Mark L., Anita L. Vangelisti, and John P. Caughlin. 2014. Interpersonal Communication and Human Relationships. 7th ed. Boston: Pearson.

Lee, John D., and Katrina A. See. 2004. “Trust in Automation: Designing for Appropriate Reliance.” Human Factors 46 (1): 50–80.

Sondern, Dominik, and Guido Hertel. 2024. “Revisiting the Classic ABI Model of Trustworthiness.” Journal of Trust Research 14 (2): 213–236.

Yang, Qian, Aaron Steinfeld, Carolyn Rosé, and John Zimmerman. 2020. “Re-Examining Whether, Why, and How Human-AI Interaction Is Uniquely Difficult to Design.” Proceedings of the 2020 CHI Conference on Human Factors in Computing Systems: 1–13.