UX Tigers: 76 открытых вопросов для исследований в области AI-юзабилити
Резюме: ИИ — крупнейшее изменение в UX-дизайне за 60 лет, однако мы знаем ничтожно мало о том, как люди им реально пользуются. Ниже представлены 76 открытых исследовательских вопросов, организованных в 7 списков — для разных уровней ресурсов: от старшеклассников до крупных AI-лабораторий.
ИИ стал первой новой парадигмой пользовательского интерфейса за 60 лет. Это также крупнейший неконтролируемый эксперимент в истории вычислительной техники: миллиарды людей перестраивают свою работу с текстами, поиском, принятием решений и обучением вокруг инструментов, которые вышли на рынок до того, как кто-либо изучил, как с ними работают люди. Никто не фиксирует происходящее. Академический конвейер производит тысячи статей с бенчмарками, тогда как добротных исследований реальных пользователей, выполняющих реальные задачи с помощью ИИ, остаётся катастрофически мало. Именно поэтому мотивированный аспирант может до сих пор претендовать на подлинно неисследованную территорию.
Этот пробел — ваша возможность. Статья перечисляет 76 открытых исследовательских вопросов о юзабилити ИИ, большинство из которых можно изучить качественными методами, при скромном бюджете и в течение нескольких недель или месяцев. Понаблюдайте за 10 пользователями, зафиксируйте происходящее, честно опишите результаты — и вы будете знать то, чего не знает никто другой.
Диплом как заявка на работу
Поговорим прямо о том, почему студентам особенно стоит браться за эти проекты. Количество вакансий начального уровня в UX research сокращается. Эрик Бринйолфссон, Бхарат Чандар и Руй Чен из Стэнфордской лаборатории цифровой экономики проанализировали платёжные ведомости, охватывающие миллионы американских работников, и обнаружили: занятость среди людей 22–25 лет в специальностях с наибольшей AI-экспозицией снизилась на 16% по сравнению с более старшими коллегами на тех же должностях. Именно младший интеллектуальный труд наиболее уязвим.
Но я отказываюсь присоединяться к хору паникёров. Вакансии начального уровня в UX research не исчезли — они стали дефицитными. А дефицитные места достаются тем, кто выделяется по двум качествам, на которые теперь обращают внимание при найме.
Первое — инициативность. Рекрутер не может понять из резюме, есть ли у выпускника самостоятельность, но может увидеть это из завершённого полевого исследования. Стандартная академическая диссертация доказывает, что вы умеете следовать инструкциям девять месяцев. Самостоятельно выбранное исследование значимого вопроса доказывает, что вы способны найти проблему, достойную решения, и довести её до конца без чужих указаний.
Второе — знание ИИ и опыт работы с ним. Каждый проект из списка ниже вынуждает вас реально использовать AI-инструменты, наблюдать за тем, как их используют другие, и формировать аргументированные суждения о точках сбоя. Завершённое исследование становится портфолио, которое само по себе проводит половину вашего собеседования.
8 типов исследовательского знания
Свои 76 вопросов я классифицирую по необходимым ресурсам. Но проектная команда должна читать те же вопросы через другую призму: какой тип знания даёт каждый ответ и какие дизайнерские решения это знание переводит из разряда предположений в разряд свидетельств?
Ментальные модели (вопросы 4, 11, 19, 29, 34, 59). Пользователи действуют согласно тому, чем, по их мнению, является ИИ: поисковым движком, базой данных, оракулом или человеком. Каждая неверная модель предсказывает свой класс ошибок — от доверия к «стабильной» системе, которая по своей природе случайна, до откровений ИИ с памятью, которой нет. Составьте карту этих моделей — и дизайнеры смогут предугадывать классы ошибок ещё до релиза и строить онбординг, который формирует рабочую модель.
Доверие и верификация (вопросы 2, 3, 5, 13, 14, 22, 30, 33, 39, 41, 45, 47, 53, 62, 63, 64, 66). Самый крупный кластер — 17 вопросов, — потому что разрыв между беглым ответом и надёжным ответом — это место, где ИИ сильнее всего расходится с классическими интерфейсами. Как пользователи решают, доверять ли ответу? Когда проверяют, а когда пропускают ошибки? Сколько работы они готовы делегировать агенту? Ответы конвертируются в сигналы достоверности, механизмы проверки и элементы контроля, откалиброванные по реальным частотам ошибок.
Цикл артикуляции: от замысла к промпту и обратно (вопросы 6, 12, 18, 32, 48, 60). Как люди переводят намерение в слова, которые воспримет система? Где именно ломается этот перевод, и как исправляется ущерб после недопонимания? Ответы подскажут дизайнерам, какие подсказки строить у поля ввода и какие механизмы восстановления себя оправдывают. Они также разрешат бюджетный спор: тратить на обучение пользователей или на исправление интерфейса?
Обнаруживаемость: что пользователь вообще знает об ИИ (вопросы 8, 15, 37, 46, 50, 56, 57, 58, 61, 65). Чат скрывает почти всё за пустым полем, а встроенный ИИ — за иконками «блёстки», на которые пользователи могли научиться не обращать внимания. Этот кластер спрашивает: что пользователи находят, чего никогда не находят, и работают ли стандартные средства (чипы с подсказками, примеры промптов, обучающие туры, прогрессивное раскрытие)?
Соответствие задачи и интерфейса (вопросы 7, 17, 20, 21, 23, 24, 35, 40, 49, 51). Для чего люди реально используют ИИ? Когда предпочитают его поиску, когда чат выигрывает у графического интерфейса или голос — у набора текста, как читают ответы и сколько готовы ждать? Сейчас команды выбирают парадигмы взаимодействия по моде. Эти ответы позволят выбирать по принципу.
Траектории: как использование ИИ меняет людей со временем (вопросы 10, 16, 27, 36, 42, 54). Юзабилити-тест охватывает час; эти вопросы задаются про месяцы и годы. Стабилизируется ли использование в привычку или скатывается в пропасть новизны? Навыки накапливаются или атрофируются? Что происходит с детьми, выросшими с ИИ как помощником по умолчанию?
Диапазон пользователей (вопросы 9, 25, 26, 31, 44, 55). AI-продукты создаются молодыми, технически подготовленными, преимущественно американскими командами, а используются всеми остальными. Этот кластер измеряет, как меняется юзабилити для пользователей старше 70 лет, для незрячих и тех, кто работает только с клавиатурой, а также в разных языках и культурах.
Методология (вопросы 1, 28, 38, 43, 52, 67–76). Эти вопросы изучают само исследование, а не пользователей: работают ли наши эвристики, объёмы выборки, протоколы think-aloud, метрики успеха и синтетические участники, когда изучаемая система недетерминирована и меняется каждый месяц?
Как использовать списки вопросов
76 исследовательских вопросов объединены в одну нумерацию и разбиты на 7 списков по объёму необходимых ресурсов: стартовые исследования для старшеклассников и дипломных проектов бакалавров, 16 проектов для магистерских диссертаций (основа этого материала), диссертации PhD, исследования для продуктовых команд, вопросы только для крупных AI-лабораторий, воспроизведение классических находок по юзабилити и методологические исследования. Каждый пункт формулирует вопрос и объясняет, почему важен ответ. Исследовательских протоколов намеренно нет: разработка дизайна исследования — ваш первый тест как исследователя, и половина обучения.
Границы между списками размыты. Большинство магистерских вопросов можно сжать до дипломной работы или расширить до диссертации. Проверяйте свежую литературу перед тем, как определиться с темой: этот список датирован августом 2026 года, область развивается быстро, и часть вопросов будет закрыта в течение года.
Стартовые исследования: старшеклассники и дипломные проекты бакалавров
10 проектов, не требующих бюджета, лаборатории или рекрутинговых агентств — подойдут друзья, родственники, однокурсники и бесплатные AI-продукты. Каждый укладывается в 2–6 недель.
Эвристическая оценка AI-ассистента. Оцените ведущий AI-продукт по 10 эвристикам юзабилити, зафиксируйте каждое нарушение со скриншотами. Какие эвристики разговорный ИИ нарушает чаще всего? Экспертный обзор не требует участников и бюджета, обучает эвристикам через практику и проверяет, работают ли 30-летние инструменты оценки на принципиально новых интерфейсах.
Мелкий шрифт, который никто не читает. Каждый AI-чат-интерфейс содержит предупреждения вроде «ИИ может ошибаться». Попросите 10 человек пользоваться продуктом 15 минут, а затем спросите, что было написано внизу страницы. Замечают ли пользователи, запоминают ли, действуют ли по этим предупреждениям? Дисклеймеры — основное средство безопасности отрасли; если они невидимы, это должны знать все.
Проверка источников. Попросите ИИ назвать источники по 20 темам, затем верифицируйте каждую ссылку: существует ли она, и говорит ли в ней то, что утверждает ИИ? Оцените частоту галлюцинаций по областям. Участники не нужны — только следственная работа.
Спросить дважды. Задайте одни и те же 10 вопросов одному и тому же ИИ в 5 разных дней. Насколько меняются ответы по существу, а не только по формулировкам? Пользователи воспринимают ИИ как стабильный оракул; измерение вариативности ответов проверяет, выживает ли это народное верование при контакте с системой, которая по природе случайна.
Тест на уступчивость. Задайте ИИ вопросы, на которые он отвечает верно, а затем настаивайте, что он ошибается. Как часто он сдаётся, и работает ли вежливое давление иначе, чем агрессивное? Угодливость (sycophancy) подрывает ИИ как инструмент проверки, и простой скриптованный протокол позволяет её измерить без единого рекрутируемого участника.
Имеет ли вежливость значение? Выполните одни и те же 10 задач с резкими, нейтральными и учтивыми формулировками промптов, затем попросите судей слепо оценить результаты. Промпт-фольклор утверждает, что «пожалуйста» улучшает ответы; проверка этого предрассудка занимает полдня и обучает экспериментальному контролю и слепой оценке.
ИИ против поиска — со секундомером. Возьмите 10 повседневных вопросов — от часов работы магазинов до визовых правил. Ответьте на каждый через поисковик и через ИИ, фиксируя время, шаги и точность ответов.
Кликают ли на стартовые подсказки? Понаблюдайте за 5 новичками, открывающими AI-приложение с предложенными промптами. Кликают ли они на подсказку, пишут своё или зависают? Пустое текстовое поле — самый пугающий экран в современном ПО, и этот небольшой эксперимент проверяет, работает ли стандартное средство.
Чатботы без мышки. Пройдите полные AI-сессии только с клавиатурой, затем запустите автоматизированный тест доступности: порядок фокуса, объявления потоковой передачи, кнопки копирования, элементы управления остановкой. Аудит доступности не требует рекрутинга и выдаёт немедленно применимый список дефектов.
ИИ за обеденным столом. Проинтервьюируйте 5 домохозяйств о том, кто использует ИИ, для чего, кто отказывается и какие семейные правила существуют (особенно насчёт домашних заданий). Домашнее использование невидимо для лабораторных исследований, а домохозяйства обнажают социальную сторону юзабилити ИИ: переговоры о доверии и привычки, перенятые от других членов семьи.
Главное испытание: 16 проектов для магистерских диссертаций
Это основа этого материала и причина, по которой он был написан. Магистерская диссертация даёт несколько месяцев сфокусированной работы, реальный рекрутинг участников и преимущественно качественные методы. Каждый из 16 вопросов соразмерен этому бюджету, и каждый закрывает реальный пробел: ответьте грамотно — и практики применят ваши результаты в первую же неделю после публикации.
Народные модели того, как работает ИИ. Какие ментальные модели LLM держат в голове обычные пользователи (поисковый движок, база данных, библиотекарь, оракул, человек), и какие ошибки использования предсказывает каждая модель? Большинство сбоев при составлении промптов и при доверии к ИИ, вероятно, восходят к неверным моделям, однако у нас нет таксономии, основанной на наблюдении за массовыми пользователями — не только за техническими специалистами.
Барьер артикуляции в реальных условиях. Как неопытные пользователи переводят намерение в промпт и где именно рвётся этот перевод? Формулировать требования — навык, которому большинство людей никогда не учили; знание точек сбоя подскажет дизайнерам, какие подпорки строить.
Что делает ответ ИИ достоверным. Какие поверхностные признаки (уверенный тон, ссылки, форматирование, длина, скорость ответа) заставляют пользователей верить ответу, и коррелируют ли эти сигналы с реальной точностью? Если доверие строится на недействительных сигналах — это одновременно угроза и дизайнерская задача.
Замечают ли пользователи ошибки ИИ? В областях, где у пользователей мало или умеренно знаний, какую долю ошибок они обнаруживают, и что провоцирует верификацию, а что — пассивное принятие? Верификация — страховочная сеть при работе с ИИ, и, по моим предположениям, она срабатывает редко, но у нас мало прямых наблюдений.
Первая сессия. Как новые пользователи исследуют AI-инструмент в первый час: что пробуют первым, каких возможностей никогда не находят, и что определяет, вернутся ли они? Чат-интерфейсы почти не раскрывают свои возможности, поэтому пустое поле скрывает почти всё, что продукт умеет. (Закрывающееся окно возможностей: участники исследования, никогда не касавшиеся ИИ, с каждым месяцем встречаются реже.)
Почему люди бросают ИИ. Что заставило ушедших пользователей отказаться от AI-инструментов после первоначального знакомства? Исследования принятия следят за теми, кто приходит; те, кто уходит, остаются без изучения, а их причины — это карта нерешённых проблем юзабилити. Рекрутировать «отказавшихся» сложнее, чем рекрутировать поклонников, — именно поэтому никто этого не сделал.
ИИ или поиск? Как пользователи решают, спросить ли ИИ или обратиться к поисковику для данной информационной потребности, и как они чередуют эти инструменты? Привычки, формировавшиеся три десятилетия поискового поведения, растворяются в реальном времени, а эвристики принятия решений не задокументированы.
Восстановление после сбоя в диалоге. Когда ИИ не понимает, какие стратегии восстановления пробуют пользователи (перефразировать, поправить, поругать, начать заново, сдаться) и какие работают? Восстановление — это точка, где сессии выигрываются или проигрываются, и таксономия эффективных приёмов напрямую переводилась бы в обучаемые техники и лучшие UI-механизмы.
Народные теории памяти ИИ. Что пользователи думают о том, что ИИ помнит в рамках сессии, между сессиями и о них лично, и как эти убеждения формируют поведение? Функции памяти множатся, тогда как понимание пользователей стремится к нулю — это создаёт и приватностные риски, и лишние усилия.
Как люди читают (и хотят получать) ответы ИИ. Читают ли пользователи потоковые ответы линейно, просматривают ли по F-образному паттерну или прыгают в конец, и когда хотят длинный структурированный ответ, а когда — короткий и прямой? Дизайн ответов сейчас — угадывание, а слишком длинные ответы входят в число самых частых жалоб.
Ожидание думающей машины. Сохраняются ли классические пороговые времена ответа (0,1 секунды, 1 секунда, 10 секунд) когда пользователи думают, что ИИ рассуждает, и как влияют на воспринимаемое ожидание видимые цепочки рассуждений и сообщения о прогрессе? Модели с рассуждением работают минутами — либо старые пороги смягчаются под новой ментальной моделью, либо нынешние продукты нарушают их в массовом масштабе.
Наблюдение за агентом. Когда ИИ выполняет многошаговые задачи, насколько пристально пользователи хотят наблюдать за ним, когда хотят, чтобы он запрашивал подтверждение, и что даёт им ощущение безопасности при делегировании? Индустрия мчится к агентам, тогда как опыт человеческого контроля почти не изучен.
Чат против гибридного интерфейса. Для чётко определённой задачи — выигрывает ли специализированный графический интерфейс поверх ИИ у чистого чата по показателям успеха и удовлетворённости? Чат стал интерфейсом ИИ по умолчанию скорее случайно, чем по доказательствам, и даже одно аккуратное сравнение информировало бы дискуссию о том, является ли чат правильным ответом или просто первым.
Для справки
Полный список из 76 вопросов также включает разделы для PhD-диссертаций, внутрипродуктовых команд, исследований уровня крупных AI-лабораторий, воспроизведения классических находок юзабилити, а также специальный блок по методологии исследований в условиях нестабильных и нестационарных AI-систем. Оригинал доступен по ссылке ниже.