MatrAIx: симуляция 8,3 миллиарда персон-агентов для оценки ИИ-систем
Группа исследователей из Harvard, MIT, Stanford и ряда других университетов опубликовала препринт MatrAIx — инфраструктуры для оценки ИИ-систем и цифровых продуктов с помощью симулированных пользователей в масштабе всего населения планеты.
Почему это важно
Человеческая оценка ИИ-систем остаётся необходимой: только реальные пользователи показывают, как продукт ведёт себя в условиях разнородных запросов, культурных различий и непредсказуемого поведения. Однако человеческое тестирование дорого, медленно и не масштабируется. Офлайн-бенчмарки — более доступная альтернатива, но они, как правило, измеряют результаты задач, не моделируя то, как конкретные пользователи формулируют запросы, взаимодействуют с системой и оценивают её.
Типичный пример: бенчмарк для coding-агента может проверять, проходит ли результат все unit-тесты. Это подтверждает функциональную корректность, но не отражает потребности пользователей. Новичок хочет объяснений, небольших правок и частых подтверждений. Эксперт предпочтёт лаконичные ответы, широкий рефакторинг и большую автономию. Одни пользователи дают подробные спецификации и проверяют каждое изменение; другие начинают с размытой цели и ожидают уточняющих вопросов.
MatrAIx создан, чтобы закрыть именно этот разрыв.
Три компонента системы
Persona 8B — база из 8,3 миллиарда персональных профилей, описанных через схему из 1290 категориальных измерений. Записи формируются двумя способами: выборка из графа зависимостей, сохраняющего корреляции между атрибутами, или извлечение из профилей, написанных реальными людьми. В открытый доступ выпущено около 1 миллиона качественно отфильтрованных персон: 599 847 основаны на реальных пользователях, 400 000 — синтетические.
MatrAIx Playground — четыре среды, в которых симулированные пользователи оценивают и взаимодействуют с цифровыми продуктами: Survey (опрос), AI Chatbot (чат-бот), Web (браузер) и App (мобильное приложение).
Набор задач — 1010 прикладных сценариев, охватывающих более 25 предметных областей: Commerce, Software, Finance, Healthcare и другие.
Как проходила валидация
Исследователи провели 18 189 испытаний на восьми репрезентативных задачах. Персоны-агенты запускались на трёх языковых моделях: Claude Opus 4.8, GPT 5.5 и Claude Haiku 4.5. Полученная обратная связь фиксировала, как решения и предпочтения меняются в зависимости от фона персоны: колебания при повышении цены, готовность продолжить работу после ошибки ИИ-ассистента, терпимость к задержкам.
В первом из двух основных валидационных исследований 400 испытаний проверяли, насколько точно персоны придерживаются заявленных поведенческих атрибутов во всех четырёх средах. Заявленное поведение выражалось или корректно подавлялось в 366 случаях из 400 — точность составила 91,5%.
Во втором исследовании живые судьи и LLM-судьи оценивали качество извлечения персон из реальных пользовательских профилей. Оба подхода подтвердили высокое качество: персоны надёжно воспроизводят нюансы поведения реальных людей.
Что это меняет для исследователей
MatrAIx предоставляет сквозную инфраструктуру для оценки ИИ-систем и продуктов с участием разнородных симулированных пользователей. Речь идёт о принципиально ином масштабе: вместо десятков участников в usability-исследовании — тысячи симулированных персон с зафиксированными демографическими профилями, поведенческими паттернами и культурными особенностями.
Для команд, разрабатывающих conversational AI, голосовых ассистентов или опросные инструменты, это означает возможность тестировать модели до найма реальных участников — и выявлять ошибки, специфичные для конкретных демографических групп, заблаговременно.
Препринт, код и публичный датасет персон доступны на GitHub: MatrAIx-ai/MatrAIx-Persona-8B.