Marketing Letters: лексиконы как якоря для генеративного AI в анализе тональности
Авторы: Юнсун Чон, Серхио Гроув, Эдуардо Вильясис-Кальдерон
Статья опубликована 13 августа 2026 года в журнале Marketing Letters в открытом доступе. Тема — распространённые, но недооцениваемые методологические ошибки в анализе тональности текстов с помощью лексиконов, а также то, как лексиконы можно использовать в паре с генеративным AI, а не вместо него.
Аннотация
Лексиконный анализ тональности (computer-aided text analysis, CATA) широко применяется в маркетинговых исследованиях. Авторы выявляют несколько систематически упускаемых проблем: произвольный выбор лексикона и некорректное использование разностных показателей (positive minus negative) для измерения общей тональности. В статье предлагаются практические рекомендации, позволяющие избежать эмпирических смещений, приводящих к несогласованным результатам.
Авторы также показывают, как лексиконы могут служить контекстными якорями при использовании GenAI через few-shot prompting. На данных об отзывах потребителей они воспроизводят результаты предыдущего исследования о воспринимаемой полезности отзывов, применяя широко распространённые лексиконы (AFINN, BING, LIWC, NRC, VADER). Ключевые выводы: произвольный выбор лексикона приводит к смещённым и несогласованным результатам, ограничивая обобщаемость, а совместное использование GenAI и лексиконов повышает качество анализа.
1. Введение
Computer-aided text analysis применяется в маркетинге для понимания настроений, речевых паттернов и мнений потребителей в отзывах и социальных медиа о продуктах, брендах и компаниях. Тональность, извлечённая из отзывов о продуктах, позволяет изучать электронное сарафанное радио (eWOM), поляризацию настроений и воспринимаемую полезность отзывов.
Однако, несмотря на широкое распространение лексиконного CATA, рекомендации по лучшим практикам остаются ограниченными — особенно в эпоху генеративного AI. Часть исследователей считает, что возможности GenAI могут вытеснить традиционные лексиконные подходы. Авторы статьи придерживаются противоположной точки зрения: теоретический фундамент CATA должен дополнять методы на основе GenAI, сохраняя теоретическую обоснованность обнаружения тональности.
Авторы выделяют три часто упускаемые проблемы в лексиконном CATA, которые могут воспроизводиться и в работе с GenAI:
- Произвольный выбор лексикона без эмпирического или контекстного обоснования. Такой же паттерн возникает с GenAI, где выбор модели определяется воспринимаемыми возможностями, а не соответствием контексту.
- Некорректное использование разностных показателей (positive minus negative). Исследователи должны проверять, можно ли объединять позитивный и негативный компоненты, а не принимать это как данность.
- Лексиконы и GenAI рассматриваются как взаимозаменяемые инструменты, хотя они измеряют разные вещи: лексиконы фиксируют эмоциональный тон, а GenAI — контекстуальную оценочную благоприятность.
Для устранения этих проблем авторы предлагают рекомендации по работе с компонентами тональности и использованию лексиконов как контекстных якорей для GenAI. Лексиконы, по их мнению, могут сохранять теоретическую непрерывность и повышать прозрачность, потенциально снижая частоту неподтверждённых выводов модели (галлюцинаций).
2. Использование лексиконов в академической литературе
В различных бизнес-дисциплинах для CATA применяются разные лексиконы. Пять наиболее широко используемых — AFINN, BING, LIWC, NRC и VADER — различаются по типам слов, шкалам тональности, методологии создания и формату результатов. Исследователи ранее отмечали отсутствие формальных критериев выбора лексикона: нередко выбирается тот, который лучше подходит для анализа, а не тот, который соответствует исследовательскому контексту. Это вносит систематические искажения в статистические выводы.
3. Рекомендации
3.1. Рекомендация A: охват лексикона как критерий выбора
Охват лексикона (lexicon coverage) — это степень, в которой лексикон включает термины и фразы из исследуемой предметной области: насколько хорошо он фиксирует слова в изучаемом тексте, связанные с измеряемой тональностью. Лексиконы, включающие специализированную терминологию, демонстрируют лучшие результаты в анализе тональности в различных бизнес-контекстах.
Рекомендация: предпочтительно использовать лексиконы с широким охватом эмоциональных выражений. Для оценки охвата авторы предлагают рассчитывать долю слов с тональностью, идентифицированных лексиконом, от общего числа слов в корпусе. Исследователи должны выбирать лексиконы с достаточным охватом, содержащие слова, значимые в контексте конкретного исследования.
3.2. Рекомендация B: разностный показатель против отдельных компонентов тональности
Исследователи должны определять, использовать ли разностный показатель тональности (overall sentiment) или анализировать позитивный и негативный компоненты по отдельности. Произвольное применение разностного показателя может вносить смещения в анализ.
По мнению Эдвардса (1994), использование разностного показателя (positive minus negative) обусловлено нахождением статистической эквивалентности между компонентами. Лексиконы должны демонстрировать сбалансированные эффекты по компонентам тональности, иначе разностный показатель может давать смещённые коэффициенты и снижать предсказательную силу модели.
Авторы рекомендуют проводить тест на равенство (beta equality test) по Эдвардсу перед использованием разностного показателя — независимо от того, основан ли он на лексиконе или на GenAI. Когда GenAI предоставляет единый разностный показатель тональности, это операция того же типа и требует той же проверки.
3.3. Рекомендация C: лексиконы как контекстные якоря для GenAI через few-shot prompting
Проприетарные лексиконы и GenAI-модели оба работают по принципу «чёрного ящика». Тем не менее GenAI обладает ключевым преимуществом: в отличие от лексиконов с заранее определёнными списками слов, GenAI может включать контекстную информацию при оценке тональности. Например, фраза «arrived safe, no damage, and on time» не содержит явно эмоционально окрашенных слов и не будет обнаружена лексиконом, но GenAI может вывести её позитивную тональность из контекста.
Для систематического учёта контекста авторы предлагают использовать лексиконы для идентификации примеров тональности (exemplars) при few-shot prompting. Этот подход опирается на контекстное обучение: GenAI адаптируется к задаче без дообучения модели. Привязывая GenAI к примерам из лексиконов, стратегия даёт модели ориентиры для интерпретации тональности в конкретном контексте исследования.
По сравнению с zero-shot prompting подход few-shot снижает неопределённость модели, согласует интерпретацию тональности с предметно-специфическим языком и уменьшает влияние неоднозначных наблюдений. Лексиконы, по этой логике, сохраняют значительную ценность в эпоху GenAI — не как самостоятельные инструменты измерения, а как контекстные якоря.
Авторы также подчёркивают теоретическое различие между показателями лексиконов и GenAI: лексиконы фиксируют эмоциональный тон, GenAI — контекстуальную оценочную благоприятность. При отсутствии проблем с мультиколлинеарностью авторы рекомендуют включать оба показателя в анализ, чтобы разграничить их эффекты и учесть общую дисперсию.
4. Эмпирическое применение рекомендаций
Для демонстрации предложенных рекомендаций авторы воспроизводят модель из работы Majumder et al. (2022), предсказывающей воспринимаемую полезность отзывов. В качестве зависимой переменной используется число полезных голосов, в качестве независимых — характеристики отзыва: тональность, длина, звёздный рейтинг, общее число голосов.
Выборка составила 12 494 отзыва из трёх категорий продуктов на Amazon.com: цифровая музыка, видеоигры и продукты питания. Помимо VADER (как в оригинальном исследовании), авторы измерили тональность с помощью AFINN, BING, LIWC (2015 и 2022), NRC и Llama 3.1 (GenAI-подход).
Результаты по лексиконам оказались несогласованными, несмотря на то что большинство лексиконов (кроме NRC) показали значимость компонента негативной тональности. Охват лексиконов существенно различается: NRC (20,52%) значительно превышает AFINN (10,26%), BING (12,09%) и VADER (12,83%), хотя NRC использует наименьший словарь. Это свидетельствует о том, что лексиконы с ограниченным охватом могут не фиксировать весь спектр тональности в текстах из-за недостаточного соответствия контексту.
Вклад и значимость для исследователей
Авторы вносят три вклада в литературу. Во-первых, предлагают практические рекомендации, позволяющие редакторам, рецензентам и авторам оценивать правомерность выбора лексикона в CATA. Во-вторых, предлагают интеграционный фреймворк, в котором лексиконы и GenAI взаимодополняют, а не замещают друг друга. В-третьих, воспроизведением предыдущего исследования демонстрируют, что произвольное использование GenAI и стандартные методы агрегации тональности могут скрывать значимые различия.
Статья актуальна для исследователей, применяющих CATA в маркетинге, CX и анализе потребительских отзывов, а также для тех, кто строит аналитические пайплайны на основе GenAI и нуждается в методологически обоснованных принципах выбора инструментов.