Человек vs модель: как мы с нейронками читали новости
Сейчас принято отдавать языковой модели любую задачу, которая формулируется словами: «Определи, через какой аспект издание подаёт событие» или «Найди в тексте приёмы убеждения или манипуляций».
Мы попробовали сделать и то и другое на реальном потоке новостей, потом проверили результат уже с точки зрения человека. И решили не показывать читателям ни одно, ни другое. Ниже описали почему, с числами. Да, это отчёт об отрицательном результате, каких публикуют мало, хотя они полезнее многих положительных.
01Выход за рамки
Есть устоявшийся словарь из 14 «рамок» — экономика, безопасность, законность, мораль, качество жизни, культурная идентичность, общественное мнение, политика и так далее. Он пришёл из политологии и используется в исследованиях медиа четверть века.
Идея понятная: два издания могут назвать ровно один набор фактов о пожаре и подать его по-разному: одно ведёт с ущерба в деньгах, другое с угрозы жителям. Если это измерить, под каждым сюжетом можно написать: «18 изданий из 31 подали это как вопрос безопасности, 7 — как экономический».
Мы дали одинаковую инструкцию и одни и те же сто новостных текстов трём моделям разных разработчиков — назовём их A, B и C, где C заметно дороже и мощнее остальных.
Сначала результат выглядел обнадёживающим. A и B совпали на 76 текстах из ста; каппа Коэна — статистика, которая вычитает случайные совпадения, — 0,71 при случайном согласии 0,17. Для задачи с четырнадцатью вариантами это много.
Потом мы добавили третью модель, и картина поменялась.
| пара | совпало | каппа |
|---|---|---|
| A — B | 76% | 0,71 |
| A — C | 63% | 0,57 |
| B — C | 67% | 0,62 |
| все три сразу | 55% | — |
Причина видна в том, как модели пользуются словарём. На этой сотне текстов у A две самые частые рамки покрывают 56%, у B — 52%, у C — 38%. Более дешёвые модели сваливают почти всё в две большие корзины («политика» и «безопасность»), дорогая раскладывает шире. И крупнейшее расхождение системное, а не случайное: то, что A девять раз назвала политикой, C увидела как международную репутацию.
02Человек как эталон
Тогда мы сделали то, чего в подобных проектах обычно не делают: попросили человека разметить сорок текстов вслепую — без названия издания и без ответов моделей. Это и есть эталон.
| разметчик | совпало с человеком | каппа | 95% интервал |
|---|---|---|---|
| A | 55% | 0,44 | 0,28 … 0,60 |
| B | 55% | 0,45 | 0,28 … 0,63 |
| C (дорогая) | 57% | 0,51 | 0,35 … 0,67 |
Интервалы перекрываются полностью: на сорока текстах «дорогая модель лучше» не установлено. Деньги не купили точности.
И гипотеза «C раскладывает словарь шире, наверное, она и права» тоже не подтвердилась: на этих сорока текстах у человека две самые частые рамки покрывают 55% — он посередине между 68% у A и 40% у C. Дешёвая модель схлопывает, дорогая дробит, человек не делает ни то ни другое.
03Когда лучше сказать «нет»
Дальше начинается самое интересное. Мы разложили ошибку на две части.
При этом инструкция прямо разрешала пустой ответ. Модели им просто не пользовались. Отсюда разложение, которое всё объясняет:
- на текстах, где рамка есть, все три модели правы в 67% случаев;
- на текстах, где рамки нет, они не правы почти никогда.
04Мы попробовали это починить
Гипотеза была: модель различать умеет, а воздерживаться — нет, и это лечится формулировкой. Мы переписали инструкцию двумя способами: в первом воздержание вынесено вперёд и названо обычным ответом, во втором добавлена явная проверка в два шага.
| инструкция | воздержаний из 40 | точность там, где рамка есть |
|---|---|---|
| человек | 7 (18%) | — |
| исходная | 0 (0%) | 67% |
| «воздержание — обычный ответ» | 26 (67%) | 31% |
| «решай в два шага» | 36 (92%) | 9% |
Инструкция не калибрует модель, а перекидывает её в другую крайность. Доля воздержаний следует за наклоном текста инструкции, а не за содержанием новостей. И точность на текстах, где рамка есть, падает синхронно: модель начинает воздерживаться ровно там, где не надо. Настройки, дающей и то и другое, в этом диапазоне нет.
Есть и последний штрих. Мы дважды прогнали одну и ту же исходную инструкцию на одной и той же модели с отключённой случайностью. Первый прогон: ноль воздержаний. Второй: пять. Величина, которую предлагалось показать читателю, гуляет между запусками.
05В поисках «соломенного чучела»
Мы искали и другие приёмы в новостных сообщениях. Есть словарь приёмов из исследований пропаганды — нагруженный язык, ярлык, апелляция к страху, ложная дилемма, «а у вас», соломенное чучело (подмена: оппоненту приписывают заведомо слабый или искажённый довод и триумфально его опровергают, будто это и была его позиция). Задача найти их в тексте трудна для всех: даже узкоспециализированные системы, заточенные именно под неё и соревнующиеся на научных бенчмарках, набирают лишь F1 ≈ 0,35–0,40.
F1 — это общая оценка «поиска в тексте» по шкале от 0 до 1: она сводит в одно число точность (сколько из найденного — правда, а не ложная тревога) и полноту (сколько реальных приёмов удалось поймать). 0,35–0,40 — это низко: даже лучшие системы промахиваются примерно так же часто, как попадают. Иначе говоря, низкий потолок у самой задачи, а не только у наших моделей.
| разметчик | точность | полнота | F1 |
|---|---|---|---|
| A | 0,36 | 0,30 | 0,33 |
| B | 0,20 | 0,27 | 0,23 |
| C (дорогая) | 0,21 | 0,20 | 0,21 |
«Нагруженный язык»: человек отметил его в 6 текстах из сорока, модели — в 16, 26 и 18. Перебор втрое-вчетверо. Модель считает нагруженным почти любой живой язык.
«Сомнение»: человек отметил 6 раз, модели — 0, 3 и 1 раз, и пересечений ноль. Под одним и тем же словом человек и модель понимают разное.
Отдельно стоит сказать, почему это опаснее, чем ошибка в рамке. Утверждение «издание не назвало факт номер четыре» читатель может проверить сам за минуту. Утверждение «издание применило апелляцию к страху» — оценочное суждение об организации, и проверить его нельзя никак, кроме как поверить. Ставить такое рядом с названием издания при F1 0,2–0,33 — значит выдавать шум за обвинение.
06После прочтения сжечь
Признаки подачи и приёмы убеждения мы не показали аудитории, хотя они были посчитаны, измерены и через сутки отключены. В продукте остались только те метрики, которые читатель может проверить сам: кто написал, сколько изданий, какие факты подтверждены независимо, какой факт у кого отсутствует.
Мы считаем, что это правильный исход, и что публиковать его важнее, чем красивый. Отрицательные результаты в этой области почти не публикуются: продукт, попробовавший измерить подачу моделью и не сумевший, обычно просто выкатывает метрику и молчит о её качестве.
07Три вывода, которые переносятся на другие задачи
- Согласие моделей — не истина. Две модели могут согласиться потому, что делят одну ошибку. Проверять надо человеком, вслепую, и лучше рано, пока не потрачено полгода.
- Модели плохо говорят «ничего». Классификатор со списком вариантов выберет вариант. Если в вашей задаче «ни один не подходит» — законный и частый ответ, измерьте отдельно, как часто модель им пользуется. Возможно, никогда.
- Дорогая модель не спасает. Разница между моделью за копейки и моделью в двадцать раз дороже оказалась внутри доверительного интервала. Когда задача плохо определена, деньги не помогают — помогает эталон.
Поэтому в digesta нет ни «оптики подачи», ни «индекса манипуляций» — только то, что можно проверить: сколько изданий, какие факты подтверждены независимо и какого факта у кого нет.
Метод и оговорки
Выборка. 100 новостных текстов за 2–3 сентября 2026, по одному от каждого из ста разных изданий, 21 медиапространство. Медианная длина — около 80 слов.
Разметчики. Три модели трёх разных разработчиков, одна и та же инструкция, отключённая случайность. Человеческий эталон — 40 текстов, размечены владельцем продукта вслепую (без названия издания и без ответов моделей).
Главное ограничение: эталон один. Это разметка одного человека, а не согласованное мнение нескольких. Часть расхождений «модель против человека» — на самом деле «человек против другого человека». Вывод — про то, что модели не воспроизводят конкретного внимательного читателя, а не про единственно верную разметку.
Второе: сорок текстов. Доверительные интервалы широкие. Разницы в несколько процентных пунктов между моделями здесь неразличимы.
Третье: инструкции для проверки воздержания писались, не глядя на то, где именно человек воздержался. Но целевая доля 18% была известна, поэтому окончательное подтверждение требует свежего слепого блока.
Что не проверяли. Специализированные модели, обученные на размеченных корпусах фреймов, — они существуют и на своей задаче держатся лучше. Наш вывод — про универсальные модели с инструкцией в промпте, то есть про то, как эту задачу решают в продуктах сегодня.