digesta Новости — без шума
← Все статьи

Человек vs модель: как мы с нейронками читали новости

Сейчас принято отдавать языковой модели любую задачу, которая формулируется словами: «Определи, через какой аспект издание подаёт событие» или «Найди в тексте приёмы убеждения или манипуляций».

Мы попробовали сделать и то и другое на реальном потоке новостей, потом проверили результат уже с точки зрения человека. И решили не показывать читателям ни одно, ни другое. Ниже описали почему, с числами. Да, это отчёт об отрицательном результате, каких публикуют мало, хотя они полезнее многих положительных.

Человек с пустым ярлыком и лотком «ничего»; три робота лепят разные метки на одну заметку.

01Выход за рамки

Есть устоявшийся словарь из 14 «рамок» — экономика, безопасность, законность, мораль, качество жизни, культурная идентичность, общественное мнение, политика и так далее. Он пришёл из политологии и используется в исследованиях медиа четверть века.

Идея понятная: два издания могут назвать ровно один набор фактов о пожаре и подать его по-разному: одно ведёт с ущерба в деньгах, другое с угрозы жителям. Если это измерить, под каждым сюжетом можно написать: «18 изданий из 31 подали это как вопрос безопасности, 7 — как экономический».

Мы дали одинаковую инструкцию и одни и те же сто новостных текстов трём моделям разных разработчиков — назовём их A, B и C, где C заметно дороже и мощнее остальных.

Сначала результат выглядел обнадёживающим. A и B совпали на 76 текстах из ста; каппа Коэна — статистика, которая вычитает случайные совпадения, — 0,71 при случайном согласии 0,17. Для задачи с четырнадцатью вариантами это много.

Потом мы добавили третью модель, и картина поменялась.

парасовпалокаппа
A — B76%0,71
A — C63%0,57
B — C67%0,62
все три сразу55%—

Причина видна в том, как модели пользуются словарём. На этой сотне текстов у A две самые частые рамки покрывают 56%, у B — 52%, у C — 38%. Более дешёвые модели сваливают почти всё в две большие корзины («политика» и «безопасность»), дорогая раскладывает шире. И крупнейшее расхождение системное, а не случайное: то, что A девять раз назвала политикой, C увидела как международную репутацию.

Согласие двух моделей — вообще не доказательство правоты. Это в лучшем случае верхняя граница осмысленности задачи.

02Человек как эталон

Тогда мы сделали то, чего в подобных проектах обычно не делают: попросили человека разметить сорок текстов вслепую — без названия издания и без ответов моделей. Это и есть эталон.

разметчиксовпало с человекомкаппа95% интервал
A55%0,440,28 … 0,60
B55%0,450,28 … 0,63
C (дорогая)57%0,510,35 … 0,67

Интервалы перекрываются полностью: на сорока текстах «дорогая модель лучше» не установлено. Деньги не купили точности.

И гипотеза «C раскладывает словарь шире, наверное, она и права» тоже не подтвердилась: на этих сорока текстах у человека две самые частые рамки покрывают 55% — он посередине между 68% у A и 40% у C. Дешёвая модель схлопывает, дорогая дробит, человек не делает ни то ни другое.

03Когда лучше сказать «нет»

Дальше начинается самое интересное. Мы разложили ошибку на две части.

18%
текстов человек отметил как «рамки здесь нет» (7 из 40)
0%
модель A не воздержалась ни разу за все 40 текстов

При этом инструкция прямо разрешала пустой ответ. Модели им просто не пользовались. Отсюда разложение, которое всё объясняет:

То есть задача, которую модель на самом деле решает, — не «какая здесь рамка», а «выбери что-нибудь из списка». Она не умеет сказать «ничего».

04Мы попробовали это починить

Гипотеза была: модель различать умеет, а воздерживаться — нет, и это лечится формулировкой. Мы переписали инструкцию двумя способами: в первом воздержание вынесено вперёд и названо обычным ответом, во втором добавлена явная проверка в два шага.

инструкциявоздержаний из 40точность там, где рамка есть
человек7 (18%)—
исходная0 (0%)67%
«воздержание — обычный ответ»26 (67%)31%
«решай в два шага»36 (92%)9%

Инструкция не калибрует модель, а перекидывает её в другую крайность. Доля воздержаний следует за наклоном текста инструкции, а не за содержанием новостей. И точность на текстах, где рамка есть, падает синхронно: модель начинает воздерживаться ровно там, где не надо. Настройки, дающей и то и другое, в этом диапазоне нет.

Есть и последний штрих. Мы дважды прогнали одну и ту же исходную инструкцию на одной и той же модели с отключённой случайностью. Первый прогон: ноль воздержаний. Второй: пять. Величина, которую предлагалось показать читателю, гуляет между запусками.

05В поисках «соломенного чучела»

Мы искали и другие приёмы в новостных сообщениях. Есть словарь приёмов из исследований пропаганды — нагруженный язык, ярлык, апелляция к страху, ложная дилемма, «а у вас», соломенное чучело (подмена: оппоненту приписывают заведомо слабый или искажённый довод и триумфально его опровергают, будто это и была его позиция). Задача найти их в тексте трудна для всех: даже узкоспециализированные системы, заточенные именно под неё и соревнующиеся на научных бенчмарках, набирают лишь F1 ≈ 0,35–0,40.

F1 — это общая оценка «поиска в тексте» по шкале от 0 до 1: она сводит в одно число точность (сколько из найденного — правда, а не ложная тревога) и полноту (сколько реальных приёмов удалось поймать). 0,35–0,40 — это низко: даже лучшие системы промахиваются примерно так же часто, как попадают. Иначе говоря, низкий потолок у самой задачи, а не только у наших моделей.

Приёмы убеждения: F1 против человека. Все три модели у нижней планки области или ниже. «Потолок» — лучшие специализированные системы на научных бенчмарках.
Лучшие системы (потолок)~0,38
A0,33
B0,23
C (дорогая)0,21
разметчикточностьполнотаF1
A0,360,300,33
B0,200,270,23
C (дорогая)0,210,200,21

«Нагруженный язык»: человек отметил его в 6 текстах из сорока, модели — в 16, 26 и 18. Перебор втрое-вчетверо. Модель считает нагруженным почти любой живой язык.

«Сомнение»: человек отметил 6 раз, модели — 0, 3 и 1 раз, и пересечений ноль. Под одним и тем же словом человек и модель понимают разное.

Отдельно стоит сказать, почему это опаснее, чем ошибка в рамке. Утверждение «издание не назвало факт номер четыре» читатель может проверить сам за минуту. Утверждение «издание применило апелляцию к страху» — оценочное суждение об организации, и проверить его нельзя никак, кроме как поверить. Ставить такое рядом с названием издания при F1 0,2–0,33 — значит выдавать шум за обвинение.

06После прочтения сжечь

Признаки подачи и приёмы убеждения мы не показали аудитории, хотя они были посчитаны, измерены и через сутки отключены. В продукте остались только те метрики, которые читатель может проверить сам: кто написал, сколько изданий, какие факты подтверждены независимо, какой факт у кого отсутствует.

Мы считаем, что это правильный исход, и что публиковать его важнее, чем красивый. Отрицательные результаты в этой области почти не публикуются: продукт, попробовавший измерить подачу моделью и не сумевший, обычно просто выкатывает метрику и молчит о её качестве.

07Три вывода, которые переносятся на другие задачи

Поэтому в digesta нет ни «оптики подачи», ни «индекса манипуляций» — только то, что можно проверить: сколько изданий, какие факты подтверждены независимо и какого факта у кого нет.


Метод и оговорки

Выборка. 100 новостных текстов за 2–3 сентября 2026, по одному от каждого из ста разных изданий, 21 медиапространство. Медианная длина — около 80 слов.

Разметчики. Три модели трёх разных разработчиков, одна и та же инструкция, отключённая случайность. Человеческий эталон — 40 текстов, размечены владельцем продукта вслепую (без названия издания и без ответов моделей).

Главное ограничение: эталон один. Это разметка одного человека, а не согласованное мнение нескольких. Часть расхождений «модель против человека» — на самом деле «человек против другого человека». Вывод — про то, что модели не воспроизводят конкретного внимательного читателя, а не про единственно верную разметку.

Второе: сорок текстов. Доверительные интервалы широкие. Разницы в несколько процентных пунктов между моделями здесь неразличимы.

Третье: инструкции для проверки воздержания писались, не глядя на то, где именно человек воздержался. Но целевая доля 18% была известна, поэтому окончательное подтверждение требует свежего слепого блока.

Что не проверяли. Специализированные модели, обученные на размеченных корпусах фреймов, — они существуют и на своей задаче держатся лучше. Наш вывод — про универсальные модели с инструкцией в промпте, то есть про то, как эту задачу решают в продуктах сегодня.