digesta Só sinal. Sem ruído
← Todos os artigos

Humano contra modelo: como lemos as notícias com redes neurais

Hoje é comum entregar a um modelo de linguagem qualquer tarefa que se possa formular em palavras: «Determine sob que aspecto o veículo apresenta o acontecimento» ou «Encontre no texto as técnicas de persuasão ou manipulação».

Tentamos fazer as duas coisas num fluxo real de notícias e depois verificamos o resultado do ponto de vista de um humano. E decidimos não mostrar nenhuma das duas aos leitores. Abaixo está o porquê, com números. Sim, é um relato de um resultado negativo, dos que se publicam pouco, embora sejam mais úteis do que muitos positivos.

Человек с пустым ярлыком и лотком «ничего»; три робота лепят разные метки на одну заметку.

01Sair do quadro

Existe um dicionário consolidado de 14 «quadros» — economia, segurança, legalidade, moral, qualidade de vida, identidade cultural, opinião pública, política, e assim por diante. Veio da ciência política e é usado na pesquisa de mídia há um quarto de século.

A ideia é clara: dois veículos podem nomear exatamente o mesmo conjunto de fatos sobre um incêndio e apresentá-lo de forma diferente — um abre com o custo em dinheiro, o outro com a ameaça aos moradores. Se isso for mensurável, sob cada tema se poderia escrever: «18 veículos de 31 apresentaram como uma questão de segurança, 7 como uma questão econômica».

Demos a mesma instrução e os mesmos cem textos de notícia a três modelos de desenvolvedores diferentes — chamemo-los de A, B e C, onde C é notavelmente mais caro e potente que os demais.

No início o resultado parecia animador. A e B coincidiram em 76 textos de cem; o kappa de Cohen — uma estatística que subtrai as coincidências por acaso — valia 0,71 contra um acordo fortuito de 0,17. Para uma tarefa com quatorze opções, é muito.

Depois acrescentamos o terceiro modelo, e o quadro mudou.

parcoincidiukappa
A — B76 %0,71
A — C63 %0,57
B — C67 %0,62
os três de uma vez55 %—

A razão vê-se em como os modelos usam o dicionário. Nesta centena de textos, os dois quadros mais frequentes de A cobrem 56 %, os de B — 52 %, os de C — 38 %. Os modelos mais baratos jogam quase tudo em dois grandes cestos («política» e «segurança»), o caro reparte mais amplamente. E a maior divergência é sistemática, não aleatória: o que A chamou de política nove vezes, C viu como reputação internacional.

Dois modelos concordarem não é prova nenhuma de acerto. É, na melhor das hipóteses, um limite superior do sentido da tarefa.

02O humano como referência

Então fizemos o que esses projetos costumam não fazer: pedimos a um humano que anotasse quarenta textos às cegas — sem o nome do veículo e sem as respostas dos modelos. É isso a referência.

anotadorcoincidiu com o humanokappaintervalo de 95 %
A55 %0,440,28 … 0,60
B55 %0,450,28 … 0,63
C (caro)57 %0,510,35 … 0,67

Os intervalos se sobrepõem por completo: em quarenta textos, «o modelo caro é melhor» não está estabelecido. O dinheiro não comprou precisão.

E a hipótese «C reparte o dicionário mais amplamente, provavelmente tem razão» também não se confirmou: nesses quarenta textos os dois quadros mais frequentes do humano cobrem 55 % — bem entre os 68 % de A e os 40 % de C. O modelo barato colapsa, o caro fragmenta, o humano não faz nem uma coisa nem outra.

03Quando é melhor dizer «não»

Aqui começa o mais interessante. Decompusemos o erro em duas partes.

18 %
dos textos o humano marcou «aqui não há quadro» (7 de 40)
0 %
o modelo A não se absteve nenhuma vez nos 40 textos

E olha que a instrução permitia explicitamente uma resposta vazia. Os modelos simplesmente não a usaram. Daí uma decomposição que explica tudo:

Ou seja, a tarefa que o modelo de fato resolve não é «qual quadro há aqui» mas «escolha algo da lista». Ele não sabe dizer «nada».

04Tentamos consertar isso

A hipótese era: o modelo sabe distinguir, mas não se abster, e isso se cura com a formulação. Reescrevemos a instrução de duas maneiras: a primeira põe a abstenção à frente e a nomeia uma resposta comum, a segunda acrescenta uma verificação explícita em dois passos.

instruçãoabstenções de 40precisão onde há quadro
humano7 (18 %)—
original0 (0 %)67 %
«a abstenção é uma resposta comum»26 (67 %)31 %
«decida em dois passos»36 (92 %)9 %

A instrução não calibra o modelo, ela o joga para o outro extremo. A proporção de abstenções segue a inclinação do texto da instrução, não o conteúdo das notícias. E a precisão nos textos que têm quadro cai no mesmo compasso: o modelo passa a se abster justamente onde não deve. Nesta faixa não existe um ajuste que dê as duas coisas.

Há um último toque. Rodamos duas vezes a mesma instrução original no mesmo modelo com a aleatoriedade desligada. Primeira passagem: zero abstenções. Segunda: cinco. A grandeza que se propunha mostrar ao leitor varia de uma passagem para outra.

05Em busca do «espantalho»

Procuramos também outras técnicas nos despachos de notícia. Existe um dicionário de técnicas da pesquisa sobre propaganda — linguagem carregada, rotulação, apelo ao medo, falso dilema, «e você também», o espantalho (uma substituição: atribui-se ao adversário um argumento deliberadamente fraco ou distorcido e o refuta-se triunfalmente, como se essa tivesse sido a sua posição). Encontrá-las num texto é difícil para todos: mesmo os sistemas altamente especializados, feitos exatamente para isso e competindo em bancadas de teste científicas, alcançam apenas um F1 ≈ 0,35–0,40.

O F1 é uma nota geral de «busca no texto» numa escala de 0 a 1: reduz a um único número a precisão (quanto do encontrado é real, não um alarme falso) e a abrangência (quantas técnicas reais se conseguiu captar). 0,35–0,40 é baixo: mesmo os melhores sistemas erram mais ou menos tão frequentemente quanto acertam. Em outras palavras, o teto é baixo para a própria tarefa, não só para os nossos modelos.

Técnicas de persuasão: F1 contra o humano. Os três modelos estão na extremidade inferior da faixa ou abaixo. O «teto» são os melhores sistemas especializados em bancadas de teste científicas.
Melhores sistemas (teto)~0,38
A0,33
B0,23
C (caro)0,21
anotadorprecisãoabrangênciaF1
A0,360,300,33
B0,200,270,23
C (caro)0,210,200,21

«Linguagem carregada»: o humano marcou em 6 textos de quarenta, os modelos — em 16, 26 e 18. Um excesso de três a quatro vezes. O modelo considera carregada quase qualquer linguagem viva.

«Dúvida»: o humano marcou 6 vezes, os modelos — 0, 3 e 1 vez, e zero interseções. Sob a mesma palavra, o humano e o modelo entendem coisas diferentes.

Vale dizer à parte por que isto é mais perigoso do que um erro de quadro. A afirmação «o veículo não citou o fato número quatro» o leitor pode verificar sozinho em um minuto. A afirmação «o veículo empregou um apelo ao medo» é um juízo de valor sobre uma organização, e não há como verificá-la a não ser acreditando. Pôr isso ao lado do nome de um veículo com um F1 de 0,2–0,33 é fazer passar o ruído por uma acusação.

06Leia e queime

Os indícios de apresentação e as técnicas de persuasão não os mostramos ao público, embora tenham sido calculados, medidos e desligados um dia depois. No produto ficaram apenas as métricas que o leitor pode verificar por si mesmo: quem escreveu, quantos veículos, quais fatos estão confirmados de forma independente, qual fato falta a quem.

Consideramos que este é o desfecho certo, e que publicá-lo importa mais do que publicar um bonito. Os resultados negativos nesta área quase nunca são publicados: um produto que tentou medir a apresentação com um modelo e não conseguiu costuma apenas lançar a métrica e calar sobre a sua qualidade.

07Três conclusões que se transferem para outras tarefas

Por isso a digesta não tem nem «óptica de apresentação» nem «índice de manipulação» — apenas o que pode ser verificado: quantos veículos, quais fatos estão confirmados de forma independente e qual fato falta a quem.


Método e ressalvas

Amostra. 100 textos de notícia de 2–3 de setembro de 2026, um de cada um de cem veículos diferentes, 21 espaços midiáticos. Comprimento mediano — cerca de 80 palavras.

Anotadores. Três modelos de três desenvolvedores diferentes, a mesma instrução, aleatoriedade desligada. A referência humana — 40 textos, anotados pelo dono do produto às cegas (sem o nome do veículo e sem as respostas dos modelos).

A limitação principal: uma só referência. É a anotação de uma só pessoa, não a opinião concertada de várias. Parte das divergências «modelo contra humano» são na verdade «humano contra outro humano». A conclusão é sobre os modelos não reproduzirem um leitor atento específico, não sobre existir uma única anotação verdadeira.

Segunda: quarenta textos. Os intervalos de confiança são largos. Diferenças de alguns pontos percentuais entre modelos são aqui indistinguíveis.

Terceira: as instruções para testar a abstenção foram escritas sem olhar onde exatamente o humano se absteve. Mas a proporção-alvo de 18 % era conhecida, então uma confirmação definitiva exige um novo bloco às cegas.

O que não testamos. Os modelos especializados, treinados em corpora de quadros anotados — eles existem e se saem melhor na sua própria tarefa. A nossa conclusão é sobre os modelos generalistas com uma instrução no prompt, ou seja, sobre como esta tarefa é resolvida nos produtos hoje.