digesta Que du signal. Sans bruit
← Tous les articles

L'humain contre le modèle : lire l'actualité avec des IA

Il est désormais courant de confier à un modèle de langage n'importe quelle tâche formulable en mots : « Détermine sous quel angle le média présente l'événement » ou « Trouve dans le texte les techniques de persuasion ou de manipulation ».

Nous avons essayé de faire l'un et l'autre sur un flux d'actualité réel, puis vérifié le résultat du point de vue d'un humain. Et nous avons décidé de n'en montrer aucun aux lecteurs. Voici pourquoi, chiffres à l'appui. Oui, c'est un compte rendu d'un résultat négatif, de ceux que l'on publie peu, bien qu'ils soient plus utiles que bien des résultats positifs.

Человек с пустым ярлыком и лотком «ничего»; три робота лепят разные метки на одну заметку.

01Sortir du cadre

Il existe un dictionnaire établi de 14 « cadres » — économie, sécurité, légalité, morale, qualité de vie, identité culturelle, opinion publique, politique, et ainsi de suite. Il vient de la science politique et sert dans la recherche sur les médias depuis un quart de siècle.

L'idée est claire : deux médias peuvent citer exactement le même ensemble de faits sur un incendie et le présenter différemment — l'un mène avec le coût en argent, l'autre avec la menace pour les habitants. Si l'on sait le mesurer, sous chaque sujet on pourrait écrire : « 18 médias sur 31 l'ont présenté comme une question de sécurité, 7 comme une question économique ».

Nous avons donné la même consigne et les mêmes cent textes d'actualité à trois modèles de développeurs différents — appelons-les A, B et C, où C est nettement plus cher et plus puissant que les autres.

Au début, le résultat semblait encourageant. A et B ont coïncidé sur 76 textes sur cent ; le kappa de Cohen — une statistique qui soustrait les coïncidences dues au hasard — valait 0,71 contre un accord fortuit de 0,17. Pour une tâche à quatorze options, c'est beaucoup.

Puis nous avons ajouté le troisième modèle, et le tableau a changé.

pairecoïncidékappa
A — B76 %0,71
A — C63 %0,57
B — C67 %0,62
les trois à la fois55 %—

La raison se voit dans la façon dont les modèles utilisent le dictionnaire. Sur cette centaine de textes, les deux cadres les plus fréquents de A couvrent 56 %, ceux de B — 52 %, ceux de C — 38 %. Les modèles moins chers versent presque tout dans deux grands paniers (« politique » et « sécurité »), le cher répartit plus largement. Et le plus grand écart est systématique, pas aléatoire : ce que A a appelé politique neuf fois, C l'a vu comme réputation internationale.

Que deux modèles s'accordent n'est nullement une preuve de justesse. C'est au mieux une borne supérieure du sens de la tâche.

02L'humain comme référence

Nous avons alors fait ce que ces projets ne font d'ordinaire pas : nous avons demandé à un humain d'annoter quarante textes à l'aveugle — sans le nom du média et sans les réponses des modèles. C'est cela, la référence.

annotateurcoïncidé avec l'humainkappaintervalle à 95 %
A55 %0,440,28 … 0,60
B55 %0,450,28 … 0,63
C (cher)57 %0,510,35 … 0,67

Les intervalles se recouvrent entièrement : sur quarante textes, « le modèle cher est meilleur » n'est pas établi. L'argent n'a pas acheté de précision.

Et l'hypothèse « C répartit le dictionnaire plus largement, il a sans doute raison » ne s'est pas confirmée non plus : sur ces quarante textes, les deux cadres les plus fréquents de l'humain couvrent 55 % — juste entre les 68 % de A et les 40 % de C. Le modèle bon marché écrase, le cher fragmente, l'humain ne fait ni l'un ni l'autre.

03Quand il vaut mieux dire « non »

C'est ici que cela devient le plus intéressant. Nous avons décomposé l'erreur en deux parties.

18 %
des textes que l'humain a marqués « pas de cadre ici » (7 sur 40)
0 %
le modèle A ne s'est abstenu aucune fois sur les 40 textes

Or la consigne autorisait explicitement une réponse vide. Les modèles ne s'en sont tout simplement pas servis. D'où une décomposition qui explique tout :

Autrement dit, la tâche que le modèle résout réellement n'est pas « quel cadre est ici » mais « choisis quelque chose dans la liste ». Il ne sait pas dire « rien ».

04Nous avons essayé de réparer cela

L'hypothèse était : le modèle sait distinguer, mais pas s'abstenir, et cela se soigne par la formulation. Nous avons réécrit la consigne de deux façons : la première met l'abstention en avant et la nomme une réponse ordinaire, la seconde ajoute une vérification explicite en deux étapes.

consigneabstentions sur 40précision là où il y a un cadre
humain7 (18 %)—
d'origine0 (0 %)67 %
« l'abstention est une réponse ordinaire »26 (67 %)31 %
« décide en deux étapes »36 (92 %)9 %

La consigne ne calibre pas le modèle, elle le bascule dans l'autre extrême. La part d'abstentions suit l'inclinaison du texte de la consigne, pas le contenu des nouvelles. Et la précision sur les textes qui ont un cadre chute de concert : le modèle se met à s'abstenir précisément là où il ne faut pas. Dans cette plage, il n'existe pas de réglage qui donne les deux.

Il y a une dernière touche. Nous avons lancé deux fois la même consigne d'origine sur le même modèle, aléa désactivé. Premier passage : zéro abstention. Deuxième : cinq. La grandeur qu'on proposait de montrer au lecteur varie d'un passage à l'autre.

05À la recherche de « l'homme de paille »

Nous avons aussi cherché d'autres techniques dans les dépêches. Il existe un dictionnaire de techniques issu de la recherche sur la propagande — langage chargé, étiquetage, appel à la peur, faux dilemme, « et vous alors », l'homme de paille (une substitution : on prête à l'adversaire un argument volontairement faible ou déformé et on le réfute triomphalement, comme si c'était sa position). Les trouver dans un texte est difficile pour tout le monde : même les systèmes très spécialisés, conçus exactement pour cela et concourant sur des bancs d'essai scientifiques, n'atteignent qu'un F1 ≈ 0,35–0,40.

Le F1 est une note globale de « recherche dans le texte » sur une échelle de 0 à 1 : il ramène en un seul nombre la précision (quelle part du trouvé est réelle, pas une fausse alerte) et le rappel (combien de techniques réelles ont été attrapées). 0,35–0,40, c'est bas : même les meilleurs systèmes se trompent à peu près aussi souvent qu'ils réussissent. Autrement dit, le plafond est bas pour la tâche elle-même, pas seulement pour nos modèles.

Techniques de persuasion : F1 contre l'humain. Les trois modèles sont au bas de la zone ou en dessous. Le « plafond », ce sont les meilleurs systèmes spécialisés sur des bancs d'essai scientifiques.
Meilleurs systèmes (plafond)~0,38
A0,33
B0,23
C (cher)0,21
annotateurprécisionrappelF1
A0,360,300,33
B0,200,270,23
C (cher)0,210,200,21

« Langage chargé » : l'humain l'a marqué dans 6 textes sur quarante, les modèles — dans 16, 26 et 18. Un excès de trois à quatre fois. Le modèle juge chargé presque tout langage vivant.

« Doute » : l'humain l'a marqué 6 fois, les modèles — 0, 3 et 1 fois, et zéro intersection. Sous le même mot, l'humain et le modèle comprennent des choses différentes.

Il vaut la peine de dire à part pourquoi c'est plus dangereux qu'une erreur de cadre. L'affirmation « le média n'a pas cité le fait numéro quatre », le lecteur peut la vérifier lui-même en une minute. L'affirmation « le média a employé un appel à la peur » est un jugement de valeur sur une organisation, et on ne peut pas la vérifier autrement qu'en y croyant. Mettre cela à côté du nom d'un média avec un F1 de 0,2–0,33, c'est faire passer du bruit pour une accusation.

06À lire puis brûler

Les marqueurs de présentation et les techniques de persuasion, nous ne les avons pas montrés au public, bien qu'ils aient été calculés, mesurés et coupés au bout d'un jour. Dans le produit ne sont restées que les métriques que le lecteur peut vérifier lui-même : qui a écrit, combien de médias, quels faits sont confirmés de façon indépendante, quel fait manque chez qui.

Nous estimons que c'est le bon aboutissement, et que le publier importe plus que d'en publier un joli. Les résultats négatifs dans ce domaine ne sont presque jamais publiés : un produit qui a tenté de mesurer la présentation par un modèle et n'y est pas parvenu se contente d'ordinaire de sortir la métrique et de taire sa qualité.

07Trois conclusions transposables à d'autres tâches

C'est pourquoi digesta n'a ni « optique de présentation » ni « indice de manipulation » — seulement ce qui peut être vérifié : combien de médias, quels faits sont confirmés de façon indépendante et quel fait manque chez qui.


Méthode et réserves

Échantillon. 100 textes d'actualité des 2–3 septembre 2026, un de chacun de cent médias différents, 21 espaces médiatiques. Longueur médiane — environ 80 mots.

Annotateurs. Trois modèles de trois développeurs différents, la même consigne, aléa désactivé. La référence humaine — 40 textes, annotés par le propriétaire du produit à l'aveugle (sans le nom du média et sans les réponses des modèles).

La limite principale : une seule référence. C'est l'annotation d'une seule personne, pas l'avis concerté de plusieurs. Une partie des écarts « modèle contre humain » sont en réalité « humain contre autre humain ». La conclusion porte sur le fait que les modèles ne reproduisent pas un lecteur attentif donné, pas sur l'existence d'une annotation unique et vraie.

Deuxième : quarante textes. Les intervalles de confiance sont larges. Des écarts de quelques points de pourcentage entre modèles sont ici indiscernables.

Troisième : les consignes pour tester l'abstention ont été écrites sans regarder où précisément l'humain s'était abstenu. Mais la part cible de 18 % était connue, donc une confirmation définitive exige un nouveau bloc à l'aveugle.

Ce que nous n'avons pas testé. Les modèles spécialisés, entraînés sur des corpus de cadres annotés — ils existent et tiennent mieux sur leur propre tâche. Notre conclusion porte sur les modèles généralistes avec une consigne dans le prompt, c'est-à-dire sur la façon dont cette tâche est résolue dans les produits aujourd'hui.