digesta Solo señal. Sin ruido
← Todos los artículos

Humano contra modelo: cómo leímos las noticias con redes neuronales

Hoy se acostumbra a encargar a un modelo de lenguaje cualquier tarea que se pueda formular con palabras: «Determina bajo qué aspecto el medio presenta el suceso» o «Encuentra en el texto las técnicas de persuasión o manipulación».

Intentamos hacer ambas cosas con un flujo real de noticias y luego comprobamos el resultado desde el punto de vista de un humano. Y decidimos no mostrar ninguna de las dos a los lectores. Abajo está el porqué, con cifras. Sí, es un informe de un resultado negativo, de los que se publican pocos, aunque sean más útiles que muchos positivos.

Человек с пустым ярлыком и лотком «ничего»; три робота лепят разные метки на одну заметку.

01Salirse del marco

Existe un diccionario asentado de 14 «marcos» — economía, seguridad, legalidad, moral, calidad de vida, identidad cultural, opinión pública, política, y así sucesivamente. Viene de la ciencia política y se usa en la investigación de medios desde hace un cuarto de siglo.

La idea es clara: dos medios pueden nombrar exactamente el mismo conjunto de hechos sobre un incendio y presentarlo de forma distinta — uno abre con el coste en dinero, otro con la amenaza para los vecinos. Si se sabe medir, bajo cada tema podría escribirse: «18 medios de 31 lo presentaron como una cuestión de seguridad, 7 como una cuestión económica».

Dimos la misma instrucción y los mismos cien textos de actualidad a tres modelos de distintos desarrolladores — llamémoslos A, B y C, donde C es notablemente más caro y potente que los demás.

Al principio el resultado parecía alentador. A y B coincidieron en 76 textos de cien; la kappa de Cohen — una estadística que resta las coincidencias por azar — valía 0,71 frente a un acuerdo fortuito de 0,17. Para una tarea con catorce opciones, es mucho.

Luego añadimos el tercer modelo, y el panorama cambió.

parcoincidiókappa
A — B76 %0,71
A — C63 %0,57
B — C67 %0,62
los tres a la vez55 %—

La razón se ve en cómo usan los modelos el diccionario. En este centenar de textos, los dos marcos más frecuentes de A cubren el 56 %, los de B el 52 %, los de C el 38 %. Los modelos más baratos lo vuelcan casi todo en dos grandes cestos («política» y «seguridad»), el caro reparte más ancho. Y la mayor discrepancia es sistemática, no aleatoria: lo que A llamó política nueve veces, C lo vio como reputación internacional.

Que dos modelos coincidan no es ninguna prueba de acierto. Es, en el mejor de los casos, una cota superior del sentido de la tarea.

02El humano como referencia

Entonces hicimos lo que estos proyectos no suelen hacer: pedimos a un humano que anotara cuarenta textos a ciegas — sin el nombre del medio y sin las respuestas de los modelos. Esa es la referencia.

anotadorcoincidió con el humanokappaintervalo al 95 %
A55 %0,440,28 … 0,60
B55 %0,450,28 … 0,63
C (caro)57 %0,510,35 … 0,67

Los intervalos se solapan por completo: en cuarenta textos, «el modelo caro es mejor» no está establecido. El dinero no compró precisión.

Y la hipótesis «C reparte el diccionario más ancho, seguramente tiene razón» tampoco se confirmó: en estos cuarenta textos los dos marcos más frecuentes del humano cubren el 55 % — justo entre el 68 % de A y el 40 % de C. El modelo barato colapsa, el caro fragmenta, el humano no hace ni lo uno ni lo otro.

03Cuándo es mejor decir «no»

Aquí empieza lo más interesante. Descompusimos el error en dos partes.

18 %
de los textos el humano marcó «aquí no hay marco» (7 de 40)
0 %
el modelo A no se abstuvo ni una vez en los 40 textos

Y eso que la instrucción permitía explícitamente una respuesta vacía. Los modelos simplemente no la usaron. De ahí una descomposición que lo explica todo:

Es decir, la tarea que el modelo resuelve en realidad no es «qué marco hay aquí» sino «elige algo de la lista». No sabe decir «nada».

04Intentamos arreglarlo

La hipótesis era: el modelo sabe distinguir, pero no abstenerse, y eso se cura con la formulación. Reescribimos la instrucción de dos maneras: la primera pone la abstención por delante y la nombra una respuesta corriente, la segunda añade una comprobación explícita en dos pasos.

instrucciónabstenciones de 40precisión donde hay marco
humano7 (18 %)—
original0 (0 %)67 %
«la abstención es una respuesta corriente»26 (67 %)31 %
«decide en dos pasos»36 (92 %)9 %

La instrucción no calibra el modelo, lo lanza al otro extremo. La proporción de abstenciones sigue la inclinación del texto de la instrucción, no el contenido de las noticias. Y la precisión en los textos que sí tienen marco cae al mismo compás: el modelo empieza a abstenerse justo donde no debe. En este rango no existe un ajuste que dé ambas cosas.

Hay un último toque. Ejecutamos dos veces la misma instrucción original en el mismo modelo con el azar desactivado. Primera pasada: cero abstenciones. Segunda: cinco. La magnitud que se proponía mostrar al lector varía de una pasada a otra.

05En busca del «hombre de paja»

Buscamos también otras técnicas en los despachos de noticias. Existe un diccionario de técnicas de la investigación sobre propaganda — lenguaje cargado, etiquetado, apelación al miedo, falso dilema, «y tú más», el hombre de paja (una sustitución: se atribuye al adversario un argumento deliberadamente débil o distorsionado y se refuta triunfalmente, como si esa hubiera sido su postura). Encontrarlas en un texto es difícil para todos: incluso los sistemas muy especializados, hechos precisamente para ello y compitiendo en bancos de prueba científicos, alcanzan solo un F1 ≈ 0,35–0,40.

El F1 es una puntuación general de «búsqueda en el texto» en una escala de 0 a 1: reduce a un solo número la precisión (cuánto de lo hallado es real, no una falsa alarma) y la exhaustividad (cuántas técnicas reales se lograron captar). 0,35–0,40 es bajo: incluso los mejores sistemas fallan más o menos tan a menudo como aciertan. Dicho de otro modo, el techo es bajo para la tarea misma, no solo para nuestros modelos.

Técnicas de persuasión: F1 contra el humano. Los tres modelos están en el extremo inferior de la zona o por debajo. El «techo» son los mejores sistemas especializados en bancos de prueba científicos.
Mejores sistemas (techo)~0,38
A0,33
B0,23
C (caro)0,21
anotadorprecisiónexhaustividadF1
A0,360,300,33
B0,200,270,23
C (caro)0,210,200,21

«Lenguaje cargado»: el humano lo marcó en 6 textos de cuarenta, los modelos — en 16, 26 y 18. Un exceso de tres a cuatro veces. El modelo considera cargado casi cualquier lenguaje vivo.

«Duda»: el humano la marcó 6 veces, los modelos — 0, 3 y 1 veces, y cero intersecciones. Bajo la misma palabra, el humano y el modelo entienden cosas distintas.

Vale la pena decir aparte por qué esto es más peligroso que un error de marco. La afirmación «el medio no nombró el hecho número cuatro» el lector puede comprobarla él mismo en un minuto. La afirmación «el medio empleó una apelación al miedo» es un juicio de valor sobre una organización, y no hay manera de comprobarla salvo creyéndola. Poner eso al lado del nombre de un medio con un F1 de 0,2–0,33 es hacer pasar el ruido por una acusación.

06Léase y quémese

Los indicios de presentación y las técnicas de persuasión no se los mostramos al público, aunque se calcularon, se midieron y se apagaron al cabo de un día. En el producto quedaron solo las métricas que el lector puede comprobar por sí mismo: quién lo escribió, cuántos medios, qué hechos están confirmados de forma independiente, qué hecho le falta a quién.

Consideramos que este es el desenlace correcto, y que publicarlo importa más que publicar uno bonito. Los resultados negativos en este campo casi nunca se publican: un producto que intentó medir la presentación con un modelo y no lo logró suele limitarse a sacar la métrica y callar sobre su calidad.

07Tres conclusiones que se trasladan a otras tareas

Por eso digesta no tiene ni «óptica de presentación» ni «índice de manipulación» — solo lo que se puede comprobar: cuántos medios, qué hechos están confirmados de forma independiente y qué hecho le falta a quién.


Método y reservas

Muestra. 100 textos de actualidad de los días 2–3 de septiembre de 2026, uno de cada uno de cien medios distintos, 21 espacios mediáticos. Longitud mediana — unas 80 palabras.

Anotadores. Tres modelos de tres desarrolladores distintos, la misma instrucción, azar desactivado. La referencia humana — 40 textos, anotados por el propietario del producto a ciegas (sin el nombre del medio y sin las respuestas de los modelos).

La limitación principal: una sola referencia. Es la anotación de una sola persona, no la opinión consensuada de varias. Parte de las discrepancias «modelo contra humano» son en realidad «humano contra otro humano». La conclusión trata de que los modelos no reproducen a un lector atento concreto, no de que exista una única anotación verdadera.

Segunda: cuarenta textos. Los intervalos de confianza son amplios. Diferencias de unos pocos puntos porcentuales entre modelos son aquí indistinguibles.

Tercera: las instrucciones para probar la abstención se escribieron sin mirar dónde exactamente se abstuvo el humano. Pero la proporción objetivo del 18 % era conocida, así que una confirmación definitiva exige un bloque a ciegas nuevo.

Lo que no probamos. Los modelos especializados, entrenados en corpus de marcos anotados — existen y aguantan mejor en su propia tarea. Nuestra conclusión trata de los modelos generales con una instrucción en el prompt, es decir, de cómo se resuelve esta tarea en los productos hoy.