El Instituto de Lengua Estonia publicó un benchmark integral que mide cómo resisten los grandes modelos de lenguaje (LLM) a la propaganda rusa. Los modelos de peso abierto encabezaron la lista, con Nvidia's Nemotron y Alibaba's Qwen entregando resultados comparables a los de Anthropic. OpenAI's GPT-5.4 emergió como el sistema con la puntuación más alta, etiquetando el 54 por ciento de sus respuestas como "Exemplares" y obteniendo una puntuación media de 88.9.
Los modelos de frontera más recientes muestran una mejora notable con respecto a sus predecesores. Claude 3.5 Haiku, lanzado en 2024, registró una calificación media de 73.1, lo que lo colocó en el tercio inferior de los modelos evaluados en 2026. Por contraste, los modelos más antiguos de solo unos años atrás lucharon por alcanzar niveles de resistencia similares. La tendencia ascendente sugiere que los desarrolladores están priorizando cada vez más las salvaguardas contra la desinformación patrocinada por el estado.
El desempeño de Google, sin embargo, sigue siendo mixto. Los benchmarks detallados del instituto revelan que Gemini 2.5 Pro, el modelo más resistente a la propaganda de la empresa hasta la fecha, obtuvo una puntuación media de 82, pero su susceptibilidad a las sugerencias maliciosas plantea preocupaciones. Su sucesor, Gemini 3.5 Flash, cayó a una puntuación media de 73, similar a la de los modelos de Anthropic lanzados dos años antes. La caída es especialmente pronunciada cuando el modelo se consulta en ruso; las puntuaciones en ese idioma son significativamente más bajas que en inglés.
Otros sistemas de peso abierto exhiben debilidades similares específicas del idioma. Moonshot's Kimi K2 y StepFun's Step 3.5 Flash también vieron disminuir sus puntuaciones de resistencia cuando se les sometió a pruebas con sugerencias en ruso. El patrón apunta a un desafío más amplio: muchos LLM, a pesar de su sólido desempeño general, carecen de la comprensión lingüística y cultural matizada necesaria para detectar la propaganda en varios idiomas.
Más allá de los números brutos, el estudio cita la investigación del profesor Gregory Asmolov de King's College, quien argumenta que el gobierno ruso está aprovechando alianzas técnicas con naciones del BRICS para influir en los modelos de IA. Al incorporar puntos de vista "sensibles culturalmente" en los datos de entrenamiento, Moscú espera moldear cómo los LLM interpretan el contenido políticamente cargado. El benchmark estonio sirve, por lo tanto, no solo como una métrica de desempeño, sino también como una advertencia sobre la manipulación geopolítica de la IA.
Los observadores de la industria señalan que el énfasis del benchmark en las pruebas multilingües podría impulsar los ciclos de desarrollo futuros. Si los desarrolladores integran defensas más robustas entre idiomas, la brecha entre la resistencia solo en inglés y la multilingüe puede disminuir. Por ahora, los datos sugieren que los modelos de peso abierto están a la vanguardia, mientras que algunos de los jugadores propietarios más grandes aún tienen trabajo por hacer.
Las partes interesadas, desde formuladores de políticas hasta investigadores de IA, están observando los resultados de cerca. El benchmark ofrece una yarda concreta para medir el progreso, pero también subraya la necesidad de vigilancia continua a medida que los actores estatales perfeccionan sus tácticas de propaganda. A medida que los LLM se integran más en la comunicación diaria, asegurarse de que puedan discernir y rechazar la desinformación, especialmente en idiomas más allá del inglés, sigue siendo una frontera crítica.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.