Anthropic reveló una importante falla de seguridad en su informe de riesgo del 14 de agosto, señalando que sus plataformas de retroalimentación humana operaron sin los clasificadores de bloqueo de armas biológicas durante once meses. La empresa desplegó inicialmente las salvaguardas en mayo de 2025, pero desde ese momento hasta abril de 2026, una bandera desactivó tanto el comportamiento de bloqueo como la registración de contenido potencialmente peligroso.
Durante el período de interrupción, alrededor de 50,000 contratistas externos accedieron a las plataformas y intercambiaron aproximadamente 133 millones de solicitudes y respuestas. Anthropic confió en proveedores externos para verificar a estos usuarios, pero muchos proveedores carecían de procesos de selección capaces de detener incluso a los actores de amenazas de armas biológicas más básicos (CB-1). La mayoría de los contratistas podían mantener conversaciones abiertas en lugar de limitarse a conjuntos de respuestas fijas.
La revisión interna de Anthropic ejecutó Claude Sonnet 5 sobre cada turno humano en el período afectado, identificando 1,197 transcritos como de alto riesgo. De estos, 757 provenían de los propios equipos de Anthropic en la misma infraestructura; los 440 restantes provenían de ejercicios de prueba de penetración deliberados. El personal examinó todos los 62 transcritos de alto riesgo no Anthropic y una muestra aleatoria de 30 otros. No encontraron un uso claramente preocupante, aunque identificaron un puñado de conversaciones de uso dual potencial. La empresa dijo que la corta duración de la mayoría de los intercambios hace que un riesgo real en el mundo sea poco probable, pero reconoció que la falla aumenta la probabilidad de problemas similares no detectados.
Segunda violación que involucra a Mythos Preview
En abril de 2026, una pista externa alertó a Anthropic de que unos pocos contratistas en un proveedor de etiquetado de datos habían explotado una falla para obtener una clave de API. La clave les permitió ejecutar modelos fuera de sus tareas asignadas, incluido Mythos Preview, uno de los sistemas más capaces de Anthropic. El camino de acceso no autorizado permaneció abierto durante varias semanas, y Mythos Preview se ejecutó sin los clasificadores biológicos durante aproximadamente dos semanas. Anthropic cerró el vector dentro de 90 minutos de enterarse de la violación y lo cerró el mismo día. No se comprometieron pesos de modelo, datos de clientes ni activos de red central.
El informe también actualiza la calificación de riesgo de desalineación de Anthropic. La empresa aumentó su estimación de daño catastrófico por desalineación en entornos de alto riesgo de "muy bajo" en febrero a "bajo" en el informe de agosto, citando divulgaciones de incidentes recientes en evaluaciones de ciberseguridad en lugar de nueva evidencia de comportamiento de modelo. Anthropic aclaró que el cambio refleja una incertidumbre aumentada.
Entre las divulgaciones, Anthropic anunció un modelo interno no lanzado llamado Modelo 2. El modelo obtiene alrededor de 1,5 puntos más en el índice de capacidad de la empresa que su buque insignia anterior, Mythos 5, pero Anthropic no tiene planes de lanzarlo. La empresa también revisó su disparador de armas nuevas, que ahora cubre la IA que puede "sustituir funcionalmente" la escasa experiencia humana en lugar de simplemente "ayudar significativamente" a los actores de amenazas.
La auditoría interna de Anthropic fue revisada en parte por su propio modelo Claude, que identificó tres áreas en las que el registro público era menos completo que la evaluación interna. La empresa dijo que las críticas eran justas y que las auditorías externas aún no han sido solicitadas, a pesar de la autoridad de la Long-Term Benefit Trust para exigirlas.
Este artículo fue escrito con la asistencia de IA.
News Factory APP - noticias agénticas para impulsar tu SEO y AEO.