El informe de riesgo de Anthropic del 14 de agosto revela que, desde mayo de 2025 hasta abril de 2026, sus plataformas de retroalimentación humana operaron sin los clasificadores diseñados para bloquear la asistencia para armas biológicas. Aproximadamente 50,000 contratistas generaron alrededor de 133 millones de intercambios mientras los filtros y la registración estaban desactivados. Una revisión identificó 1,197 transcritos de alto riesgo, pero el personal no encontró evidencia clara de un uso peligroso. La empresa también reveló un modelo interno, Modelo 2, que no será lanzado, y detalló un segundo incidente en el que una clave de API derivada de un proveedor dio acceso a un modelo poderoso que se ejecutó sin salvaguardas durante dos semanas.
Leer más