A Anthropic divulgou uma falha importante de segurança em seu relatório de risco de 14 de agosto, observando que suas plataformas de feedback humano operaram sem os classificadores de bloqueio de armas biológicas por onze meses. A empresa primeiro implantou as salvaguardas em maio de 2025, mas a partir desse ponto até abril de 2026, uma flag desativou tanto o comportamento de bloqueio quanto o registro de conteúdo potencialmente perigoso.

Durante o período, cerca de 50.000 contratados externos acessaram as plataformas e trocaram aproximadamente 133 milhões de prompts e respostas. A Anthropic confiou em fornecedores externos para verificar esses usuários, mas muitos fornecedores não tinham processos de triagem capazes de parar mesmo os atores de ameaça de armas biológicas mais básicos (CB-1). A maioria dos contratados pôde manter conversas abertas em vez de ser limitada a conjuntos de respostas fixas.

A revisão interna da Anthropic executou o Claude Sonnet 5 em cada turno humano no período afetado, flagrando 1.197 transcritos como de alto risco. Desses, 757 originaram-se das próprias equipes da Anthropic na mesma infraestrutura; os 440 restantes vieram de exercícios de red teaming deliberados. A equipe examinou todos os 62 transcritos de alto risco não-Anthropic e uma amostra aleatória de 30 outros. Eles não encontraram nenhuma utilização claramente preocupante, embora tenham identificado um punhado de conversas potencialmente de uso duplo. A empresa disse que o curto comprimento da maioria das interações torna um risco real improvável, mas reconheceu que a lacuna aumenta a probabilidade de questões semelhantes e não descobertas.

Segunda violação envolvendo Mythos Preview

Em abril de 2026, uma dica externa alertou a Anthropic de que alguns contratados em um fornecedor de rotulagem de dados haviam explorado uma falha para obter uma chave de API. A chave permitiu que eles executem modelos fora de suas tarefas atribuídas, incluindo o Mythos Preview, um dos sistemas mais capazes da Anthropic. O caminho de acesso não autorizado permaneceu aberto por várias semanas, e o Mythos Preview operou sem os classificadores biológicos por aproximadamente duas semanas. A Anthropic fechou o vetor dentro de 90 minutos após saber da violação e o fechou no mesmo dia. Nenhum peso de modelo, dados de cliente ou ativos de rede central foram comprometidos.

O relatório também atualiza a classificação de risco de desalinhamento da Anthropic. A empresa aumentou sua estimativa de dano catastrófico de desalinhamento em configurações de alto risco de "muito baixo" em fevereiro para "baixo" no relatório de agosto, citando divulgações de incidentes recentes em avaliações de segurança cibernética em vez de novas evidências de comportamento de modelo. A Anthropic esclareceu que a mudança reflete incerteza aumentada.

Entre as divulgações, a Anthropic anunciou um modelo interno não lançado chamado Model 2. O modelo pontua cerca de 1,5 pontos mais alto no índice de capacidade da empresa do que seu modelo anterior de bandeira, o Mythos 5, mas a Anthropic não tem planos de enviá-lo. A empresa também revisou seu gatilho de arma nova, agora cobrindo a IA que pode "substituir funcionalmente" a expertise humana escassa em vez de apenas "ajudar significativamente" atores de ameaça.

A auditoria interna da Anthropic foi parcialmente revisada por seu próprio modelo Claude, que flagrou três áreas onde o registro público era menos completo do que a avaliação interna. A empresa disse que as críticas foram justas e que auditorias externas ainda não foram solicitadas, apesar da autoridade do Long-Term Benefit Trust para exigí-las.

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.