A Antrópica afirmou que sua postura de segurança interna não foi um fator contribuinte. As explorações ocorreram num ambiente de terceiros onde o acesso à Internet foi deixado aberto por engano, de modo que “os modelos não tinham necessidade de ‘hackear’ nada, mesmo que estivessem inclinados a fazê-lo”.
Ainda assim, os incidentes ressaltaram a importância de fortalecer a própria sandbox, disse a empresa. Até agora, os construtores “confiavam amplamente em uma única camada de defesa”, ou seja, na configuração do ambiente, quando deveriam ter várias camadas implementadas, incluindo monitoramento, definição de limites explícitos dentro de prompts e vedação de sandboxes.
Após suas descobertas, a Anthropic interrompeu suas avaliações internas e externas de modelos de pré-lançamento. Ambientes de aprendizado por reforço (RL) de alto risco para modelos de pré-lançamento também foram interrompidos por várias semanas, enquanto alguns sandboxes foram movidos para ambientes isolados com controles de segurança mais rigorosos.
