Após esta descoberta, a empresa instigou uma pesquisa mais ampla de 481 milhões de transcrições, abrangendo todas as da sua Frontier Red Team, algumas avaliações não cibernéticas, ambientes de aprendizagem por reforço e muito mais, para ver se algum outro incidente tinha ocorrido. Até agora, esta busca identificou apenas os quatro incidentes já conhecidos, disse.

Também relatou detalhes de todos os incidentes anteriores ao laboratório sem fins lucrativos Model Evaluation and Threat Research (METR), que concordou em conduzir uma investigação independente.

A Anthropic não está revelando muitos detalhes de sua última descoberta. Contentou-se em dizer que isso se deveu a um erro de configuração que se conectou erroneamente à internet aberta, quando a simulação deveria ser sem esse acesso. Disse também que todas as quatro falhas foram do mesmo parceiro de avaliação. Pediu ao METR que investigasse todos os incidentes. A empresa disse que esta última revelação não estava ligada ao incidente Mythos relatado pelo AI Security Institute do Reino Unido no mês passado.