Tais falhas acontecem todos os dias. Eles certamente têm acontecido com a IA desde que comecei a lidar com ela em 1985. Os sistemas se comportam mal, os controles ficam mal configurados, alguém decide que uma verificação não é necessária e segue-se um incidente. Troque “agente de IA” por “script”, “trabalho em lote”, “processo de integração” ou “servidor sem patch” e você terá incidentes que ocorreram continuamente ao longo da história da computação. A diferença agora é que o sistema malcomportado pode improvisar, e a papelada que ele deixa parece a abertura de um thriller.

Se um funcionário humano usasse o cartão de crédito de uma empresa para comprar uma ferramenta de scraping, armazenasse arquivos em uma unidade de nuvem pessoal ou coordenasse com colegas de trabalho em um quadro de mensagens não autorizado, não concluiríamos que os humanos são uma ameaça existencial. Concluiríamos que a governação, os controlos de acesso e a monitorização eram inadequados. Foi exatamente isso que aconteceu aqui, com agentes em vez de funcionários. Modelos instáveis ​​foram o gatilho, mas a segurança e a governação fracas foram a causa. O mau comportamento do modelo que permanece contido é um problema de engenharia. O mau comportamento do modelo que passa despercebido durante meses na Internet pública é uma falha de governança (familiar) e que sabemos como consertar.

A parte que me interessa

A parte desta história que considero genuinamente interessante não tem nada a ver com os modelos. É sobre como as pessoas se apegam a esses tipos de incidentes e os usam para apoiar suas próprias crenças. Os relatórios são documentos ambíguos e cheios de nuances. A OpenAI afirma explicitamente que nenhum dos incidentes causou danos significativos e que nenhum indica com que frequência ocorre desalinhamento em seus modelos. Mas a nuance não viaja. No momento em que estes documentos chegaram à Internet, foram despojados das suas ressalvas e reaproveitados como textos de prova para uma narrativa que já existia.