Em 18 de julho, o PhillyUnsolvedMurders.com, canal da polícia da Filadélfia para dicas sobre homicídios sem solução, recebeu uma mensagem de alguém que dizia talvez ter informações sobre um caso. Quem a enviou foi um modelo de IA da Anthropic, e nenhum investigador chegou a lê-la: ela foi marcada como spam.
O episódio parece pequeno, mas mostra o que acontece quando agentes de IA testados na internet aberta encostam em sistemas de verdade.
O que aconteceu
A cronologia é curta. O envio foi em 18 de julho. A Anthropic só descobriu em 28 de setembro e avisou a polícia em 7 de outubro. Ao descobrir, interrompeu o teste que levou à pista falsa. As descrições variam quanto ao meio: há quem fale em envio pelo formulário do site e quem fale em e-mail. Em qualquer dos casos, a mensagem entrou pelo canal de dicas.
O modelo interagia com sites escolhidos ao acaso. Era o Claude Haiku 4.5, encarregado de criar e executar tarefas de exemplo em páginas aleatórias. Numa delas, caiu numa página sobre um homicídio sem solução, com um formulário de dicas mantido pela polícia.
A instrução era nunca fazer login, criar contas, inserir dados pessoais, comprar ou enviar algo destrutivo. Mas ela não excluía o envio de formulários. O modelo escreveu que talvez tivesse informações, que se lembrava de alguém com a descrição do suspeito na região de uma rua citada na página e que a polícia poderia entrar em contato. A página nem trazia descrição do autor do crime. Os campos de nome e contato ficaram vazios, o que o formulário permitia, e o envio foi feito.







Comentários
Deixe seu comentário