A Anthropic informou que seu modelo de IA Claude realizou ações adicionais não intencionais nos sistemas digitais de organizações externas, incluindo o envio de uma denúncia falsa em um caso de homicídio da polícia, o que levou a administração Trump a emitir um alerta para que empresas de inteligência artificial protejam seus sistemas.

Em um relatório detalhando incidentes anteriormente não divulgados, a Anthropic listou quatro tipos de comportamentos não intencionais que a IA demonstrou, incluindo explorar falhas básicas em softwares para executar comandos, enviar formulários que não deveria e burlar restrições para acessar certos dados públicos.

Em um exemplo de comportamento inadequado encontrado, a Anthropic disse que seu modelo Claude Haiku 4.5 enviou uma denúncia a um departamento de polícia local sobre um homicídio, afirmando no formulário: “Posso ter informações sobre este caso” e “Lembro-me de ter visto alguém com a descrição na área”, sem preencher os campos de nome e contato do site. O Departamento de Polícia da Filadélfia divulgou o incidente em um comunicado à imprensa, informou a empresa.

Os agentes de IA da Anthropic também enviaram 20 solicitações de visto por meio de um formulário disponível publicamente no site do Departamento de Estado, segundo um porta-voz do órgão. Todas as solicitações estavam incompletas e, portanto, não foram processadas, acrescentou o porta-voz. O New York Times noticiou anteriormente o caso dos pedidos de visto.

A Anthropic e sua rival, OpenAI, revelaram uma série de incidentes nos últimos meses envolvendo seus modelos de IA agindo de formas não intencionais, desde comportamentos como os descritos no relatório de sexta-feira até invasões de sites de terceiros. Essas revelações têm alimentado preocupações sobre os riscos de segurança da IA de ponta.

A empresa disse que alguns dos novos casos envolviam sites administrados por agências governamentais nos níveis federal, estadual e municipal, sem especificar quais agências. O relatório não nomeou as entidades externas envolvidas, o que, segundo a Anthropic, foi a pedido de algumas das partes afetadas.

A Anthropic afirmou no relatório que considera esse comportamento menos grave do que alguns outros incidentes anteriores envolvendo sua IA. “Os casos que identificamos até hoje nessas categorias tiveram impacto mínimo no mundo real”, escreveu a empresa.

A Anthropic também disse que informou a Casa Branca sobre esses casos e notificou cada agência envolvida.

Na sexta-feira, autoridades da administração Trump afirmaram que agora exigirão que as empresas de IA notifiquem as partes afetadas e resolvam incidentes de segurança envolvendo seus modelos.

“No início do dia, a Anthropic contatou a Força SI para divulgar os detalhes de vários incidentes anteriores que descobriu no final de setembro, envolvendo o uso não autorizado e fraudulento de sistemas governamentais e outros”, disse a Casa Branca em comunicado da Força de Superinteligência (Super Intelligence Force), uma nova unidade governamental para supervisionar o desenvolvimento e a segurança da IA.

“A empresa nos informou que esses eventos ocorreram no passado, a atividade cessou e não há atividade semelhante em andamento”, dizia o comunicado.

O Axios noticiou anteriormente a exigência do governo.

Como resultado desses incidentes descobertos, a Anthropic disse na sexta-feira que restringiu alguns tipos de acesso à internet para seus modelos de IA durante a fase de testes de seu processo de treinamento.

(Atualizações para incluir confirmação do Departamento de Estado sobre pedidos de visto no quarto parágrafo)

© 2026 Bloomberg L.P.

The post Modelo de IA da Anthropic “saiu do controle” e enviou denúncia falsa à polícia appeared first on InfoMoney.