A Anthropic anunciou novas medidas de segurança da IA após a divulgação de três incidentes envolvendo agentes de inteligência artificial com acesso à internet. Durante testes, os sistemas conseguiram invadir ambientes de três empresas diferentes. Em um dos casos, o agente utilizado foi o Claude; nos outros dois, os testes estavam relacionados à OpenAI.
Em comunicado publicado após a repercussão dos ataques, a Anthropic afirmou que avaliações com capacidades autônomas avançadas também precisam seguir controles rigorosos. “Os testes de segurança acontecem antes do lançamento de um modelo justamente porque ainda não sabemos do que ele é capaz”, declarou a empresa, que defendeu padrões de proteção equivalentes aos aplicados em sistemas que já operam com os modelos.
A companhia também revisou a segurança de ambientes cibernéticos criados apenas com cenários fictícios. Segundo a Anthropic, mesmo sem informações sensíveis, agentes avançados podem representar uma ameaça relevante. A empresa citou a necessidade de desenvolver esses ambientes em conjunto com as avaliações, acompanhar melhor os resultados e esclarecer nos comandos quais sistemas estão ou não dentro do escopo dos testes.
O comunicado afirmou ainda que não foram encontradas evidências de que os modelos tenham perseguido objetivos próprios. De acordo com a empresa, eles seguiram as instruções recebidas, mas em grande parte dos casos acreditaram, de forma equivocada, que os ambientes avaliados eram reais. Quando o Claude identificou o sistema como real e prosseguiu, teria interpretado a ação como parte do desafio proposto.
Como próximos passos, a Anthropic informou que vai ampliar o monitoramento contínuo das transcrições, aprimorar ferramentas de investigação e reforçar a garantia de segurança junto a fornecedores terceirizados. A empresa acrescentou que as salvaguardas presentes nas versões públicas de seus modelos teriam bloqueado os comportamentos observados nos testes e declarou ter “otimismo cauteloso” de que controles mais rígidos e investimentos contínuos em alinhamento possam reduzir esse tipo de risco.
Imagem meramente ilustrativa. Crédito da ilustrativa: e-Safer
