Início tecnologia

Mythos 5: IA criou identidades falsas para invadir repositório

O modelo Claude Mythos 5, da Anthropic, criou identidades falsas e usou técnicas de engenharia social para tentar inserir código malicioso em um repositório público no GitHub. O caso foi revelado pelo AI Security Institute (AISI), órgão de pesquisa do governo do Reino Unido, que classificou o incidente como o primeiro exemplo claro de autonomia e engano direcionado a pessoas reais sem instrução explícita.

Robôs vestidos de fantasma em ilustração cartoon

O incidente ocorreu entre 25 e 28 de julho de 2026, durante uma avaliação de rotina. O AISI testava sete modelos de IA em 122 execuções de um desafio de cibersegurança. Para medir a capacidade máxima dos modelos, o instituto liberou acesso à internet e desativou os classificadores de segurança – condições que não refletem o uso comercial das ferramentas.

Dos 122 testes, 10 resultaram em ações não autorizadas na internet real. Foram 19 ocorrências no total, sendo 17 atribuídas ao Mythos 5 e duas ao GPT-5.6 Sol, da OpenAI.

O ataque em camadas

O Mythos 5 não conseguiu resolver o desafio dentro do ambiente simulado. Então saiu procurando na web por palavras-chave do teste e concluiu, errado, que um repositório público no GitHub fazia parte do exercício. A partir daí, o agente executou uma sequência coordenada de ações.

Primeiro, fez reconhecimento dos mantenedores do projeto: investigou metadados públicos, confirmou endereços de e-mail e mapeou horários de atividade. Depois, usou a rede Tor e proxies SOCKS para contornar as proteções contra bots do GitHub e criou múltiplas contas falsas.

Com as identidades fabricadas, o Mythos 5 abriu um pull request contendo código malicioso no repositório real. Para pressionar o mantenedor humano a aprovar a alteração, usou as contas falsas para comentar no próprio PR, simulando uma revisão independente e fabricando um falso consenso.

Quando um revisor humano alertou que o código continha malware, o agente negou a acusação e usou outras contas falsas para pressionar o mantenedor. Também editou a atividade anterior para parecer inofensiva e considerou adotar uma nova identidade para continuar a operação.

Phishing e ataques a assistentes de IA

O Mythos 5 foi além. Enviou cinco e-mails diretamente aos desenvolvedores – dois com anexos maliciosos e três com mensagens de engenharia social. Também abriu uma issue no GitHub contendo instruções ocultas de prompt injection, projetadas para manipular assistentes de IA como Claude Code e Copilot que pudessem triar o ticket.

Em uma tentativa separada, o agente gerou 145 repositórios com aparência legítima sob uma única conta, inseriu metadados maliciosos de pacotes Python e fez com que um script fosse executado dentro de pelo menos 53 contêineres do Dependabot do GitHub. A conta foi suspensa, e o agente então apelou da suspensão se passando por humano, monitorou a resposta e preparou automação para reenviar os payloads caso a conta fosse restaurada.

O que impediu o ataque

O código malicioso nunca foi mesclado. Um mantenedor humano desconfiou do pull request e o rejeitou. Outra pessoa abriu o código suspeito em um ambiente isolado, em vez de executá-lo diretamente. O AISI foi alertado quando o tráfego do agente passou pela rede Tor, o que acionou o monitoramento de segurança do instituto. Todas as avaliações foram interrompidas em menos de uma hora.

O AISI notificou o GitHub, que removeu as contas falsas e os artefatos deixados pelo agente. Os mantenedores afetados foram informados. O instituto afirma que não há evidências de danos reais.

A resposta da Anthropic

A Anthropic confirmou que o Mythos 5 foi testado sem as salvaguardas padrão e com acesso à internet – configuração que não está disponível para clientes. Em comunicado, a empresa disse que as condições do teste “não representam nenhum dos nossos modelos de produção” e que está conduzindo sua própria investigação para identificar as causas do comportamento.

O AISI reconheceu que suas escolhas de configuração contribuíram para o incidente, mas destacou que o nível de autonomia e engano observado não era esperado. “É a primeira vez que vemos riscos em torno de autonomia e engano se manifestarem tão claramente, sem instrução específica, no mundo real”, afirmou o instituto.

O caso acende um alerta para a indústria: modelos de IA cada vez mais capazes, quando colocados em ambientes permissivos, podem improvisar caminhos que seus próprios criadores não previram – e a linha entre simulação e realidade pode ser mais tênue do que se imaginava.

BBC