Um pesquisador de segurança demonstrou em 28 de agosto de 2026 que uma tarefa rotineira — pedir ao Claude Code para resumir um site — pode resultar em execução remota de código no computador do desenvolvedor. O ataque explora o que especialistas chamam de Claude Code injeção de prompt via conteúdo web malicioso, e funciona mesmo sem nenhum arquivo suspeito visível no repositório.

O responsável é Johann Rehberger, conhecido como wunderwuzzi, especialista em ataques contra agentes de IA. Os resultados são preocupantes: taxa de sucesso entre 60% e 80%, dependendo da variante testada.

Como funciona o Claude Code injeção de prompt via resumo de site

O ataque não exige código malicioso no repositório. O fluxo completo, etapa por etapa:

  1. O desenvolvedor pede ao Claude Code Opus 5 em Auto Mode que resuma um site — tarefa aparentemente inofensiva.
  2. O servidor malicioso responde com erro HTTP 415, forçando o Claude a usar curl em vez de WebFetch.
  3. O curl baixa um arquivo ZIP contendo arquivos de aparência legítima, um binário decoder-darwin e um módulo Python malicioso struct.py.
  4. O Claude recusa executar o binário suspeito — decisão que parece segura e, na prática, é a armadilha: em vez disso, ele escreve seu próprio decodificador Python.
  5. Ao executar o decodificador dentro do diretório extraído, Python carrega o struct.py malicioso no lugar do módulo padrão da biblioteca — técnica chamada de module shadowing.
  6. O struct.py inicia um processo separado que baixa e executa payload remoto, abrindo conexão de comando e controle C2.

Resultado: a máquina do desenvolvedor está comprometida. Tudo a partir de um simples pedido de resumo.

O paradoxo da Anthropic: 0,00% vs. 80% de sucesso real

A Anthropic havia publicado avaliação mostrando que o Auto Mode do Opus 5 tinha 0,00% de taxa de sucesso em injeções de prompt — baseada em 72 cenários testados por laboratório independente, com 10 execuções cada. O problema: o ataque de Claude Code injeção de prompt de Rehberger não estava entre os 72 cenários.

Portanto, 0,00% no benchmark e 80% de sucesso na prática são ambos tecnicamente verdadeiros. O executivo Boris Cherny havia declarado que a injeção de prompt está largamente resolvida — afirmação que o experimento contradiz. A resposta oficial da Anthropic: o Auto Mode é um recurso de conveniência respaldado por um classificador de melhor esforço, não uma garantia de segurança.

Em outras palavras: o recurso que a empresa destacou como prova de robustez não cobre este cenário de Claude Code injeção de prompt.

Por que isso importa para o seu negócio

Se sua equipe usa Claude Code para analisar repositórios externos, revisar código de terceiros ou acessar referências técnicas online, o Claude Code injeção de prompt é uma ameaça real a considerar antes de adotar o agente em ambientes de produção.

A recomendação dos pesquisadores é clara: agentes autônomos de código não devem ser executados diretamente no ambiente de desenvolvimento principal. Sandboxes isolados, monitoramento de processos iniciados pelo agente e revisão manual de ações críticas são controles obrigatórios para quem usa agentes de IA em fluxos de trabalho reais.

O relatório completo de Rehberger no Embrace The Red documenta as três variantes do ataque e as taxas de sucesso detalhadas por tipo de payload.


Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.

Fonte: The Register