Pesquisadores da Meta AI e da Universidade de Illinois desenvolveram o EvoHarness-RL, uma técnica de treinamento que permite a modelos de linguagem menores executar tarefas complexas de agentes de IA com eficiência comparável aos modelos de fronteira mais caros do mercado.

O resultado mais chamativo: o Qwen3-8B (modelo de 8 bilhões de parâmetros) treinado com EvoHarness-RL atingiu 96,9% de taxa de sucesso em benchmarks de agentes — superando os 96,4% do Claude Opus 4.5, um dos modelos mais avançados e caros disponíveis. Publicado em 28 de agosto de 2026, o trabalho foi coberto pelo VentureBeat.

O problema que o EvoHarness-RL resolve

Agentes de IA eficientes dependem de um "harness" — o sistema de suporte que controla como o modelo acessa ferramentas, organiza memória e toma decisões. O problema atual é duplo:

1. Harnesses manuais não escalam. Cada troca de modelo exige retuning de prompts, redesign de memória e reconfiguração de permissões. É um ciclo caro de engenharia que se repete a cada atualização.

2. Memória acumulativa degrada o raciocínio. Sistemas que simplesmente empilham contexto assumem que mais informação é sempre útil. Em tarefas longas, isso enche a janela com conclusões desatualizadas, tentativas falhas e dados irrelevantes — e o modelo piora progressivamente.

Como funciona o BPE e as meta-ações

O EvoHarness-RL consolida o suporte ao agente em uma interface unificada chamada BPE — três dimensões de estado:

  • Belief: estado atual do ambiente (o que é verdadeiro agora)
  • Progress: objetivos completos e pendentes
  • Experience: conhecimento histórico reutilizável entre tarefas

O agente opera com quatro meta-ações: track (registrar informação), commit (consolidar progresso), recall (recuperar experiência relevante) e note (anotar observações). Isso substitui a memória puramente acumulativa por uma memória dinâmica que descarta o que ficou obsoleto.

O treinamento ocorre em duas fases: ajuste supervisionado inicial e, em seguida, aprendizado por reforço com consciência de custo — o modelo aprende a ser eficiente, não apenas eficaz.

Os números que impressionam

ModeloTaxa de sucessoMelhoria com EvoHarness-RL
Qwen3-8B96,9%baseline treinado
Claude Opus 4.596,4%referência frontier
GPT-4.1baseline + 22,1 ppcom EvoHarness-RL
GPT-5baseline + 25,7 ppcom EvoHarness-RL

A técnica melhora mesmo os modelos de fronteira — GPT-5 ganhou 25,7 pontos percentuais com o EvoHarness-RL.

Por que isso importa para o seu negócio

A relevância prática do EvoHarness-RL para empresas e pequenos negócios que usam agentes de IA está no custo. Hoje, implementações de agentes que exigem performance de nível Claude Opus ou GPT-5 custam caro por token. Se um modelo de 8 bilhões de parâmetros — executável localmente ou em API de baixo custo — pode entregar desempenho equivalente, a equação econômica muda radicalmente.

Segundo a Anthropic, o Claude Opus 4.5 custa US$ 15 por milhão de tokens de entrada. Um modelo 8B em hardware próprio pode custar menos de US$ 0,50 por milhão de tokens — uma redução de 97%. Com EvoHarness-RL, essa substituição deixa de ser um compromisso de qualidade.

Para negócios que automatizam processos com agentes (atendimento, análise de dados, geração de relatórios), a técnica abre a porta para infraestrutura própria, sem dependência de APIs de frontier. O artigo original do VentureBeat com todos os detalhes técnicos está disponível em venturebeat.com.


Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.

Fonte: VentureBeat