Pesquisadores da Meta AI e da Universidade de Illinois desenvolveram o EvoHarness-RL, uma técnica de treinamento que permite a modelos de linguagem menores executar tarefas complexas de agentes de IA com eficiência comparável aos modelos de fronteira mais caros do mercado.
O resultado mais chamativo: o Qwen3-8B (modelo de 8 bilhões de parâmetros) treinado com EvoHarness-RL atingiu 96,9% de taxa de sucesso em benchmarks de agentes — superando os 96,4% do Claude Opus 4.5, um dos modelos mais avançados e caros disponíveis. Publicado em 28 de agosto de 2026, o trabalho foi coberto pelo VentureBeat.
O problema que o EvoHarness-RL resolve
Agentes de IA eficientes dependem de um "harness" — o sistema de suporte que controla como o modelo acessa ferramentas, organiza memória e toma decisões. O problema atual é duplo:
1. Harnesses manuais não escalam. Cada troca de modelo exige retuning de prompts, redesign de memória e reconfiguração de permissões. É um ciclo caro de engenharia que se repete a cada atualização.
2. Memória acumulativa degrada o raciocínio. Sistemas que simplesmente empilham contexto assumem que mais informação é sempre útil. Em tarefas longas, isso enche a janela com conclusões desatualizadas, tentativas falhas e dados irrelevantes — e o modelo piora progressivamente.
Como funciona o BPE e as meta-ações
O EvoHarness-RL consolida o suporte ao agente em uma interface unificada chamada BPE — três dimensões de estado:
- Belief: estado atual do ambiente (o que é verdadeiro agora)
- Progress: objetivos completos e pendentes
- Experience: conhecimento histórico reutilizável entre tarefas
O agente opera com quatro meta-ações: track (registrar informação), commit (consolidar progresso), recall (recuperar experiência relevante) e note (anotar observações). Isso substitui a memória puramente acumulativa por uma memória dinâmica que descarta o que ficou obsoleto.
O treinamento ocorre em duas fases: ajuste supervisionado inicial e, em seguida, aprendizado por reforço com consciência de custo — o modelo aprende a ser eficiente, não apenas eficaz.
Os números que impressionam
| Modelo | Taxa de sucesso | Melhoria com EvoHarness-RL |
|---|---|---|
| Qwen3-8B | 96,9% | baseline treinado |
| Claude Opus 4.5 | 96,4% | referência frontier |
| GPT-4.1 | baseline + 22,1 pp | com EvoHarness-RL |
| GPT-5 | baseline + 25,7 pp | com EvoHarness-RL |
A técnica melhora mesmo os modelos de fronteira — GPT-5 ganhou 25,7 pontos percentuais com o EvoHarness-RL.
Por que isso importa para o seu negócio
A relevância prática do EvoHarness-RL para empresas e pequenos negócios que usam agentes de IA está no custo. Hoje, implementações de agentes que exigem performance de nível Claude Opus ou GPT-5 custam caro por token. Se um modelo de 8 bilhões de parâmetros — executável localmente ou em API de baixo custo — pode entregar desempenho equivalente, a equação econômica muda radicalmente.
Segundo a Anthropic, o Claude Opus 4.5 custa US$ 15 por milhão de tokens de entrada. Um modelo 8B em hardware próprio pode custar menos de US$ 0,50 por milhão de tokens — uma redução de 97%. Com EvoHarness-RL, essa substituição deixa de ser um compromisso de qualidade.
Para negócios que automatizam processos com agentes (atendimento, análise de dados, geração de relatórios), a técnica abre a porta para infraestrutura própria, sem dependência de APIs de frontier. O artigo original do VentureBeat com todos os detalhes técnicos está disponível em venturebeat.com.
Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.
Fonte: VentureBeat


