Notícias de IA

Microsoft cria teste que checa se agentes de IA realmente fizeram o trabalho

O ThinkingBox avalia o estado final de bancos de dados, não apenas a resposta da IA. O teste reúne 507 tarefas empresariais e repete cada uma 20 vezes.

3 min de leitura
Arte oficial do Microsoft ThinkingBox com o nome da ferramenta sobre fundo verde claro.
Imagem oficial de divulgação: Microsoft e Hugging Face.

O que você precisa saber

  • O ThinkingBox verifica o que o agente deixou registrado no sistema, em vez de considerar apenas a resposta final ou as chamadas de ferramentas.
  • O benchmark reúne 507 fluxos empresariais sintéticos e repete cada tarefa 20 vezes a partir do mesmo estado inicial.
  • Código, ambiente e dados foram publicados, mas a execução exige Linux ou WSL, Python, Docker e modelos configurados.

Entenda a notícia

A Microsoft e a Hugging Face publicaram em 3 de outubro o ThinkingBox, um ambiente para testar se agentes de IA concluíram tarefas empresariais de verdade. A proposta é olhar o estado final do sistema, como um banco de dados ou um chamado de atendimento, em vez de confiar apenas no texto que o agente escreveu.

Um exemplo do estudo mostra um agente que consultou um pedido atrasado, abriu um chamado e respondeu ao cliente sem erros aparentes. Mesmo assim, ele encerrou o caso como resolvido enquanto a entrega continuava com problema. As chamadas de ferramentas eram válidas, mas o resultado registrado estava errado.

O ThinkingBox-Bench reúne 507 fluxos sintéticos de varejo, seguro de automóveis, viagens, banco digital e consultoria. Cada tarefa começa com um ambiente limpo, é executada 20 vezes e termina com verificações programadas sobre campos alterados, efeitos extras e ações que ficaram faltando. Os clientes e situações do conjunto são reconstruções, não casos reais.

Em uma análise comum com 121.680 tentativas válidas de 12 modelos, 79.853 falharam nas verificações. Entre essas falhas, 67,24% ainda terminaram normalmente, usaram uma ferramenta capaz de mudar dados e não apresentaram erro final. As checagens encontraram valores errados em 77,61% delas, efeitos extras em 43,30% e efeitos obrigatórios ausentes em 25,36%. Essas categorias podem se sobrepor.

O resultado chama atenção para uma diferença importante: acertar uma vez não significa repetir o acerto de forma confiável. Por isso, o benchmark mede tanto a taxa média de sucesso quanto quantas tarefas passaram nas 20 tentativas. A comparação foi produzida pelos responsáveis pela ferramenta e deve ser lida como uma avaliação específica, não como um ranking definitivo de modelos.

O ambiente, o código e os dados estão disponíveis publicamente. Não há restrição geográfica ao Brasil indicada no anúncio, mas a ferramenta não é um aplicativo pronto para o público geral. Para executar os testes, a documentação pede Linux ou WSL, Python 3.11 ou superior, Docker e pontos de acesso aos modelos usados como agente, usuário simulado e avaliador.

O que muda na prática: uma empresa que usa agentes para alterar pedidos, cadastros, reservas ou pagamentos deve testar o resultado salvo no sistema e repetir o mesmo cenário várias vezes. A resposta convincente da IA não basta. Mudanças difíceis de desfazer também precisam de aprovação humana e de uma verificação final antes de serem confirmadas.

Na fonte

  1. The Agent Said It Was Done. The Database Disagreed.

    Microsoft e Hugging Face · Fonte primária · publicado em 03 out 2026 · consultado em 04 out 2026

  2. One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

    Microsoft Research · Artigo técnico · publicado em 20 ago 2026 · consultado em 04 out 2026

Encontrou algo que precisa de correção? Veja como avisar a Rensen.

Mais para ler