Teto de tokens distorce benchmark de raciocínio matemático de IA

Parar no teto de tokens ou terminar a derivação muda o resultado de benchmarks como AIME e HMMT, aponta estudo do arXiv

Por Marcos Guimarães2 out 2026
Teto de tokens distorce benchmark de raciocínio matemático de IA

O que aconteceu

O artigo "Budget Boundary Effects in Test-Time Mathematical Reasoning" foi submetido ao arXiv em 30 de setembro de 2026 e recebeu o identificador arXiv:2609.38699v1. O estudo examina uma decisão pontual de controladores em tempo de teste: quando um teto cumulativo de tokens cai no meio de uma derivação matemática, o sistema para ali (regra strict) ou deixa a tentativa atual terminar (regra advisory).

Para isolar esse efeito, os autores rodaram replays offline pareados de 19.200 traces públicas. O conjunto reúne 120 problemas das competições AIME, BrUMO e HMMT, submetidos a duas configurações de arquivo de um mesmo modelo. A ordem dos candidatos e o teto de 16 tentativas ficaram fixos ao longo de todos os testes. A escolha da resposta final foi cega a gabaritos e a rótulos de correção, o que impede que o sistema saiba antecipadamente qual tentativa está certa.

Contexto

Raciocínio matemático se consolidou como vitrine para medir a capacidade de modelos de linguagem. A avaliação típica soma quantos problemas de competição o sistema resolve dentro de um orçamento de computação definido antes da execução. O teto cumulativo de tokens é a peça central desse orçamento: ele define quanto o modelo pode gastar pensando antes de entregar uma resposta.

A questão que o artigo levanta é onde esse teto cai. Um limite de 4 mil tokens pode interromper uma derivação pela metade, e a política adotada nesse ponto muda o que o seletor de respostas tem em mãos. Sob a regra strict, o sistema paga por um prefixo inacabado que o seletor baseado apenas em tentativas concluídas não consegue aproveitar.

Por que importa

Benchmarks como AIME e HMMT são usados para comparar modelos e orientar decisões de produto. Quando duas avaliações declaram o mesmo teto, mas tratam a fronteira de formas diferentes, a comparação de acurácia deixa de ser limpa. No teto de 4k, a maior parte do ganho de acurácia da regra advisory vem de substituir abstenções por respostas corretas, segundo o estudo. Parte da diferença entre sistemas pode vir da política de parada, e não da capacidade do modelo.

Impacto

As comparações por custo realizado se comportam de forma distinta das comparações no mesmo teto. Na configuração identificada como low, a regra advisory com teto de 4k teve acurácia maior que a strict com teto de 8k, a custo médio de conclusão comparável. Na configuração high, a acurácia observada da advisory ficou 0,42 ponto abaixo da strict com teto de 32k, gastando 59% dos tokens médios dessa última. Os autores alertam que essas comparações agregadas não provam superioridade com computação igual nem equivalência de acurácia.

Um terceiro achado atinge a lógica de escalar tentativas. Aumentar a cobertura de candidatos não garante resposta mais correta: um seletor baseado em log-probabilidade perdeu acurácia conforme a cobertura subiu, inclusive depois de um reparo de consistência de nível de fonte. Em tetos de 32k, as diferenças de acurácia de maioria entre regras no mesmo teto encolhem para menos de 1,3 ponto percentual.

O que muda

O artigo propõe um padrão de divulgação para curvas de orçamento. Cada curva deveria declarar, em conjunto, o teto adotado, o custo realizado, os candidatos elegíveis, a regra de parada e a informação disponível ao seletor. Sem esses cinco itens, comparações entre modelos em benchmarks de matemática ficam sem base para verificação.

O que vem agora

O texto é um pré-print e não passou por revisão por pares. A adoção das recomendações depende de autores de benchmark e de laboratórios passarem a reportar as cinco variáveis junto com os resultados. Enquanto isso, qualquer leitura de ranking de raciocínio matemático que cite apenas o teto de tokens continua incompleta.

Fontes

  • arXiv: Budget Boundary Effects in Test-Time Mathematical Reasoning. https://arxiv.org/abs/2609.38699