SR-OPD corta até 96% dos tokens de professor na destilação de LLMs

Método seleciona quais prompts e rollouts recebem supervisão do professor, usando respostas bem-sucedidas do próprio aluno como referência

Por Marcos Guimarães5 out 2026
SR-OPD corta até 96% dos tokens de professor na destilação de LLMs

O que aconteceu

O artigo "Spend Teacher Tokens Where They Matter: Success-Referenced On-Policy Distillation" foi submetido ao arXiv em 2 de outubro de 2026 e publicado sob o identificador arXiv:2610.02678v1, na categoria de Inteligência Artificial (cs.AI). O texto apresenta a Success-Referenced On-Policy Distillation, sigla SR-OPD, técnica que decide quais prompts e quais rollouts devem receber supervisão do modelo professor durante o treinamento.

A SR-OPD, proposta no artigo, parte de uma observação simples. Quando o aluno gera rollouts com resultados diferentes para o mesmo prompt, ou seja, algumas respostas corretas e outras erradas, a resposta bem-sucedida funciona como referência natural para escolher quais tentativas falhas merecem atenção do professor. O método prioriza rollouts falhos cujas trajetórias de hidden state mostram divergência sustentada em relação à referência bem-sucedida, levando em conta o custo estimado de input do professor.

Os testes usaram três pares professor-aluno e seis benchmarks de raciocínio matemático. No cenário one-pass, a SR-OPD consumiu entre 3,46% e 5,02% dos tokens de input do professor exigidos pelo Vanilla OPD, com desempenho de raciocínio comparável. O material não informa os nomes dos modelos testados nem a instituição dos autores.

Contexto

A destilação on-policy, ou OPD, combina rollouts gerados pelo próprio aluno com supervisão densa em nível de token vinda do professor. É um método caro por definição. Fornecer esse tipo de supervisão para cada rollout exige volume substancial de computação do lado do professor, que costuma ser um modelo maior, mais lento e mais caro de rodar.

A SR-OPD ataca exatamente esse gargalo. Em vez de supervisionar tudo, o método escolhe onde gastar. O artigo enquadra a decisão como um problema de alocação de orçamento fixo de tokens de professor, e a referência usada para essa alocação vem do próprio comportamento do aluno, não de um sinal externo.

O trabalho também traz um experimento de controle com orçamento casado a 5% do total gasto pelo Vanilla OPD. Esse recorte serviu para isolar e validar as duas escolhas centrais do desenho: concentrar supervisão em prompts que geraram tanto sucessos quanto falhas, e usar os rollouts bem-sucedidos para guiar a seleção das falhas.

Por que importa

O custo de tokens de professor é o principal limitador prático da destilação on-policy. Cada token de input processado pelo professor representa compute e, em muitos fluxos de treinamento, dinheiro. Reduzir esse consumo para a casa de 3% a 5% sem perda relevante de raciocínio muda a conta de quem treina modelos menores a partir de modelos maiores.

Isso interessa diretamente a laboratórios e empresas que mantêm modelos compactos para inferência barata. A destilação é o caminho padrão para transferir capacidade de um modelo grande para um pequeno, e o gargalo sempre foi quanto do professor é preciso pagar para obter esse ganho.

A SR-OPD, desenvolvida no artigo, indica que o aluno já carrega parte da informação necessária para decidir onde a supervisão rende mais. O comportamento bem-sucedido do próprio aluno funciona como referência de alocação sob orçamento fixo de tokens de professor.

Impacto

Se o resultado se sustentar fora dos benchmarks de matemática, o efeito prático é uma queda acentuada no custo por rodada de destilação. Um time que hoje precisa reservar orçamento de professor para todos os rollouts passa a concentrar esse gasto em uma fração pequena das amostras.

O ganho não é apenas financeiro. Menos tokens de professor significam menos tempo de GPU dedicado ao modelo maior e mais espaço para rodar ciclos adicionais de treino com o mesmo orçamento. A SR-OPD também reduz o desperdício em prompts fáceis, onde o aluno já acerta e a supervisão densa acrescenta pouco.

O artigo não detalha ganhos de velocidade em wall clock nem custo em dólares. Os resultados divulgados são de desempenho de raciocínio e de consumo de tokens.

O que muda

A contribuição metodológica é a inversão de quem define o alvo. Em vez de o professor determinar o que corrigir, a SR-OPD usa o contraste entre rollouts do próprio aluno para apontar onde a divergência é maior e mais persistente ao longo das camadas ocultas.

Esse critério, baseado em divergência sustentada da trajetória de hidden state, é o que separa a SR-OPD de uma seleção aleatória de amostras. O experimento com orçamento de 5% do Vanilla OPD sustenta as duas decisões de desenho de forma separada, o que dá alguma confiança de que o ganho vem do critério, não de um ajuste incidental.

O que vem agora

O artigo não informa cronograma de liberação de código nem planos de reprodução por terceiros. Os resultados apresentados cobrem raciocínio matemático em seis benchmarks, e a generalização para outras tarefas, como código ou diálogo, não foi testada no material divulgado.

O caminho natural de acompanhamento é verificar se a mesma lógica de referência por sucesso se aplica a domínios onde a resposta correta é menos binária. Também fica em aberto como a SR-OPD se comporta quando o aluno raramente produz um rollout bem-sucedido para o mesmo prompt, caso em que a referência interna deixa de existir.

Fontes

  • arXiv cs.AI: "Spend Teacher Tokens Where They Matter: Success-Referenced On-Policy Distillation" (arXiv:2610.02678v1) — https://arxiv.org/abs/2610.02678