VHOP-Router eleva busca visual de agentes LLM de 5% a 76,3%

VHOP-Router eleva busca visual de agentes LLM de 5% a 76,3%

O VHOP-Router, publicado no arXiv em 30 de setembro de 2026, eleva a recuperação visual de menos de 5% para 76,3% e corta 61% dos tokens em busca agêntica. O método treina modelos de embedding para navegar cadeias de imagens em uma única chamada, sem consultas de texto intermediárias.

Por Redação Mapa Paper2 out
PCPO: agente de IA aprende com os próprios algoritmos

PCPO: agente de IA aprende com os próprios algoritmos

O método PCPO permite que agentes de design de algoritmos aprendam com algoritmos que eles mesmos geram. Treinado com 4 casos de chip e um modelo de 8B parâmetros, iguala modelos fechados como o GPT-5.5 e acelera kernels de GPU em média 8,27x.

Por Redação Mapa Paper2 out
PathAnchor: sistema de IA usa evidência em caminho e chega a 82,6%

PathAnchor: sistema de IA usa evidência em caminho e chega a 82,6%

O PathAnchor, sistema de raciocínio científico publicado no arXiv, organiza evidências em trajetórias ordenadas em vez de passagens soltas. Acertou 82,6% de 120 perguntas e elevou as respostas com citação em evidência aberta de 69,2% para 90,0%.

Por Redação Mapa Paper2 out
Bisimulação por ação melhora memória de agentes de GUI

Bisimulação por ação melhora memória de agentes de GUI

Paper no arXiv propõe bisimulação condicionada por ação para memória de agentes de GUI. O método funde estados com base no que acontece após cada clique, ignora semelhança visual e eleva a taxa de sucesso no benchmark MiniWoB++.

Por Redação Mapa Paper2 out
Paper propõe TRG para avaliar agentes de voz em tempo real

Paper propõe TRG para avaliar agentes de voz em tempo real

O paper arXiv:2609.30798v1 propõe o TRG, padrão que mede agentes de voz por timing, recuperação pós-disrupção e desfecho verificado no backend. O estudo reúne 38 fontes e afirma que nenhum sistema end-to-end self-hostable atende hoje aos requisitos de produção.

Por Redação Mapa Paper28 set
Benchmark CPB testa admissão de crenças na memória de agentes de IA

Benchmark CPB testa admissão de crenças na memória de agentes de IA

O Correlated Promotion Benchmark, publicado no arXiv em 25 de setembro de 2026, testa se afirmações devem entrar na memória compartilhada de agentes de IA. Nenhuma política sem acesso à linhagem da fonte rejeitou falsidades de forma consistente, e uma crença falsa admitida sem contestação foi repetida em 0,97 a 0,99 das sondagens.

Por Redação Mapa Paper28 set
PTC-Decoder melhora SLMs offline sem retreinar modelo

PTC-Decoder melhora SLMs offline sem retreinar modelo

O PTC-Decoder, framework de decodificação do arXiv, melhora a execução de tarefas por SLMs offline em dispositivos restritos como satélites. Em 200 tarefas reais e 7 modelos, o ganho médio foi de +1,21 ponto, sem retreinamento.

Por Redação Mapa Paper28 set
Jailbreak em modelos de difusão: estudo mapeia barreira de energia

Jailbreak em modelos de difusão: estudo mapeia barreira de energia

Paper no arXiv trata o alinhamento de segurança de modelos de difusão como uma barreira de energia e deriva três sinais de detecção sem treinamento. Nos testes com LLaDA-8B, LLaDA-1.5, Dream-7B e LLaDA-MoE-7B, todo ataque que escapou da detecção também falhou em gerar conteúdo nocivo.

Por Redação Mapa Paper28 set