PDDL: avaliação de planos gerados por LLM falha, aponta estudo

PDDL: avaliação de planos gerados por LLM falha, aponta estudo

Estudo no arXiv mostra que validade sintática e sucesso do planejador não garantem que um problema PDDL gerado por LLM represente de fato a tarefa descrita em linguagem natural. O trabalho propõe checagem semântica contra referência e reparo iterativo, e aponta o PDDL 2.1 como o ponto mais frágil.

Por Redação Mapa Paper11 set
Decision Transformer otimiza rede D2D com drone e RIS

Decision Transformer otimiza rede D2D com drone e RIS

O artigo arXiv:2609.09885v1 apresenta um Decision Transformer que controla trajetória, atitude e fases de uma RIS montada em drone para redes D2D, com transferência zero-shot superior à do DRL direto e ajuste fino online com menos interações.

Por Redação Mapa Paper11 set
Era by Eon cria benchmark com empresa fictícia para testar agentes de IA

Era by Eon cria benchmark com empresa fictícia para testar agentes de IA

O Era by Eon Benchmark gera empresas fictícias completas, com simuladores de Salesforce, Zendesk, Slack e Gong, para avaliar agentes de IA com gabarito exato. Em 23 companhias simuladas, o realismo médio subiu de 61,8 para 97,0, e a acurácia dos nove modelos testados variou de 42,4% a 76,8%.

Por Redação Mapa Paper11 set
UnitBoost troca meta-agente LLM por operador de merge

UnitBoost troca meta-agente LLM por operador de merge

O UnitBoost substitui o meta-agente generativo de sistemas LLM compostos por um operador de merge definido, livre de ordem e com proveniência de unidade. Em três benchmarks held-out, supera o melhor candidato com rótulos gold em 0,060 a 0,195 ponto e eleva o F1 de célula do FanOutQA de 0,4778 para 0,5524.

Por Redação Mapa Paper11 set
LexAgentHallu: benchmark mede alucinações de agentes jurídicos de IA

LexAgentHallu: benchmark mede alucinações de agentes jurídicos de IA

O LexAgentHallu, benchmark publicado no arXiv, avaliou 18 agentes jurídicos de IA em 3.414 instâncias e encontrou um efeito de resposta certa com raciocínio errado. As alucinações se agrupam em perfis previsíveis por framework, tarefa e categoria jurídica.

Por Redação Mapa Paper11 set
Estudo aponta falha em destilação multi-professor por correção

Estudo aponta falha em destilação multi-professor por correção

Estudo no arXiv analisou destilação multi-professor com filtro de correção e encontrou acurácia maior, mas recall zero em categoria Refuted e perda de funcionalidade de rótulos. O ganho real sobre filtro rígido não foi demonstrado.

Por Redação Mapa Paper11 set
Estudo lista 7 fontes de formação de capacidade em IA física

Estudo lista 7 fontes de formação de capacidade em IA física

Um artigo no arXiv identifica sete fontes de formação de capacidade para a IA física e afirma saturação teórica após testar 49 registros de evidência em três rodadas. O framework separa semelhança de capacidade observada de semelhança na forma como ela foi formada.

Por Redação Mapa Paper11 set
RobustSGPO propõe controle de busca para evolução de agentes de IA

RobustSGPO propõe controle de busca para evolução de agentes de IA

O RobustSGPO, novo método submetido ao arXiv em 9 de setembro de 2026, controla o escopo das edições em prompts de agentes de IA e elevou a conclusão de tarefas de 60,0% para 80,0% em 30 tarefas não vistas. A qualidade de teste subiu de 3,77 para 4,14 sob orçamento de 20 milhões de tokens.

Por Redação Mapa Paper11 set
Gêmeos digitais cognitivos ganham arquitetura de quatro camadas

Gêmeos digitais cognitivos ganham arquitetura de quatro camadas

Pesquisadores propõem uma arquitetura de quatro camadas para gêmeos digitais cognitivos (CDTs), com camada física, gêmeo digital, cognição e tarefa. O ciclo fechado faz o sistema refinar a experiência cognitiva a cada operação, com dois modos: cognição guiada por usuário e autogerada.

Por Redação Mapa Paper11 set
Estudo propõe mecânica estatística do aprendizado em espaço de função

Estudo propõe mecânica estatística do aprendizado em espaço de função

O artigo arXiv:2609.09589 propõe descrever o aprendizado de redes neurais profundas no espaço de funções, com parâmetros como estados microscópicos e funções como variáveis macroscópicas. A derivação exata para erro quadrático médio leva à expressão Φ_fluc(M;B) e a uma regra de pareamento entre os operadores M e B.

Por Redação Mapa Paper11 set