MobileJudgeBench testa LLMs como juízes de agentes mobile

MobileJudgeBench testa LLMs como juízes de agentes mobile

O MobileJudgeBench, novo benchmark para avaliar LLMs como juízes de agentes mobile, mostra que um baseline simples compete com métodos elaborados — e que o modelo de linguagem por trás do juiz é o fator decisivo.

Por Redação Mapa Paper13 ago
Teoria da Mente inversa para recomendação de conteúdo

Teoria da Mente inversa para recomendação de conteúdo

Um preprint no arXiv propõe um pipeline de Teoria da Mente inversa que infere crenças, preferências e traços de personalidade a partir do comportamento de navegação, com resultados que igualam ou superam personas de referência no dataset OPeRA. O estudo também demonstra a abordagem em um aplicativo bancário espacial no visionOS.

Por Redação Mapa Paper13 ago
Apodex Discovery propõe novo padrão para avaliar IA de descoberta

Apodex Discovery propõe novo padrão para avaliar IA de descoberta

O Apodex Discovery, apresentado no arXiv em agosto de 2026, propõe avaliar IA por investigações verificáveis em problemas reais, e não por benchmarks fixos. Nos testes iniciais, superou o estado da arte em 7% no design de capsídeos AAV.

Por Redação Mapa Paper13 ago