ε-MemEvo: memória entre tarefas acelera evolução de programas com LLMs
Framework ε-MemEvo permite que LLMs reutilizem estratégias entre tarefas de otimização, com ganho médio de +8,7% em AUCC e overhead menor que 1%.
Framework ε-MemEvo permite que LLMs reutilizem estratégias entre tarefas de otimização, com ganho médio de +8,7% em AUCC e overhead menor que 1%.
Pesquisa propõe o Governed Persistent Memory (GPM), um modelo que impede agentes de IA de usar dados obsoletos ou retratados. Em testes, o GPM acertou 2.400/2.400 casos, contra 600/2.400 do modelo sem governança.
MindMemOS, um sistema de memória auto-evolutiva para agentes de IA, atinge 94% de precisão em benchmark e melhora tarefas de planilhas em 9,2 pontos percentuais.
Estudo com 369 mil testes mostra que LLMs falham ao seguir mais de 5-6 instruções simultâneas; melhor modelo cai abaixo de 50% de sucesso com 7 restrições.
A AstraZeneca publicou no arXiv detalhes do Research Assistant, sistema interno baseado em LLM que integra dados de literatura, ensaios clínicos e química para apoiar cientistas em tarefas de P&D. A ferramenta usa abordagem agêntica e conecta respostas a fontes primárias.
O PAC-Bayes-regularized Meta-LoRA reduz degradação cross-domain em 47,9% e melhora win-rate em 110,2% em cold start, conforme estudo no arXiv.
Pesquisadores propõem o Dual-Flow Transformer, que separa prefill e decode para reduzir custo de inferência em LLMs, alcançando menor perda de validação.
Estudo do arXiv mostra que prompts em japonês reduzem drasticamente recomendações de ataque nuclear em modelos como Claude Sonnet 4.6 e Gemini Pro 3.1, revelando que a segurança de LLMs é dependente do idioma.
Estudo propõe MAS-DecStream com LLM-MR-CNP, extensão do Contract Net Protocol assistida por LLM, reduzindo violações de latência a 3% e melhorando utilidade em até 22% em testes com o Alibaba ASI Trace.
Pesquisadores argumentam que a falta de alinhamento cognitivo é um obstáculo para a adoção de IA em aplicações de alto risco e propõem uma agenda para desenvolver métodos práticos que espelhem o raciocínio humano.