Second Thought: como raciocínio paralelo acelera agentes de IA
Framework de inferência paralleliza o raciocínio de agentes LLM durante a espera por observações, reduzindo decodificação em até 43% sem perder acurácia em testes preliminares.
Framework de inferência paralleliza o raciocínio de agentes LLM durante a espera por observações, reduzindo decodificação em até 43% sem perder acurácia em testes preliminares.
MOOSEDev usa grafo de conhecimento para dar memória estruturada a agentes de código, superando ferramentas vetoriais em consultas complexas com até 100% de acerto.
Um estudo no arXiv testa a robustez dos 'mapas de ação' internos no Qwen3-4B e conclui que, embora sinais de estado sejam úteis, falham em operações de composição, delimitando a universalidade desses mecanismos em LLMs.
Novo método usa autômatos para resolver limitação técnica em controle de sistemas autônomos por aprendizado por reforço, alcançando taxas de sucesso superiores em testes empíricos.
O novo método ARC corrige vieses em treinamento de IAs e reduz tempo de resposta em 74%, promovendo interações mais justas e eficientes.
Estudo no arXiv mostra que o PIB-VJEPA, uma arquitetura de IA para aprendizado preditivo, equivale estruturalmente a um modelo oculto de Markov, fornecendo uma base teórica sólida.
Pesquisa da arXiv revela que regras de liabilidade médica podem levar a uso desigual de IA, prejudicando pacientes desvantageados e distorcendo incentivos de mercado.
Estudo no arXiv usa pipeline neuro-simbólico com LLM e lógica fuzzy para avaliar adesão a protocolos de sepse em 2.438 episódios. Resultados mostram que apenas 13% dos pacientes recebem antibióticos na primeira hora.
Benchmark SemPlan testou 4 arquiteturas de LLM para consultas a dados de empresas e encontrou taxa de acerto máxima de apenas 25,67%, evidenciando o desafio entre teoria e prática em IA generativa para negócios.
Pesquisadores propõem framework para avaliar sistemas de aprendizado contínuo de IA sem benchmarks rotulados, usando um modelo professor maior como referência — crucial para setores como cibersegurança.