GraphGAN: método com grafos e GANs para detectar ataques DDoS
Pesquisadores propõem GraphGAN, que usa grafos e GANs para detectar DDoS com mais precisão, especialmente quando há poucos dados de ataques.
Pesquisadores propõem GraphGAN, que usa grafos e GANs para detectar DDoS com mais precisão, especialmente quando há poucos dados de ataques.
Estudo do arXiv mostra que LLMs de código aberto superam métodos tradicionais em corrigir erros em modelos de IA, mas sua taxa de sucesso cai drasticamente em testes complexos, impedindo a automação confiável.
TileMix é um novo kernel que roteia precisão numérica por blocos para acelerar LLMs em textos longos, recuperando qualidade perdida em métodos anteriores.
Pesquisa do arXiv revela que modelos de linguagem são testados com problemas médicos já claros, mas falham quando o paciente inicia a conversa com queixas vagas — um defeito crítico para a adoção clínica segura.
Novo framework open-source e benchmark com 350 tarefas reais buscam resolver o problema de agentes de IA que falham ao operar na web do mundo real por longos períodos.
Estudo revela que um modelo de linguagem de 3 bilhões de parâmetros, após fine-tuning, atinge 39,12% de acurácia em problemas de raciocínio matemático para sinais, triplicando o desempenho original.
O LiveHouse-TS, novo benchmark vivo para modelos de séries temporais, mostra que rankings estáticos mudam drasticamente quando avaliados em dados futuros reais, com 17 datasets de 11 domínios.
Pesquisadores propõem o PlanPO, um método de RL que melhora agentes de IA em 27,2% em benchmarks multi-turn, superando o GRPO com custo adicional desprezível.
Framework DeAR propõe raciocínio agêntico descentralizado, com colaboração peer-to-peer entre agentes. Em 9 benchmarks, superou métodos recentes, indicando que a descentralização aumenta a precisão em tarefas de conhecimento intensivo.
Pesquisadores lançaram o ASI-Bench, primeiro benchmark que mede autonomia de IA em pesquisa científica. Resultados mostram queda de desempenho de 50,91 para 26,62 sem orientação humana, indicando que sistemas atuais ainda dependem fortemente de supervisão.