Outcome Monitors: sistema detecta falhas silenciosas em ferramentas de IA
Pesquisa apresenta Outcome Monitors, sistema que detecta falhas silenciosas em ferramentas de IA e aumenta taxa de conclusão em até 14 pontos em testes.
Pesquisa apresenta Outcome Monitors, sistema que detecta falhas silenciosas em ferramentas de IA e aumenta taxa de conclusão em até 14 pontos em testes.
Um estudo com 9 LLMs mostrou que prompts simples são superiores para gerar comunicações realistas de controle de tráfego aéreo, mas expõem o risco de acúmulo de erros em diálogos longos.
Novo framework de IA separa interações em gado leiteiro por valência, revelando que 72,4% dos contatos em área de ordenha são agonísticos. Estudo mostra que contagens genéricas de interação podem mascarar a verdadeira dinâmica social e o bem-estar do rebanho.
Estudo da arXiv mostra que a segurança de implantações de IA depende do nível de acesso técnico e contratual que a empresa desplegadora tem ao modelo, e não apenas de protocolos idealizados. Pesquisa quantifica o 'imposto de controle' para quem usa modelos via API.
Artigo no arXiv propõe focar em valência, em vez de consciência, para resolver dilemas éticos no desenvolvimento de inteligência artificial.
Artigo no arXiv apresenta framework que usa active inference para otimizar a aquisição de contexto em agentes de IA, testado em modelos de linguagem frontier.
O Slack lançou o Slack Code, que integra agentes de codificação de IA como Claude Code e Copilot em canais colaborativos, permitindo que equipes acompanhem e revisem o trabalho em tempo real. A novidade está disponível em todos os planos da plataforma.
Pesquisa com 107 empresas revela que 20% não conseguem frear gastos com agentes de IA, impulsionando a adoção simultânea de múltiplas plataformas para manter controle.
OpenAI lança blog AI Futures focado em como IA transformacional pode redesenhar poder, governança, economia e liberdade. Publicação marca expansão da comunicação da empresa sobre riscos sistêmicos da tecnologia.