LLMs julgam hipóteses científicas? Novo método supera LLM-as-judge
Estudo do arXiv mostra que medir a confiança intrínseca de LLMs (logit-based energy scoring) supera o método LLM-as-judge em 33,0% vs 16,6% no ranking de hipóteses científicas, com pico de 53,1%.
