HackProbe: monitor detecta reward hacking em modelos de linguagem autoevolutivos
Artigo no arXiv apresenta o HackProbe, monitor black-box que detecta reward hacking em modelos de linguagem autoevolutivos com 0,763 de AUROC e reduz falsos positivos de 0,706 para 0,434.
