LLM recommender: fine-tuning eleva explicação segura a 95,6%
Um LLM recomendador ajustado com constrained GRPO passou a explicar suas próprias indicações com fidelidade e sem conteúdo prejudicial, segundo o artigo arXiv:2609.13657v1. A taxa de aprovação nos três critérios avaliados subiu de 64,9% para 95,6% nas avaliações internas e de 67,7% para 93,1% com um juiz independente.
