Recusa de LLMs está concentrada em camadas MLP, aponta estudo
Estudo no arXiv localiza o comportamento de recusa de LLMs nas camadas MLP do meio da rede; pesos dessas camadas transferem recusa a prompts maliciosos com ao menos 2,7 vezes mais eficácia que atenção.
