Estudo mapeia sensibilidade de camadas em modelos MoE do Qwen
Pesquisa revela que camadas tardias de modelos Mixture-of-Experts como o Qwen3.6 toleram desativação agressiva de centenas de experts sem perda de qualidade, abrindo caminho para LLMs menores e mais eficientes.
