O que é um modelo mixture-of-experts (MoE)?
Um modelo mixture-of-experts mantém um grande pool de parâmetros e ativa só um subconjunto para cada passo. O Qwen3.8-Flash-Next é documentado como 125B no total com 6B ativos por passo. O efeito prático é mais capacidade sem pagar a conta completa de compute de um modelo denso em cada passo.