¿Qué es un modelo mixture-of-experts (MoE)?
Un modelo mixture-of-experts mantiene un pool grande de parámetros y activa solo un subset por cada paso. Qwen3.8-Flash-Next está documentado como 125B totales con 6B activos por paso. El efecto práctico es más capacidad sin pagar el cómputo completo de un modelo dense en cada paso.