Что такое mixture-of-experts (MoE) модель?
Mixture-of-experts модель держит большой пул параметров и активирует только подмножество на каждый токен. Qwen3.8-Flash-Next документирован как 125B суммарно с 6B активных на токен. Практический эффект — больше capacity без полного dense-model compute bill на каждом токене.