Mô hình mixture-of-experts (MoE) là gì?
Mô hình mixture-of-experts giữ pool tham số lớn và chỉ kích hoạt một phần cho mỗi bước. Qwen3.8-Flash-Next được ghi nhận là tổng 125B với 6B active mỗi bước. Hiệu ứng thực tế là nhiều capacity hơn mà không trả toàn bộ hóa đơn compute dense-model trên mọi đơn vị.