Qwen3.8-Flash объяснено

На 2026-09-01 команда Qwen Alibaba открыла веса Qwen3.8-Flash-Next 2026-08-26: мультимодальный MoE на 125B, который активирует 6B параметров на токен, плюс 51B N-gram embeddings. Нативный контекст — 262K токенов, расширяется до 1M с YaRN. Если нужны главы длинного видео, вставьте ссылку — вам не нужно хостить веса на 125B.

Open-sourced · 2026-08-26 125B MoE · 6B active Демо ниже

Get the notes, skip the architecture diagram

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Добавьте BibiGPT в предпочитаемые источники Google Больше материалов BibiGPT в «Главных новостях» и ответах ИИ.

Ключевые факты (чтение за 90 секунд)

На 2026-09-01 команда Qwen Alibaba открыла веса Qwen3.8-Flash-Next 2026-08-26: мультимодальный MoE на 125B, который активирует 6B параметров на токен, плюс 51B N-gram embeddings, с нативным контекстом 262K (YaRN до 1M) и стоимостью обучения около одной девятой от Qwen3.7-Plus. Обновлено 2026-09-01.

Features

Чем на самом деле является Qwen3.8-Flash-Next

2026-08-26 команда Qwen открыла веса Qwen3.8-Flash-Next как architecture preview Qwen4. Production API называется Qwen3.8-Flash. Одно поколение, две поверхности: веса versus hosted endpoint.

125B MoE, 6B активных, плюс 51B N-gram embeddings

Qwen указывает основную модель на 125 миллиардов параметров, которая активирует 6 миллиардов на токен, плюс дополнительные 51 миллиард N-gram embedding параметров, которые могут лежать в system RAM, а не в GPU memory.

Нативный контекст 262K, YaRN до 1M

Окно контекста по умолчанию — 262,144 токена. Qwen говорит, что YaRN может растянуть его до миллиона токенов для длинных файлов и длинных разговоров. Транскрипту лекции всё равно нужны главы; широкое окно — это не notebook.

Стоимость обучения около 1/9 от Qwen3.7-Plus

Qwen говорит, что обучение Qwen3.8-Flash-Next заняло около одной девятой стоимости Qwen3.7-Plus, с приростом на coding и office-задачах. Это vendor-claim про training cost, а не цена для пользователя.

Что это значит, если вы работаете с длинным видео

Более дешёвая long-context мультимодальная модель помогает API-командам. Сама по себе она не даёт студенту заметок с таймкодами из двухчасового аплоада Bilibili. BibiGPT — продукт для этой второй задачи.

Вам не нужно хостить веса на 125B

Вставьте ссылку, получите главы, транскрипт и последующие Q&A. BibiGPT поддерживает Qwen3.8-Flash как модель для long-form заметок — вы не выбираете architecture diagram.

Длинный контекст окупается только если вы храните заметки

90-минутная лекция всё ещё нуждается в таймкодах и экспорте. Один дешёвый API-вызов, который вы не сохранили, — пустая трата; резюме с главами — документ, который можно искать на следующей неделе.

Это не Qwen 3.6 и не Qwen3-ASR

Qwen 3.6 — более раннее мультимодальное поколение. Qwen3-ASR — семейство speech recognition. Эта страница — событие Flash-Next / Flash от 2026-08-26. Один intent, один URL.

5 ключевых изменений (чтение за 90 секунд)

Главные факты релиза Qwen3.8-Flash / Flash-Next от 2026-08-26.

  1. 1

    Открытые веса 2026-08-26

    Qwen выпустила Qwen3.8-Flash-Next (и FP8-сборку) на Hugging Face и ModelScope тем же вечером, позиционируя это как architecture preview Qwen4.

  2. 2

    125B MoE, 6B активных, 51B N-gram embeddings

    Qwen документирует основную модель на 125B, 6B параметров, активируемых на токен, и дополнительные 51B N-gram embeddings, которые могут лежать в system RAM вместо GPU memory.

  3. 3

    Нативный контекст 262K, YaRN до 1M

    Контекст по умолчанию — 262,144 токена. Qwen говорит, что YaRN расширяет его до миллиона токенов для длинных файлов и длинных тредов.

  4. 4

    Стоимость обучения ~1/9 от Qwen3.7-Plus

    Qwen утверждает, что стоимость обучения Flash-Next была около одной девятой от Qwen3.7-Plus, с более сильными scores на coding и office-задачах. Это vendor-цифра про training cost.

  5. 5

    List price API 1 юань / 3 юаня за миллион токенов

    Reuters сообщил, что Qwen будет брать 1 юань за миллион входных токенов и 3 юаня за миллион выходных на hosted API Qwen3.8-Flash. Перед бюджетом сверяйтесь с QwenCloud.

3 типичных сценария для пользователей BibiGPT

Где важна более дешёвая long-context модель Qwen — и где суммаризатор является настоящим продуктом.

Вы уже сами запускаете Qwen

Используйте открытые веса или Flash API для своего coding и office-стека. Затем всё равно вставьте готовую лекцию в BibiGPT — чтобы люди получили главы, а не сырой дамп токенов.

Вам нужны только заметки из длинного китайского видео

Двухчасовому аплоаду Bilibili не нужен architecture brief Qwen4. Вставьте URL, экспортируйте транскрипт, продолжайте задавать вопросы. Это путь BibiGPT.

Вы сравниваете поколения Qwen

Qwen 3.6 — предыдущий мультимодальный explainer. Qwen3-ASR — speech recognition. Эта страница только про Flash / Flash-Next. Одно событие семейства моделей, один URL.

Связанные инструменты BibiGPT

Workflow заметок по длинному видео, которые сочетаются с этим релизом.

Источники

Спецификации на этой странице взяты из release notes Qwen от 2026-08-26 и однодневного репорта Reuters.

  • Qwen открыла веса Qwen3.8-Flash-Next 2026-08-26 как мультимодальный MoE на 125B с 6B активных параметров, 51B N-gram embeddings, нативным контекстом 262K (YaRN до 1M) и стоимостью обучения около 1/9 от Qwen3.7-Plus.

    GitHub — QwenLM/Qwen3.8-Flash-Next ↗
  • Reuters сообщил о запуске 2026-08-26, окне по умолчанию 262,144 токена (расширяемом до 1 миллиона), стоимости обучения в одну девятую от Qwen3.7-Plus и list prices API 1 юань / 3 юаня за миллион входных / выходных токенов.

    Reuters — Alibaba's Qwen launches Qwen3.8-Flash ↗
  • IT Home сообщил тот же день китайскоязычный бриф: открытые веса в 23:00 по пекинскому времени на Hugging Face и ModelScope, плюс list prices API 1 юань / 3 юаня.

    IT Home — Qwen3.8-Flash (Next) ↗

Термины на этой странице

Что такое mixture-of-experts (MoE) модель?

Mixture-of-experts модель держит большой пул параметров и активирует только подмножество на каждый токен. Qwen3.8-Flash-Next документирован как 125B суммарно с 6B активных на токен. Практический эффект — больше capacity без полного dense-model compute bill на каждом токене.

Для чего окно контекста 262K полезно в заметках по видео?

Окно 262,144 токена может вместить длинный транскрипт плюс инструкции в одном вызове. Само по себе оно не создаёт главы, таймкоды или экспорт, который можно искать на следующей неделе. Эти артефакты — задача продукта для video notes.

Нравится авторам, студентам и исследователям

Почему люди каждый день используют BibiGPT, чтобы превращать видео в текст.

Нам доверяют более 50 000 пользователей по всему миру

★★★★★

“Вставляю ссылку — и через несколько секунд получаю чистые субтитры. Каждую неделю это экономит мне часы перепечатки.”

Maya R.

Контент-мейкер · Переупаковывает короткие видео

★★★★★

“Экспорт расшифровки позволяет повторять новые слова в своём темпе, не останавливая видео каждую минуту.”

Daniel K.

Изучает языки · Учится по реальным видео

★★★★★

“Точный текст с таймкодами, который можно цитировать напрямую. Незаметно стал частью моей ежедневной работы.”

Priya S.

Исследователь · Цитирует публичные выступления

Часто задаваемые вопросы

Спрашивайте что угодно.

Popular guides

Пропустите checkpoint на 125B. Возьмите заметки.

Вставьте длинную ссылку YouTube, Bilibili или подкаста. BibiGPT вернёт главы, транскрипт и последующие Q&A. Обновлено 2026-09-01.