Qwen3.8-Flash explicado

Em 2026-09-01, a equipe Qwen da Alibaba havia open-sourcado o Qwen3.8-Flash-Next em 2026-08-26: um MoE multimodal de 125B que ativa 6B parâmetros por passo, mais 51B de embeddings N-gram. O contexto nativo é 262K unidades, estendível a 1M com YaRN. Se você precisa de capítulos de um vídeo longo, cole o link — você não precisa hospedar weights de 125B.

Open-source · 2026-08-26 125B MoE · 6B active Demo ao vivo abaixo

Get the notes, skip the architecture diagram

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Adicionar BibiGPT como fonte preferida no Google Veja mais BibiGPT nas Principais notícias e nas respostas com IA.

Fatos-chave (leitura de 90 segundos)

Em 2026-09-01, a equipe Qwen da Alibaba havia open-sourcado o Qwen3.8-Flash-Next em 2026-08-26: um MoE multimodal de 125B que ativa 6B parâmetros por passo, mais 51B de embeddings N-gram, com contexto nativo de 262K (YaRN até 1M) e custo de treino cerca de um nono do Qwen3.7-Plus. Última atualização em 2026-09-01.

Features

O que o Qwen3.8-Flash-Next realmente é

Em 2026-08-26 a equipe Qwen open-sourcou o Qwen3.8-Flash-Next como prévia de arquitetura do Qwen4. O nome da API de produção é Qwen3.8-Flash. Mesma geração, duas superfícies: weights versus um endpoint hospedado.

MoE 125B, 6B ativos, mais 51B de embeddings N-gram

A Qwen declara um modelo principal de 125 bilhões de parâmetros que ativa 6 bilhões por passo, com 51 bilhões extras de parâmetros de embedding N-gram que podem ficar na RAM do sistema em vez da memória da GPU.

Contexto nativo de 262K, YaRN até 1M

A janela de contexto padrão é 262.144 unidades. A Qwen diz que o YaRN pode esticar isso até um milhão de unidades para arquivos longos e conversas longas. Um transcript de aula ainda precisa de capítulos; uma janela larga não é um caderno.

Custo de treino cerca de 1/9 do Qwen3.7-Plus

A Qwen diz que treinar o Qwen3.8-Flash-Next custou cerca de um nono do Qwen3.7-Plus, com ganhos em coding e tarefas de escritório. Isso é uma claim de custo de treino do vendor, não um preço de usuário.

O que isso significa se você trabalha com vídeo longo

Um modelo multimodal de contexto longo mais barato ajuda equipes de API. Por si só, não dá a um estudante notas com timestamp de um upload de duas horas no Bilibili. O BibiGPT é o produto para esse segundo trabalho.

Você não deveria ter que hospedar weights de 125B

Cole um link, receba capítulos, um transcript e Q&A de acompanhamento. O BibiGPT oferece Qwen3.8-Flash como modelo que você pode usar para notas long-form — você não escolhe um diagrama de arquitetura.

Contexto longo só vale se você guardar as anotações

Uma aula de 90 minutos ainda precisa de timestamps e uma exportação. Uma chamada de API barata que você nunca arquiva é desperdício; um resumo em capítulos é um documento que você pesquisa na semana que vem.

Isso não é Qwen 3.6 nem Qwen3-ASR

Qwen 3.6 é uma geração multimodal anterior. Qwen3-ASR é a família de reconhecimento de fala. Esta página é o evento Flash-Next / Flash de 2026-08-26. Uma intenção, uma URL.

5 mudanças-chave (leitura de 90 segundos)

Fatos principais do lançamento Qwen3.8-Flash / Flash-Next da Qwen em 2026-08-26.

  1. 1

    Pesos abertos em 2026-08-26

    A Qwen lançou o Qwen3.8-Flash-Next (e um build FP8) no Hugging Face e no ModelScope na mesma noite, apresentado como prévia de arquitetura do Qwen4.

  2. 2

    MoE 125B, 6B ativos, 51B de embeddings N-gram

    A Qwen documenta um modelo principal de 125B, 6B parâmetros ativados por passo e 51B extras de embeddings N-gram que podem ficar na RAM do sistema em vez da memória da GPU.

  3. 3

    Contexto nativo de 262K, YaRN até 1M

    O contexto padrão é 262.144 unidades. A Qwen diz que o YaRN estende isso a um milhão de unidades para arquivos longos e threads longas.

  4. 4

    Custo de treino ~1/9 do Qwen3.7-Plus

    A Qwen afirma que o custo de treino do Flash-Next foi cerca de um nono do Qwen3.7-Plus, com scores mais fortes em coding e tarefas de escritório. Esse é um número de custo de treino do vendor.

  5. 5

    Preço de lista da API 1 yuan / 3 yuan por milhão de unidades

    A Reuters reportou que a Qwen cobraria 1 yuan por milhão de unidades de entrada e 3 yuan por milhão de unidades de saída na API hospedada Qwen3.8-Flash. Confirme no QwenCloud antes de orçar.

3 cenários típicos para usuários do BibiGPT

Onde um modelo Qwen de contexto longo mais barato importa — e onde um resumidor é o produto de verdade.

Você já roda a Qwen por conta própria

Use os pesos abertos ou a API Flash no seu próprio stack de coding e escritório. Depois ainda cole a aula pronta no BibiGPT para que humanos recebam capítulos em vez de um dump bruto de unidades.

Você só precisa de notas de um vídeo longo em chinês

Um upload de duas horas no Bilibili não precisa de um brief de arquitetura do Qwen4. Cole a URL, exporte o transcript, continue fazendo perguntas. Esse é o caminho do BibiGPT.

Você está comparando gerações Qwen

Qwen 3.6 é o explainer multimodal anterior. Qwen3-ASR é reconhecimento de fala. Esta página é só Flash / Flash-Next. Um evento de família de modelo, uma URL.

Ferramentas relacionadas do BibiGPT

Fluxos de notas de vídeo longo que combinam com este lançamento.

Fontes

As specs nesta página vêm das release notes da Qwen de 2026-08-26 e do report da Reuters no mesmo dia.

  • A Qwen open-sourcou o Qwen3.8-Flash-Next em 2026-08-26 como um MoE multimodal de 125B com 6B parâmetros ativos, 51B de embeddings N-gram, contexto nativo de 262K (YaRN até 1M) e custo de treino cerca de 1/9 do Qwen3.7-Plus.

    GitHub — QwenLM/Qwen3.8-Flash-Next ↗
  • A Reuters reportou o lançamento de 2026-08-26, a janela padrão de 262.144 unidades (expansível a 1 milhão), um nono do custo de treino do Qwen3.7-Plus e preços de lista da API de 1 yuan / 3 yuan por milhão de unidades de entrada / saída.

    Reuters — Alibaba's Qwen launches Qwen3.8-Flash ↗
  • O IT Home reportou o brief em chinês no mesmo dia: pesos abertos às 23:00 no horário de Pequim no Hugging Face e no ModelScope, mais os preços de lista da API de 1 yuan / 3 yuan.

    IT Home — Qwen3.8-Flash (Next) ↗

Termos usados nesta página

O que é um modelo mixture-of-experts (MoE)?

Um modelo mixture-of-experts mantém um grande pool de parâmetros e ativa só um subconjunto para cada passo. O Qwen3.8-Flash-Next é documentado como 125B no total com 6B ativos por passo. O efeito prático é mais capacidade sem pagar a conta completa de compute de um modelo denso em cada passo.

Para que serve uma janela de contexto de 262K em notas de vídeo?

Uma janela de 262.144 unidades pode guardar um transcript longo mais instruções em uma única chamada. Por si só, não produz capítulos, timestamps ou uma exportação que você pesquisa na semana que vem. Esses artefatos são o trabalho de um produto de notas de vídeo.

Adorado por criadores, estudantes e pesquisadores

Por que as pessoas usam o BibiGPT todos os dias para transformar vídeos em texto.

Mais de 50.000 usuários no mundo todo confiam

★★★★★

“Colo um link e recebo legendas limpas em segundos — economizo horas de redigitação toda semana.”

Maya R.

Criadora de conteúdo · Reaproveita vídeos curtos

★★★★★

“Exportar a transcrição me deixa revisar palavras novas no meu ritmo, sem pausar o vídeo o tempo todo.”

Daniel K.

Estudante de idiomas · Estuda com vídeos reais

★★★★★

“Texto preciso e com marcação de tempo que posso citar diretamente. Sem perceber, virou parte do meu fluxo diário.”

Priya S.

Pesquisadora · Cita palestras públicas

Perguntas frequentes

Tire qualquer dúvida.

Popular guides

Pule o checkpoint de 125B. Pegue as anotações.

Cole um link longo do YouTube, Bilibili ou podcast. O BibiGPT devolve capítulos, um transcript e Q&A de acompanhamento. Última atualização em 2026-09-01.