Qwen3.8-Flash explicado

A 2026-09-01, el equipo Qwen de Alibaba open-sourceó Qwen3.8-Flash-Next el 2026-08-26: un MoE multimodal de 125B que activa 6B parámetros por paso, más 51B embeddings N-gram. El contexto nativo es 262K unidades, extensible a 1M con YaRN. Si necesitas capítulos de un video largo, pega el enlace — no tienes que hostear pesos de 125B.

Open-source · 2026-08-26 MoE 125B · 6B activos Demo abajo

Get the notes, skip the architecture diagram

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Añade BibiGPT como fuente preferida en Google Verás más BibiGPT en Noticias destacadas y en las respuestas con IA.

Datos clave (lectura de 90 segundos)

A 2026-09-01, el equipo Qwen de Alibaba open-sourceó Qwen3.8-Flash-Next el 2026-08-26: un MoE multimodal de 125B que activa 6B parámetros por paso, más 51B embeddings N-gram, con contexto nativo 262K (YaRN a 1M) y costo de entrenamiento cerca de una novena parte de Qwen3.7-Plus. Última actualización 2026-09-01.

Features

Qué es realmente Qwen3.8-Flash-Next

El 2026-08-26 el equipo Qwen open-sourceó Qwen3.8-Flash-Next como preview de arquitectura de Qwen4. El nombre de API de producción es Qwen3.8-Flash. Misma generación, dos superficies: pesos versus un endpoint hosted.

MoE 125B, 6B activos, más 51B embeddings N-gram

Qwen indica un modelo principal de 125 mil millones de parámetros que activa 6 mil millones por paso, con 51 mil millones extra de parámetros de embeddings N-gram que pueden vivir en system RAM en lugar de memoria GPU.

Contexto nativo 262K, YaRN a 1M

La ventana de contexto por defecto es 262,144 unidades. Qwen dice que YaRN puede estirarla a un millón de unidades para archivos largos y conversaciones largas. Una transcripción de clase sigue necesitando capítulos; una ventana ancha no es un notebook.

Costo de entrenamiento ~1/9 de Qwen3.7-Plus

Qwen dice que entrenar Qwen3.8-Flash-Next costó cerca de una novena parte de Qwen3.7-Plus, con ganancias en coding y tareas de oficina. Es un claim de costo de entrenamiento del vendor, no un precio de usuario.

Qué significa si trabajas con video largo

Un modelo multimodal de contexto largo más barato ayuda a equipos de API. Por sí solo no le da a un estudiante notas con timestamps de un upload de dos horas en Bilibili. BibiGPT es el producto para ese segundo trabajo.

No deberías tener que hostear pesos de 125B

Pega un enlace, obtén capítulos, una transcripción y Q&A de seguimiento. BibiGPT soporta Qwen3.8-Flash como modelo que puedes usar para notas long-form — no eliges un diagrama de arquitectura.

El contexto largo solo paga si guardas las notas

Una clase de 90 minutos sigue necesitando timestamps y una exportación. Una llamada API barata que nunca archivas es desperdicio; un resumen por capítulos es un documento que puedes buscar la próxima semana.

Esto no es Qwen 3.6 ni Qwen3-ASR

Qwen 3.6 es una generación multimodal anterior. Qwen3-ASR es la familia de reconocimiento de voz. Esta página es el evento Flash-Next / Flash del 2026-08-26. Una intención, una URL.

5 cambios clave (lectura de 90 segundos)

Hechos principales del lanzamiento Qwen3.8-Flash / Flash-Next de Qwen del 2026-08-26.

  1. 1

    Pesos abiertos el 2026-08-26

    Qwen lanzó Qwen3.8-Flash-Next (y un build FP8) en Hugging Face y ModelScope esa misma noche, enmarcado como preview de arquitectura de Qwen4.

  2. 2

    MoE 125B, 6B activos, 51B embeddings N-gram

    Qwen documenta un modelo principal de 125B, 6B parámetros activados por paso y 51B embeddings N-gram extra que pueden vivir en system RAM en lugar de memoria GPU.

  3. 3

    Contexto nativo 262K, YaRN a 1M

    El contexto por defecto es 262,144 unidades. Qwen dice que YaRN lo extiende a un millón de unidades para archivos largos e hilos largos.

  4. 4

    Costo de entrenamiento ~1/9 de Qwen3.7-Plus

    Qwen afirma que el costo de entrenamiento de Flash-Next fue cerca de una novena parte de Qwen3.7-Plus, con scores más fuertes en coding y tareas de oficina. Es una cifra de costo de entrenamiento del vendor.

  5. 5

    Precio de lista API 1 yuan / 3 yuan por millón de unidades

    Reuters reportó que Qwen cobraría 1 yuan por millón de unidades de entrada y 3 yuan por millón de unidades de salida en la API hosted Qwen3.8-Flash. Confirma en QwenCloud antes de presupuestar.

3 escenarios típicos para usuarios de BibiGPT

Dónde importa un modelo Qwen de contexto largo más barato — y dónde el producto real es un resumidor.

Ya corres Qwen por tu cuenta

Usa los pesos abiertos o la API Flash para tu propio stack de coding y oficina. Luego igual pega la clase terminada en BibiGPT para que las personas reciban capítulos en lugar de un volcado crudo de unidades.

Solo necesitas notas de un video chino largo

Un upload de dos horas en Bilibili no necesita un brief de arquitectura Qwen4. Pega la URL, exporta la transcripción, sigue haciendo preguntas. Ese es el camino BibiGPT.

Comparas generaciones de Qwen

Qwen 3.6 es el explainer multimodal anterior. Qwen3-ASR es reconocimiento de voz. Esta página es solo Flash / Flash-Next. Un evento de familia de modelos, una URL.

Herramientas BibiGPT relacionadas

Flujos de notas de video largo que combinan con este lanzamiento.

Fuentes

Las specs de esta página vienen de las release notes de Qwen del 2026-08-26 y del reporte del mismo día de Reuters.

  • Qwen open-sourceó Qwen3.8-Flash-Next el 2026-08-26 como un MoE multimodal de 125B con 6B parámetros activos, 51B embeddings N-gram, contexto nativo 262K (YaRN a 1M) y costo de entrenamiento ~1/9 de Qwen3.7-Plus.

    GitHub — QwenLM/Qwen3.8-Flash-Next ↗
  • Reuters reportó el lanzamiento del 2026-08-26, la ventana por defecto de 262,144 unidades (expandible a 1 millón), un noveno del costo de entrenamiento de Qwen3.7-Plus, y precios de lista de API de 1 yuan / 3 yuan por millón de unidades de entrada / salida.

    Reuters — Alibaba's Qwen launches Qwen3.8-Flash ↗
  • IT Home reportó el brief en chino del mismo día: pesos abiertos a las 23:00 hora de Beijing en Hugging Face y ModelScope, más los precios de lista de API de 1 yuan / 3 yuan.

    IT Home — Qwen3.8-Flash (Next) ↗

Términos usados en esta página

¿Qué es un modelo mixture-of-experts (MoE)?

Un modelo mixture-of-experts mantiene un pool grande de parámetros y activa solo un subset por cada paso. Qwen3.8-Flash-Next está documentado como 125B totales con 6B activos por paso. El efecto práctico es más capacidad sin pagar el cómputo completo de un modelo dense en cada paso.

¿Para qué sirve una ventana de contexto de 262K en notas de video?

Una ventana de 262,144 unidades puede contener una transcripción larga más instrucciones en una sola llamada. Por sí sola no produce capítulos, timestamps ni una exportación que puedas buscar la próxima semana. Esos artefactos son el trabajo de un producto de notas de video.

Preferido por creadores, estudiantes e investigadores

Por qué la gente usa BibiGPT cada día para convertir vídeos en texto.

Más de 50 000 usuarios en todo el mundo confían en nosotros

★★★★★

“Pego un enlace y obtengo subtítulos limpios en segundos: me ahorra horas de transcripción cada semana.”

Maya R.

Creadora de contenido · Reutiliza vídeos cortos

★★★★★

“Exportar la transcripción me permite repasar vocabulario a mi ritmo en lugar de pausar el vídeo constantemente.”

Daniel K.

Estudiante de idiomas · Estudia con vídeos reales

★★★★★

“Texto preciso con marcas de tiempo que puedo citar directamente. Sin darme cuenta, ya es parte de mi rutina diaria.”

Priya S.

Investigadora · Cita charlas públicas

Preguntas frecuentes

Resolvemos cualquier duda.

Popular guides

Sáltate el checkpoint de 125B. Consigue las notas.

Pega un enlace largo de YouTube, Bilibili o podcast. BibiGPT devuelve capítulos, una transcripción y Q&A de seguimiento. Última actualización 2026-09-01.