Granite Speech 5.0 Turbo CTC explicado

A 2026-09-01, IBM lanzó Granite Speech 5.0 Turbo CTC el 2026-08-25: dos modelos ASR en inglés compactos de 470M. IBM reporta más de 12,600 RTFx en un NVIDIA H200 — más de 3.5 horas de habla en un segundo con inferencia por lotes. BibiGPT convierte un enlace de video o podcast en una transcripción con timestamps y un resumen, sin que tengas que cablear una GPU.

Lanzado · 2026-08-25 ASR inglés 470M Demo abajo

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without wiring a CTC decoder.

Añade BibiGPT como fuente preferida en Google Verás más BibiGPT en Noticias destacadas y en las respuestas con IA.

Datos clave (lectura de 90 segundos)

A 2026-09-01, IBM lanzó Granite Speech 5.0 Turbo CTC el 2026-08-25: dos modelos ASR en inglés de 470M (Apache 2.0 y CC-BY-NC-SA-4.0). IBM reporta más de 12,600 RTFx en un NVIDIA H200 — más de 3.5 horas de habla en un segundo con inferencia por lotes. Última actualización 2026-09-01.

Features

Qué es realmente Granite Speech 5.0 Turbo CTC

IBM Research y la org ibm-granite en Hugging Face lanzaron dos modelos ASR en inglés solo-encoder el 2026-08-25. Quitan el backbone modelo de lenguaje de los Granite Speech anteriores para que el stack se quede en 470 millones de parámetros.

Dos licencias, dos sets de entrenamiento

granite-speech-5.0-470m-turboctc es Apache 2.0. La variante -nc entrena con datos extra (GigaSpeech, SPGI Speech) y es CC-BY-NC-SA-4.0. Elige libertad comercial o un WER un poco más bajo — no ambos en un solo checkpoint.

Más de 12,600 RTFx reclamados en un H200

IBM reporta más de 12,600× throughput en tiempo real en un solo NVIDIA H200 con inferencia por lotes — suficiente para transcribir más de 3.5 horas de habla en un segundo. Es la cifra publicada por IBM, no un bake-off independiente.

WER OpenASR: 5.00% y 4.85%

En los sets públicos de inglés del OpenASR Leaderboard a 2026-08-25, IBM reporta 5.00% de WER agregado para el modelo Apache y 4.85% para el NC. Word error rate cuenta sustituciones, eliminaciones e inserciones — el número es un score, no una promesa sobre nombres en tu grabación.

Qué cambia si trabajas con video y podcasts

Un checkpoint ASR open rápido sirve a quien va a self-hostear. La mayoría de quienes tienen una clase por ponerse al día necesitan las palabras como notas, no un stack Conformer. Ese segundo trabajo es para lo que está BibiGPT.

El ASR en el edge no es un producto

Estos modelos están pensados para laptops, teléfonos y cajas de transcripción de alto throughput. Renuncian a speech translation y keyword biasing que tenían los Granite Speech anteriores. Aún tienes que envolver pesos, un decoder y almacenamiento.

Una transcripción es solo el primer paso

El texto crudo de cualquier modelo ASR todavía hay que leerlo. BibiGPT toma un enlace y devuelve una transcripción con timestamps más un resumen IA y notas buscables — para que una grabación de dos horas se vuelva algo que puedas escanear.

Solo inglés es un límite real

Ambos modelos Turbo CTC son ASR en inglés. Podcasts con chino dialectal, japonés o idiomas mezclados necesitan otro camino. BibiGPT transcribe y resume esas grabaciones desde un enlace pegado sin que elijas un checkpoint.

5 cambios clave (lectura de 90 segundos)

Hechos principales del lanzamiento Granite Speech 5.0 Turbo CTC de IBM del 2026-08-25.

  1. 1

    Lanzado el 2026-08-25, dos checkpoints

    IBM publicó granite-speech-5.0-470m-turboctc (Apache 2.0) y granite-speech-5.0-470m-turboctc-nc (CC-BY-NC-SA-4.0) en Hugging Face el mismo día que los modelos de lenguaje Granite 4.2.

  2. 2

    Sin backbone modelo de lenguaje, 470M parámetros

    A diferencia de Granite Speech 4.1, Turbo CTC es CTC solo-encoder. IBM eliminó speech translation y keyword biasing para mantener el footprint lo bastante pequeño para laptops y teléfonos.

  3. 3

    Más de 12,600 RTFx reclamados en un H200

    IBM reporta más de 12,600× throughput en tiempo real con inferencia por lotes en un solo NVIDIA H200 — más de 3.5 horas de habla en un segundo. Es una medición del vendor en sets públicos OpenASR.

  4. 4

    WER OpenASR 5.00% / 4.85%

    A 2026-08-25 IBM reporta 5.00% de WER agregado para el modelo Apache y 4.85% para el NC en tests públicos de inglés OpenASR. En FFASR, IBM dice que el par fueron los dos modelos listados más rápidos ese día.

  5. 5

    Demo streaming WebGPU, solo inglés

    IBM publicó una demo streaming WebGPU para Chrome/Edge. Ambos modelos son ASR en inglés. Video con idiomas mezclados o dialectos densos sigue necesitando un flujo de transcripción más amplio.

3 escenarios típicos para usuarios de BibiGPT

Dónde importa un lanzamiento ASR open rápido — y dónde el producto real es ir de enlace a notas.

Self-hosteas ASR en inglés a volumen

Un equipo que transcribe archivos de llamadas en sus propias GPUs puede evaluar el checkpoint Apache 2.0. Luego igual echa los archivos terminados a BibiGPT para que las personas reciban capítulos, no un stream crudo de unidades.

Solo necesitas notas de la clase

Una grabación de clase de 90 minutos no necesita un stack Conformer. Pega la URL en BibiGPT, exporta la transcripción con timestamps y sigue haciendo preguntas. Ese es el camino de producto.

Comparas lanzamientos ASR open de 2026

Granite Speech 5.0 Turbo CTC es inglés y prioriza throughput. Qwen3-ASR cubre 52 idiomas y dialectos. Mantén una URL por familia de modelos; no las fusiones en una sola página de «ASR open».

Herramientas BibiGPT relacionadas

Flujos de transcripción y notas que combinan con este lanzamiento.

Fuentes

Los hechos de esta página vienen de los posts propios de IBM del 2026-08-25. Throughput y WER son reportados por IBM.

Términos usados en esta página

¿Qué es WER (word error rate)?

Word error rate es la fracción de palabras que se sustituyeron, eliminaron o insertaron frente a una transcripción de referencia. Un WER de 5.00% significa cinco errores por cada 100 palabras de referencia en ese set de prueba. No te dice si los errores son nombres, números o relleno — que es lo que los oyentes realmente notan.

¿Qué es RTFx en reconocimiento de voz?

RTFx es cuántos segundos de audio transcribe un sistema por segundo de tiempo de pared. Un RTFx de 12,600 significa que el setup reportado procesó audio 12,600 veces más rápido que tiempo real. Es un número de hardware y batching, no una promesa sobre el micrófono de una laptop.

Preferido por creadores, estudiantes e investigadores

Por qué la gente usa BibiGPT cada día para convertir vídeos en texto.

Más de 50 000 usuarios en todo el mundo confían en nosotros

★★★★★

“Pego un enlace y obtengo subtítulos limpios en segundos: me ahorra horas de transcripción cada semana.”

Maya R.

Creadora de contenido · Reutiliza vídeos cortos

★★★★★

“Exportar la transcripción me permite repasar vocabulario a mi ritmo en lugar de pausar el vídeo constantemente.”

Daniel K.

Estudiante de idiomas · Estudia con vídeos reales

★★★★★

“Texto preciso con marcas de tiempo que puedo citar directamente. Sin darme cuenta, ya es parte de mi rutina diaria.”

Priya S.

Investigadora · Cita charlas públicas

Preguntas frecuentes

Resolvemos cualquier duda.

Popular guides

Sáltate el stack del decoder. Consigue la transcripción.

Pega un enlace de YouTube, Bilibili o podcast — o sube un archivo. BibiGPT devuelve una transcripción con timestamps, un resumen IA y notas que puedes buscar. Última actualización 2026-09-01.