Granite Speech 5.0 Turbo CTC explicado

Em 2026-09-01, a IBM havia lançado o Granite Speech 5.0 Turbo CTC em 2026-08-25: dois modelos ASR em inglês compactos de 470M. A IBM reporta mais de 12.600 RTFx em um NVIDIA H200 — mais de 3,5 horas de fala em um segundo com batched inference. O BibiGPT transforma um link de vídeo ou podcast em transcript com timestamp e um resumo, sem GPU para configurar.

Lançado · 2026-08-25 470M English ASR Demo ao vivo abaixo

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without wiring a CTC decoder.

Adicionar BibiGPT como fonte preferida no Google Veja mais BibiGPT nas Principais notícias e nas respostas com IA.

Fatos-chave (leitura de 90 segundos)

Em 2026-09-01, a IBM havia lançado o Granite Speech 5.0 Turbo CTC em 2026-08-25: dois modelos ASR em inglês de 470M (Apache 2.0 e CC-BY-NC-SA-4.0). A IBM reporta mais de 12.600 RTFx em um NVIDIA H200 — mais de 3,5 horas de fala em um segundo com batched inference. Última atualização em 2026-09-01.

Features

O que o Granite Speech 5.0 Turbo CTC realmente é

A IBM Research e a org ibm-granite no Hugging Face lançaram dois modelos ASR em inglês encoder-only em 2026-08-25. Eles removem o modelo de linguagem backbone usado em modelos Granite Speech anteriores, então o stack fica em 470 milhões de parâmetros.

Duas licenças, dois conjuntos de treino

granite-speech-5.0-470m-turboctc é Apache 2.0. A variante -nc treina com dados extras (GigaSpeech, SPGI Speech) e é CC-BY-NC-SA-4.0. Escolha liberdade comercial ou um WER um pouco menor — não os dois no mesmo checkpoint.

12.600+ RTFx reivindicados em um H200

A IBM reporta mais de 12.600× de throughput em tempo real em um único NVIDIA H200 com batched inference — o bastante para transcrever mais de 3,5 horas de fala em um segundo. Esse é o número publicado pela IBM, não um bake-off independente.

WER OpenASR: 5,00% e 4,85%

Nos conjuntos públicos de teste em inglês do OpenASR Leaderboard em 2026-08-25, a IBM reporta 5,00% de WER agregado no modelo Apache e 4,85% no modelo NC. Word error rate conta substituições, deleções e inserções — o número é uma pontuação, não uma promessa sobre nomes na sua gravação.

O que isso muda se você trabalha com vídeo e podcasts

Um checkpoint ASR open rápido é útil para quem vai self-host. A maioria das pessoas com uma aula para acompanhar precisa das palavras como notas, não de um stack Conformer. Esse segundo trabalho é para o que o BibiGPT serve.

Edge ASR não é um produto

Esses modelos foram feitos para laptops, celulares e caixas de transcrição de alto throughput. Eles abrem mão de speech translation e keyword biasing que modelos Granite Speech anteriores tinham. Você ainda precisa encapsular weights, um decoder e storage.

Um transcript é só o primeiro passo

Texto bruto de qualquer modelo ASR ainda precisa ser lido. O BibiGPT recebe um link e devolve um transcript com timestamp mais um resumo com IA e notas pesquisáveis — assim uma gravação de duas horas vira algo que você consegue escanear.

Só inglês é um limite real

Os dois modelos Turbo CTC são ASR em inglês. Podcasts em chinês com dialeto forte, japonês ou mistos precisam de outro caminho. O BibiGPT transcreve e resume essas gravações a partir de um link colado, sem você escolher um checkpoint.

5 mudanças-chave (leitura de 90 segundos)

Fatos principais do lançamento Granite Speech 5.0 Turbo CTC da IBM em 2026-08-25.

  1. 1

    Lançado em 2026-08-25, dois checkpoints

    A IBM enviou granite-speech-5.0-470m-turboctc (Apache 2.0) e granite-speech-5.0-470m-turboctc-nc (CC-BY-NC-SA-4.0) no Hugging Face no mesmo dia dos modelos de linguagem Granite 4.2.

  2. 2

    Sem modelo de linguagem backbone, 470M parâmetros

    Diferente do Granite Speech 4.1, o Turbo CTC é CTC encoder-only. A IBM removeu speech translation e keyword biasing para manter o footprint pequeno o bastante para laptops e celulares.

  3. 3

    12.600+ RTFx reivindicados em um H200

    A IBM reporta mais de 12.600× de throughput em tempo real com batched inference em um único NVIDIA H200 — mais de 3,5 horas de fala em um segundo. É uma medição do vendor nos conjuntos públicos OpenASR.

  4. 4

    WER OpenASR 5,00% / 4,85%

    Em 2026-08-25 a IBM reporta 5,00% de WER agregado no modelo Apache e 4,85% no modelo NC nos testes públicos em inglês do OpenASR. No FFASR, a IBM diz que o par foram os dois modelos listados mais rápidos naquele dia.

  5. 5

    Demo streaming WebGPU, só inglês

    A IBM publicou uma demo streaming WebGPU para Chrome/Edge. Os dois modelos são ASR em inglês. Vídeo misturado ou com dialeto forte ainda precisa de um fluxo de transcrição mais amplo.

3 cenários típicos para usuários do BibiGPT

Onde um lançamento ASR open rápido importa — e onde um produto de link-para-notas é o trabalho de verdade.

Você self-host ASR em inglês em volume

Uma equipe que transcreve arquivos de chamadas nas próprias GPUs pode avaliar o checkpoint Apache 2.0. Depois ainda joga os arquivos prontos no BibiGPT para que humanos recebam capítulos, não um stream bruto de unidades.

Você só precisa das anotações da aula

Uma gravação de aula de 90 minutos não precisa de um stack Conformer. Cole a URL no BibiGPT, exporte o transcript com timestamp e continue fazendo perguntas. Esse é o caminho do produto.

Você está comparando lançamentos ASR open de 2026

Granite Speech 5.0 Turbo CTC é inglês e prioriza throughput. Qwen3-ASR cobre 52 idiomas e dialetos. Mantenha uma URL por família de modelo; não una tudo em uma única página de «ASR open».

Ferramentas relacionadas do BibiGPT

Fluxos de transcrição e notas que combinam com este lançamento.

Fontes

Os fatos nesta página vêm dos posts da própria IBM em 2026-08-25. Throughput e WER são reportados pela IBM.

Termos usados nesta página

O que é WER (word error rate)?

Word error rate é a fração de palavras que foram substituídas, deletadas ou inseridas em comparação com um transcript de referência. Um WER de 5,00% significa cinco erros por 100 palavras de referência naquele conjunto de teste. Não diz se os erros são nomes, números ou fillers — que é o que ouvintes realmente notam.

O que é RTFx no reconhecimento de fala?

RTFx é quantos segundos de áudio um sistema transcreve por segundo de wall-clock. Um RTFx de 12.600 significa que o setup reportado processou áudio 12.600 vezes mais rápido que o tempo real. É um número de hardware e batching, não uma promessa sobre o microfone de um laptop.

Adorado por criadores, estudantes e pesquisadores

Por que as pessoas usam o BibiGPT todos os dias para transformar vídeos em texto.

Mais de 50.000 usuários no mundo todo confiam

★★★★★

“Colo um link e recebo legendas limpas em segundos — economizo horas de redigitação toda semana.”

Maya R.

Criadora de conteúdo · Reaproveita vídeos curtos

★★★★★

“Exportar a transcrição me deixa revisar palavras novas no meu ritmo, sem pausar o vídeo o tempo todo.”

Daniel K.

Estudante de idiomas · Estuda com vídeos reais

★★★★★

“Texto preciso e com marcação de tempo que posso citar diretamente. Sem perceber, virou parte do meu fluxo diário.”

Priya S.

Pesquisadora · Cita palestras públicas

Perguntas frequentes

Tire qualquer dúvida.

Popular guides

Pule o stack do decoder. Pegue o transcript.

Cole um link do YouTube, Bilibili ou podcast — ou envie um arquivo. O BibiGPT devolve um transcript com timestamp, um resumo com IA e notas que você pode pesquisar. Última atualização em 2026-09-01.