Granite Speech 5.0 Turbo CTC dijelaskan

Per 2026-09-01, IBM merilis Granite Speech 5.0 Turbo CTC pada 2026-08-25: dua model ASR Inggris kompak 470M. IBM melaporkan lebih dari 12.600 RTFx di satu NVIDIA H200 — lebih dari 3,5 jam speech dalam satu detik dengan batched inference. BibiGPT mengubah tautan video atau podcast jadi transkrip berstempel waktu dan ringkasan, tanpa perlu merangkai GPU.

Dirilis · 2026-08-25 ASR Inggris 470M Demo di bawah

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without wiring a CTC decoder.

Jadikan BibiGPT sumber pilihan di Google Lihat lebih banyak BibiGPT di Berita Utama dan jawaban AI.

Fakta kunci (bacaan 90 detik)

Per 2026-09-01, IBM merilis Granite Speech 5.0 Turbo CTC pada 2026-08-25: dua model ASR Inggris 470M (Apache 2.0 dan CC-BY-NC-SA-4.0). IBM melaporkan lebih dari 12.600 RTFx di satu NVIDIA H200 — lebih dari 3,5 jam speech dalam satu detik dengan batched inference. Terakhir diperbarui 2026-09-01.

Features

Apa sebenarnya Granite Speech 5.0 Turbo CTC

IBM Research dan org ibm-granite di Hugging Face merilis dua model ASR Inggris encoder-only pada 2026-08-25. Mereka melepas model bahasa backbone yang dipakai Granite Speech sebelumnya supaya stack tetap di 470 juta parameter.

Dua lisensi, dua set training

granite-speech-5.0-470m-turboctc berlisensi Apache 2.0. Varian -nc dilatih dengan data ekstra (GigaSpeech, SPGI Speech) dan berlisensi CC-BY-NC-SA-4.0. Pilih kebebasan komersial atau WER sedikit lebih rendah — bukan keduanya dalam satu checkpoint.

Klaim 12.600+ RTFx di satu H200

IBM melaporkan throughput lebih dari 12.600× real-time di satu NVIDIA H200 dengan batched inference — cukup untuk mentranskripsi lebih dari 3,5 jam speech dalam satu detik. Itu angka resmi IBM, bukan bake-off independen.

OpenASR WER: 5,00% dan 4,85%

Di set tes Inggris publik OpenASR Leaderboard per 2026-08-25, IBM melaporkan WER agregat 5,00% untuk model Apache dan 4,85% untuk model NC. Word error rate menghitung substitusi, penghapusan, dan penyisipan — angkanya skor, bukan janji soal nama di rekamanmu.

Artinya jika kamu kerja dengan video dan podcast

Checkpoint ASR open yang cepat berguna buat yang mau self-host. Kebanyakan orang yang harus mengejar kuliah butuh kata-katanya jadi catatan, bukan stack Conformer. Pekerjaan kedua itu yang jadi fokus BibiGPT.

Edge ASR bukan produk jadi

Model-model ini dibangun untuk laptop, ponsel, dan kotak transkripsi high-throughput. Mereka melepas speech translation dan keyword biasing yang ada di Granite Speech sebelumnya. Kamu tetap harus membungkus weight, decoder, dan storage.

Transkrip baru langkah pertama

Teks mentah dari model ASR mana pun masih harus dibaca. BibiGPT mengambil tautan dan mengembalikan transkrip berstempel waktu plus ringkasan AI dan catatan yang bisa dicari — jadi rekaman dua jam jadi sesuatu yang bisa kamu skim.

English-only adalah batas nyata

Kedua model Turbo CTC adalah ASR Inggris. Podcast berdialek China, Jepang, atau campuran bahasa butuh jalur lain. BibiGPT mentranskripsi dan merangkum rekaman itu dari tautan yang ditempel tanpa kamu memilih checkpoint.

5 perubahan kunci (bacaan 90 detik)

Fakta utama dari rilis Granite Speech 5.0 Turbo CTC IBM pada 2026-08-25.

  1. 1

    Dirilis 2026-08-25, dua checkpoint

    IBM merilis granite-speech-5.0-470m-turboctc (Apache 2.0) dan granite-speech-5.0-470m-turboctc-nc (CC-BY-NC-SA-4.0) di Hugging Face pada hari yang sama dengan model bahasa Granite 4.2.

  2. 2

    Tanpa model bahasa backbone, 470M parameter

    Berbeda dari Granite Speech 4.1, Turbo CTC adalah CTC encoder-only. IBM melepas speech translation dan keyword biasing agar footprint cukup kecil untuk laptop dan ponsel.

  3. 3

    Klaim 12.600+ RTFx di satu H200

    IBM melaporkan throughput lebih dari 12.600× real-time dengan batched inference di satu NVIDIA H200 — lebih dari 3,5 jam speech dalam satu detik. Itu pengukuran vendor di set OpenASR publik.

  4. 4

    OpenASR WER 5,00% / 4,85%

    Per 2026-08-25 IBM melaporkan WER agregat 5,00% untuk model Apache dan 4,85% untuk model NC di tes Inggris publik OpenASR. Di FFASR, IBM bilang pasangan ini adalah dua model tercatat tercepat hari itu.

  5. 5

    Demo streaming WebGPU, hanya Inggris

    IBM memublikasikan demo streaming WebGPU di Chrome/Edge. Kedua model adalah ASR Inggris. Video multibahasa atau berdialek masih butuh alur transkripsi yang lebih luas.

3 skenario tipikal untuk pengguna BibiGPT

Di mana rilis ASR open yang cepat penting — dan di mana produk tautan-jadi-catatan adalah pekerjaan sebenarnya.

Kamu self-host ASR Inggris dalam volume besar

Tim yang mentranskripsi arsip panggilan di GPU sendiri bisa mengevaluasi checkpoint Apache 2.0. Lalu tetap dump file jadi ke BibiGPT supaya manusia mendapat bab, bukan stream unit mentah.

Kamu hanya butuh catatan kuliah

Rekaman kelas 90 menit tidak butuh stack Conformer. Tempel URL ke BibiGPT, ekspor transkrip berstempel waktu, dan terus ajukan pertanyaan. Itulah jalur produknya.

Kamu membandingkan rilis open ASR 2026

Granite Speech 5.0 Turbo CTC berbahasa Inggris dan mengutamakan throughput. Qwen3-ASR mencakup 52 bahasa dan dialek. Pertahankan satu URL per keluarga model; jangan gabungkan jadi satu halaman «open ASR».

Alat BibiGPT terkait

Alur transkripsi dan catatan yang cocok dengan rilis ini.

Sumber

Fakta di halaman ini berasal dari postingan IBM sendiri pada 2026-08-25. Throughput dan WER dilaporkan oleh IBM.

Istilah di halaman ini

Apa itu WER (word error rate)?

Word error rate adalah fraksi kata yang disubstitusi, dihapus, atau disisipkan dibanding transkrip referensi. WER 5,00% berarti lima kesalahan per 100 kata referensi di set tes itu. Angka ini tidak memberi tahu apakah kesalahannya nama, angka, atau filler — yang justru paling diperhatikan pendengar.

Apa itu RTFx dalam speech recognition?

RTFx adalah berapa detik audio yang ditranskripsi sistem per detik waktu wall-clock. RTFx 12.600 berarti setup yang dilaporkan memproses audio 12.600 kali lebih cepat dari real time. Itu angka hardware-dan-batching, bukan janji soal mikrofon laptop.

Disukai kreator, pelajar & peneliti

Mengapa banyak orang memakai BibiGPT setiap hari untuk mengubah video menjadi teks.

Dipercaya 50.000+ pengguna di seluruh dunia

★★★★★

“Saya tempel tautan dan dalam hitungan detik mendapat teks subtitle yang rapi — menghemat berjam-jam mengetik ulang setiap minggu.”

Maya R.

Kreator konten · Mendaur ulang video pendek

★★★★★

“Dengan mengekspor transkrip, saya bisa mengulang kosakata baru sesuai kecepatan sendiri tanpa terus menjeda video.”

Daniel K.

Pembelajar bahasa · Belajar dengan video asli

★★★★★

“Teks akurat dengan stempel waktu yang bisa langsung saya kutip. Diam-diam sudah jadi bagian dari rutinitas harian saya.”

Priya S.

Peneliti · Mengutip ceramah publik

Pertanyaan yang Sering Diajukan

Tanyakan apa pun.

Popular guides

Lewati stack decoder. Ambil transkripnya.

Tempel tautan YouTube, Bilibili, atau podcast — atau upload file. BibiGPT mengembalikan transkrip berstempel waktu, ringkasan AI, dan catatan yang bisa dicari. Terakhir diperbarui 2026-09-01.