Parakeet vs Whisper:2026年の新王者とWhisper、どちらが高精度か(実測比較)
レビュー

Parakeet vs Whisper:2026年の新王者とWhisper、どちらが高精度か(実測比較)

公開日 · 著者: BibiGPT チーム
BibiGPT を Google の優先ソースに追加 トップニュースと AI による回答に BibiGPT がもっと表示されます。

Parakeet vs Whisper:2026年の新王者とWhisper、どちらが高精度か(実測比較)

2時間分のポッドキャストを転写ツールに放り込み、コーヒーを淹れて戻ってくる。期待に胸を膨らませて文字起こしを開いた瞬間――ゲストの名前が誤って表記され、続けて重要な数字が別の数字に置き換わり、結論全体の意味が変わってしまっている。あなたは一文ずつ原音を聴き直して修正するか、間違ったまま使うリスクを取るかの二択を迫られます。

この瞬間、あなたが直面しているのは「転写が速いかどうか」の問題ではなく、選定の決断です。ParakeetとWhisperという現在最も主流な2つのオープンソース転写モデルのうち、あなたの音声・動画をどちらに任せるべきか? 一方は2025年に登場し一気にランキング首位に躍り出たNVIDIAのオープンソース新王者、もう一方は3年間業界を支配し「音声のテキスト化」の代名詞になった老舗選手です。

多くの比較記事はベンチマーク表を1枚見せて終わりです。しかしランキングが最適化しているのは平均点であって、あなたが実際に使うのは具体的なあの一文です。この記事では精度・速度・言語カバレッジの3つの軸を分けて整理し、最後により実践的な問いにたどり着きます。特定のモデルに賭けるよりも、いつでもエンジンを切り替えられる状態にしておくほうがいい、という結論です。

まずは実装の見た目から見てみましょう――BibiGPTでは、転写に使うエンジンを自分で選べます。

BibiGPTのカスタム転写エンジン設定画面、転写プロバイダーを選択可能

スクリーンショット:BibiGPT・カスタム転写エンジン機能デモ

転写精度がなぜ急に必須要件になったのか

転写精度が必須要件になったのは、文字起こしが「補助資料」から「一次資産」に変わったからです。ノートを取り、AIに要約させ、字幕を生成し、記事を書く――このチェーンのどこかでミスがあれば、それが拡大されて伝わります。

かつて転写に対する許容度は高いものでした。文字起こしは「だいたい合っていればいい」ものだったからです。しかし今のワークフローは違います。字幕はそのまま焼き付けて公開され、文字起こしは大規模モデルに渡されて要約・リライトされ、議事録は自動配信されます。この状況では、1つの認識ミスはもはや「なんとなく違和感がある」では済まず、自動化パイプラインを通じて次々と伝播していきます――誤った数字が議事録に入り、誤った用語が記事に入り、誤った人名がナレッジベースに入る。

転写精度を測る最も一般的な指標は単語誤り率(WER)です。機械が認識したテキストを正しいテキストに直すために必要な置換・削除・挿入の回数を、正解の総単語数で割ったもので、数値が低いほど精度が高いことを意味します(定義はWikipedia「Word error rate」を参照)。しかしWERには長らく見過ごされてきた欠陥があります――すべての単語を等しく扱う点です。助詞のような些細な単語の誤りと人名の誤りは、WER上では同じ減点になりますが、原稿を読む人にとってこの2種類の誤りの代償は桁違いです。

実践ルール: 転写精度を語るときは「どこで間違えたか」を先に問うべきで、「いくつ間違えたか」を問うべきではありません――人名や数字を1つ間違える代償は、助詞を10個間違える代償よりはるかに大きいのです。

Parakeetとは何者か:NVIDIA製オープンソース転写新王者の正体

ParakeetはNVIDIAが2025年5月にオープンソース化した英語転写モデルです。パラメータ数はわずか6億という小柄な体躯ながら、WER 6.05%という数値でHuggingFaceのOpen ASRランキング首位に躍り出ました。

一番の強みは精度ではなく速度です。NVIDIA公式のモデルカードによると、Parakeet TDT 0.6B v2のランキング上のRTFx(リアルタイム速度倍率)は最大3380に達し、1時間分の音声を処理するのにわずか数秒程度しかかかりません。同系統の方式より数十倍速いということです。単語レベルのタイムスタンプや自動句読点も標準搭載しており、字幕制作者にとって特に扱いやすい仕様で、1回の処理で最長約24分の音声セグメントを扱えます。

代償もはっきりしています。初代Parakeet v2は英語しか認識できません。 語彙表には中国語や日本語のような非ラテン文字がそもそも含まれておらず、日本語の音声を転写しても結果はほぼ使い物になりません。(後継のv3では対応言語がヨーロッパ言語25種に拡張されましたが、日本語・中国語・韓国語は依然として含まれていません。)

英語コンテンツかつ速度を重視する用途(大量転写、GPUサーバー、Apple Siliconでのローカル実行)では、Parakeetは現時点で最もコストパフォーマンスに優れたオープンソースの選択肢と言えるでしょう。

Whisperが今なお多くの人の第一選択である理由

Whisperが今も多くの人のデフォルトの選択肢である核心的な理由はただ1つ、ほぼすべての言語を認識できることです。

OpenAIのWhisper large-v3は15.5億パラメータを持ち、99以上の言語をサポートし、混合ベンチマークでの平均WERは約7.4%です。英語の精度ではParakeetにやや劣りますが、対応の広さで勝ります――中国語、日本語、韓国語、訛りのある英語、多言語が混じる会議、いずれも使える結果を返してくれます。エコシステムも成熟しており、公式のオープンソースリポジトリから各種派生版(distil-whisper、whisper.cpp、turbo)まで、ほぼすべてのプラットフォームに既存の統合があります。

言い換えれば、Parakeetは「英語専門チャンピオン」、Whisperは「オールラウンダー」です。素材の出どころが雑多な場合――今日はBilibiliの動画、明日は英語のポッドキャスト、明後日は日本語のインタビューといった具合――Whisperの言語カバレッジは「まずこれが何語かを判断し、対応するモデルを選ぶ」という手間を省いてくれます。

両者の実際の違いを見たいなら、同じ素材で比較したこちらの動画のほうが、スペック表を読むよりずっと直感的です。

動画出典:YouTube・Parakeet v2とWhisperの実測比較

Parakeet vs Whisper 実測比較:精度・速度・言語

一言でまとめると、Parakeetは英語の精度と速度で勝り、Whisperは言語カバレッジとエコシステムの成熟度で勝ります。以下の表で主要な指標を並べて確認しましょう。

比較項目Parakeet TDT 0.6B v2Whisper large-v3
英語WER約6.05%(ランキング首位)約7.4%(混合ベンチマーク)
速度(RTFx)約3380、極めて高速明らかに遅い
言語カバレッジ英語のみ(v3でヨーロッパ言語25種に拡大)99以上の言語
パラメータ規模6億15.5億
適した用途英語の大量転写、速度重視多言語、雑多な素材

データ出典:HuggingFace Open ASRランキングおよび両社の公式モデルカード。速度と言語カバレッジの横断評価はNorthflankの2026年オープンソース音声認識ベンチマークも参考にしています。注意点として、ランキングの数値は標準的な英語データセットに基づくものであり、あなた自身の訛り、業界用語、雑音の多い現場録音に置き換えると、実際の差は大きく変わる可能性があります。

判断フィルター: 英語のみを扱い、極限の速度を求めるなら → Parakeet。多言語対応が必要で素材が雑多なら → Whisper。

結局どちらを選ぶべきか:3タイプ別の転写選定

ParakeetとWhisperのどちらを選ぶかは、あなたが誰か、素材が何語か、環境構築に手間をかける余裕があるかによって決まります。ユーザー層を3タイプに分けて結論をお伝えします。

  • 英語コンテンツクリエイター/開発者:素材が基本的に英語で、GPUやApple Siliconを持っていて、大量転写を行い、速度を重視する → 迷わずParakeetを。精度もスループットも現時点で最良です。
  • 多言語学習者/コンテンツワーカー:日本語・中国語・韓国語や多言語混在の素材を扱う必要がある → Whisperが唯一の安定した選択肢です。Parakeetは現段階ではあなたの言語をカバーできません。
  • コマンドラインに触れたくない一般ユーザー:環境構築もしたくないし、「今日はどのモデルを使うべきか」の判断もしたくない → あらかじめパッケージ化され、それでいてエンジンを自分で切り替えられる製品を使い、モデル選択をドロップダウン1つの操作に変えましょう。

以下の画像は「転写結果をそのまま使える形にする」ための一側面です――セグメント設定次第で、文字起こしの読みやすさが決まります。

BibiGPTのスマート字幕セグメント設定画面、文字起こしをより整理して読みやすくする

スクリーンショット:BibiGPT・スマート字幕セグメント機能デモ

実践ルール: 新王者を追いかけて自分を1つのエンジンに縛り付けないでください――「いつでもエンジンを切り替えられる」こと自体を、あなたの中核的な能力にしましょう。

BibiGPTで転写をあなたのワークフローに組み込む

2つのオープンソースモデルの間で行ったり来たりするより、BibiGPTの発想は選択権をあなたの手に戻すことです。カスタム転写エンジンでは、自分のAPI Keyを使い(BYOK)、複数のトップクラスの転写エンジンを自由に切り替えられます。素材が何語か、速度重視か精度重視か、あなた自身のニーズに応じて選べます。

BibiGPTの転写プロバイダー選択画面、転写エンジンの切り替えと自分のAPI Keyの利用が可能

スクリーンショット:BibiGPT・転写プロバイダー切り替えデモ

転写が終わったら、すぐに取り出せることも重要です。以下の画像は、文字起こしをさまざまな用途向けにエクスポートする画面です。

BibiGPTの字幕・スクリプトの複数フォーマットダウンロード画面、文字起こしをワンクリックでエクスポート

スクリーンショット:BibiGPT・字幕スクリプトの複数フォーマットダウンロードデモ

さらに重要なのは、転写はあくまで出発点だということです。BibiGPTはすでに100万人以上のユーザーに利用され、累計500万回以上のAI要約を生成し、30以上の主要な音声・動画プラットフォームに対応しています――リンクを1つ貼るだけで、一連の流れを自動的に完結させます。

  1. 音声・動画を取得して文字起こしに変換
  2. AIが構造化された要約とマインドマップを生成
  3. SRT字幕や複数フォーマットの文字起こしをエクスポートし、音声のテキスト化のワークフローに組み込む
  4. ワンクリックでポッドキャストを記事に変換YouTube動画をテキストに変換

実用的なワークフローの一例:リンクを貼る → 転写エンジンを選ぶ → 要約で重要な箇所を特定する → 文字起こしや字幕をエクスポートする。まずは無料動画要約を試して効果を確かめてみてください。

どんな動画も数秒で要約

サンプルを選ぶと AI 要約が表示——結論ひとこと、要点リスト、ジャンプできるタイムスタンプ。

サンプルを試す:

ひとこと: Karpathy が GPT 風の言語モデルをコードでゼロから構築。小さな文字レベルモデルから完全な Transformer まで、各パーツを丁寧に解説。

要点

  • まず bigram モデル、次に自己注意を加えてトークン同士を"対話"させる
  • Transformer ブロック = マルチヘッド注意 + 順伝播 + 残差接続 + 層正規化
  • 学習は「次のトークン予測」だけ。あとは規模とデータ次第
  • nanoGPT の背後の構造を拡大したものが ChatGPT

ジャンプ

  • 00:07 なぜゼロから作るのか
  • 08:23 自己注意を直感的に
  • 1:00:00 Transformer ブロックの組み立て
  • 1:35:00 nanoGPT から ChatGPT へ

実践ルール: どのモデルが今この瞬間最も精度が高いかにこだわるより、自分のKeyを使えて、いつでもエンジンを切り替えられるツールを選び、選択権を自分の手に握っておきましょう。

音声・動画の活用を本当に複利化できている人がこだわっているのは、「どのモデルのスコアが高いか」ではなく、「この文字起こしを次に何に使うか」です。転写後のすべてのステップをスムーズに進めたいなら、ぜひBibiGPTを無料で試してみてください。

よくある質問(FAQ)

ParakeetとWhisper、どちらの転写がより正確ですか? 英語コンテンツにおいてはParakeetのWERがより低く(約6.05% vs 約7.4%)、精度も速度も上回ります。ただし中国語や日本語など英語以外の素材になると、初代Parakeetは使用できず、Whisperが唯一使える選択肢になります。

Parakeetは日本語に対応していますか? 初代Parakeet v2は英語のみに対応しており、語彙表に日本語は含まれていません。後継のv3ではヨーロッパ言語25種に拡張されましたが、日本語・中国語・韓国語は依然として含まれていません。日本語を転写したい場合は、Whisperや多言語対応の転写サービスをご利用ください。

なぜParakeetはWhisperよりこれほど速いのですか? Parakeetはより効率的なFastConformerアーキテクチャと、より小さいパラメータ規模(6億 vs Whisperの15.5億)を採用しており、GPU上でのRTFxは最大約3380に達します。長時間音声を処理する際のスループットはWhisperを大きく上回ります。

GPUを持っていない一般ユーザーでもこれらのモデルを使えますか? 使えます。BibiGPTのようなパッケージ化された製品を使えば、環境構築もコマンドライン操作も不要で、カスタム転写エンジンでプロバイダーを切り替えるだけです。自分のAPI Keyを入力してコストと精度をコントロールすることもできます。

WERが低ければ低いほど良いのでしょうか? 必ずしもそうとは限りません。WERはすべての単語を等しく扱うため、助詞の誤りと人名の誤りは同じ減点になりますが、利用者にとっての代償は天と地ほど違います。ツールを選ぶ際は、平均WERだけを見るのではなく、「固有名詞・数字・専門用語をどれだけ正確に認識できるか」に注目すべきです。

BibiGPTチーム

「動画を文字起こし」の記事 26 本をすべて見る →

これらの AI ツールを試す