Gemini Agentic Video Understanding 解説——2026-09-01 で何が変わったか
要点 — 2026-09-01、Google は Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Lite に agentic video understanding を公開しました。モデルは固定 1 FPS で動画全体を取り込む代わりに、質問に答える瞬間をフレーム・音声・字幕から検索します。公式ベンチ:最大でトークン 88% 削減、分析コスト 66% 低下、精度 7% 向上。YouTube 講義から章立てが欲しいだけなら、リンクを貼れば十分です——自分で processing=agentic を設定する必要はありません。
Get the notes, skip the API flag
Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.
核心事実(90 秒で読む)
2026-09-04 時点で、Google は 2026-09-01 に Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Lite へ agentic video understanding を公開しました。モデルは固定 1 FPS でファイル全体を読む代わりに、フレーム・音声・字幕を検索します。公式ベンチ:最大でトークン 88% 削減、分析コスト 66% 低下、精度 7% 向上。講義を検索可能なノートにしたいなら、自分で processing=agentic を繋ぐ代わりにリンクを BibiGPT へ貼ってください。
Features
Agentic video understanding の実態
新しいモデル名ではなく、処理モードです。固定フレームレートで毎秒を読む代わりに、モデル自身が何を・どの速度で・どの経路(フレーム・音声・字幕)で見るかを決めます。
3 つの Flash モデルに搭載(2026-09-01)
Google は Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Lite で有効化しました。自社ベンチでは 3.7 Flash が品質とコストのフロンティアです。開発者は Gemini API で processing を agentic に設定して有効にします。
動的検索 vs 静的 1 FPS
静的モードは固定フレームレートで動画を取り込みます(既定 1 FPS、調整可)。Agentic モードはネイティブ動画ツールでスキャン・ズームし、クエリに答える区間だけを検査します——1 FPS では見落とすサブ秒のカットも含みます。
公式の効率数字
標準の動画分析ベンチで、Google は静的処理比で最大トークン 88% 削減・分析コスト 66% 低下・精度 7% 向上を報告しています。長尺(10 分のハウツーから 90 分の講義)で効果が最大です。これは上限であり、単一テストの保証ではありません。
長い動画を扱う場合の意味
API モードが助かるのは、すでに自前で Gemini を動かしているチームです。人が章立て・文字起こし・フォローアップ Q&A を残す製品の代わりにはなりません。
自分で processing=agentic を設定しなくてよい
YouTube や講義のリンクを貼れば、章立てと文字起こしが得られます。動画アシスタントの価値は成果物であり、API 設定フラグではありません。
トークン節約はノートが残って初めて役立つ
90 分の講義にはタイムスタンプとエクスポートが必要です。安い agentic 呼び出しを保存しなければ無駄です。章立て要約こそがファイルです。
Gemini App と Ask YouTube は後続
2026-09-01 の公開は API + Google AI Studio + Gemini Enterprise Agent Platform で、アップロードと YouTube URL に対応し、標準トークン料金・追加料金なしです。消費者向け Gemini App と YouTube Ask YouTube は後続サーフェスと記載されています——本ページは日付を約束しません。
5 つの重要変化(90 秒で読む)
Google 2026-09-01 agentic video 公開の見出し変化。
- 1
モードであり、新しい SKU 名ではない
Agentic video understanding は既存 Flash モデル上の処理フラグです。4 つ目の Gemini を買う必要はありません。開発者は Gemini API で processing を agentic に設定します。
- 2
3 つのモダリティをまたぐ動的検索
静的モードは固定 FPS でサンプリングします(既定 1)。Agentic モードは何を・どの速度で見るか、フレーム・音声・字幕のどれを読むかを決め、クエリが必要とする瞬間だけを取得します。
- 3
公開された効率の上限
Google は静的処理比で最大トークン 88% 削減・分析コスト 66% 低下・精度 7% 向上を報告しています。長尺ベンチ(1H-VideoQA、LVBench)で 88% のトークン削減が出ます。より難しい推論ベンチでは節約は小さめです。
- 4
今日どこで使えるか
アップロードと YouTube URL が、Gemini API(Google AI Studio と Gemini Enterprise Agent Platform)経由で利用できます。標準トークン料金、追加料金なし。Gemini App と YouTube Ask YouTube は後続サーフェスです。
- 5
3.8 Flash は関連モデルであり、本 URL ではない
Gemini 3.8 Flash(2026-09-02)は agentic video understanding を Preview と記載しています。本ページは 09-01 の能力公開です。意図ひとつ、URL ひとつ——同じ検索のために解説を二本に分けないでください。
BibiGPT ユーザーの典型 3 シーン
API モードが本当に効く場所——そして要約ツールが本製品になる場所。
すでに Gemini を自前運用している
長尺動画エージェントに agentic 処理をオンにして、毎フレーム課金をやめます。そのうえで完成動画は BibiGPT に渡し、人が生トークンではなく章立てを受け取れるようにします。
講義ノートだけが欲しい
90 分の授業動画に API フラグは不要です。URL を貼り、文字起こしを書き出し、フォローアップ質問をします。それが BibiGPT の道です。
Omni と agentic video を比較している
Omni は任意入力からの生成です。Agentic video understanding は手元にあるファイルの分析です。生成は Omni 解説に残し、本ページは分析モードの URL です。
クリエイター・学生・研究者に愛用されています
動画をテキスト化するために、毎日 BibiGPT が選ばれている理由。
全世界 50,000 人以上のユーザーが利用中
“リンクを貼るだけで数秒でクリーンな字幕テキストが手に入り、毎週何時間もの書き起こし作業が不要になりました。”
Maya R.
コンテンツクリエイター · ショート動画を再編集
“文字起こしをエクスポートできるので、動画を何度も止めずに自分のペースで新しい単語を復習できます。”
Daniel K.
語学学習者 · 生の動画で学習
“タイムスタンプ付きの正確なテキストをそのまま引用できます。いつの間にか毎日のワークフローの一部になりました。”
Priya S.
研究者 · 公開講演を引用
よくある質問
よくある質問
ご質問はありますか?お気軽にどうぞ!
人気の記事
1 Bilibili AI動画要約ツール:BibiGPTが30以上のプラットフォームを即座に要約(2026)
2026年に最適なBilibili AI動画要約ツールは?リンクを貼るだけで、30以上のプラットフォームに対応した構造化要約・マインドマップ・要点を即座に取得。上位5ツールを比較します。
2 DeepSeek Harnessでskillを導入する方法:dshに動画を理解させる実践ガイド
DeepSeek Harnessに動画要約skillを入れるのはディレクトリをコピーするだけ——SKILL.mdはClaude Codeと同じ。dshを入れなくても、ブラウザにBilibiliやYouTubeのリンクを貼ればタイムスタンプ付きの要約が出ます。
3 アプリなしで動画を逆再生する方法|無料・ダウンロード不要でブラウザで逆再生(2026年版)
アプリのインストールもダウンロードも不要。ブラウザだけで動画を無料で逆再生する方法を、iPhone・Android・PC別に解説。音声の逆再生、長尺動画のコツ、よくあるトラブルの直し方まで2026年最新版でまとめました。
Agentic の設定は飛ばして、ノートを取る。
長い YouTube・講義・ポッドキャストの URL を BibiGPT に貼ってください。章立て・文字起こし・フォローアップ Q&A が得られ、processing=agentic の設定も Flash SKU の選択も不要です。