Gemini Agentic Video Understanding อธิบาย — อะไรเปลี่ยนเมื่อ 2026-09-01

สรุปสั้น ๆ — เมื่อ 2026-09-01 Google เปิดตัว agentic video understanding บน Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite โมเดลไม่กินวิดีโอทั้งไฟล์ที่ 1 FPS คงที่อีกต่อไป แต่ค้นหาเฟรม เสียง และทรานสคริปต์เพื่อช่วงที่ตอบคำถาม เกณฑ์วัดอย่างเป็นทางการ: ลด usage ได้สูงสุด 88% ต้นทุนวิเคราะห์ต่ำลง 66% ความแม่นยำสูงขึ้น 7% หากต้องการแค่บทจากบรรยาย YouTube ให้วางลิงก์ — ไม่ต้องตั้ง processing=agentic

GA · 2026-09-01 −88% usage เดโมด้านล่าง

Get the notes, skip the API flag

Paste a long-form video URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

เพิ่ม BibiGPT เป็นแหล่งข้อมูลที่ต้องการบน Google เห็น BibiGPT มากขึ้นใน Top Stories และคำตอบจาก AI

ข้อเท็จจริงสำคัญ (อ่าน 90 วินาที)

ณ 2026-09-04 Google เปิดตัว agentic video understanding เมื่อ 2026-09-01 บน Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite โมเดลค้นหาเฟรม เสียง และทรานสคริปต์แทนการอ่านไฟล์ที่ 1 FPS คงที่ เกณฑ์อย่างเป็นทางการ: ลด usage ได้สูงสุด 88% ต้นทุนวิเคราะห์ต่ำลง 66% ความแม่นยำสูงขึ้น 7% หากต้องการเปลี่ยนบรรยายเป็นโน้ตที่ค้นหาได้ ให้วางลิงก์ใน BibiGPT แทนการต่อ processing=agentic

Features

agentic video understanding คืออะไรจริง ๆ

เป็นโหมดประมวลผล ไม่ใช่ชื่อโมเดลใหม่ โมเดลตัดสินใจว่าจะดูอะไร ด้วยความเร็วเท่าไร และผ่านช่องทางใด — เฟรม เสียง หรือทรานสคริปต์ — แทนการอ่านทุกวินาทีด้วยอัตราคงที่

มาบน Flash สามรุ่น (2026-09-01)

Google เปิดใช้บน Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite บนเกณฑ์วัดของ Google เอง 3.7 Flash อยู่ที่แนวหน้าคุณภาพและต้นทุน นักพัฒนาเปิดใช้ด้วยการตั้ง processing เป็น agentic ใน Gemini API

การค้นหาแบบไดนามิก vs 1 FPS คงที่

โหมดคงที่กินวิดีโอด้วยอัตราเฟรมคงที่ (ค่าเริ่มต้น 1 FPS ปรับได้) โหมด agentic ใช้เครื่องมือวิดีโอเนทีฟเพื่อสแกน ซูม และตรวจเฉพาะช่วงที่ตอบคำถาม — รวมการตัดแบบต่ำกว่าวินาทีที่ 1 FPS จะพลาด

ตัวเลขประสิทธิภาพอย่างเป็นทางการ

บนเกณฑ์วิเคราะห์วิดีโอมานตราด Google รายงานลด usage ได้สูงสุด 88% ต้นทุนวิเคราะห์ต่ำลง 66% และความแม่นยำสูงขึ้น 7% เมื่อเทียบกับการประมวลผลแบบคงที่ กำไรสูงสุดบนฟอร์มยาว (คู่มือ 10 นาทีถึงบรรยาย 90 นาที) นี่คือค่าสูงสุด ไม่ใช่การรับประกันจากการทดสอบครั้งเดียว

หมายความว่าอะไรถ้าคุณทำงานกับวิดีโอยาว

โหมด API ช่วยทีมที่รัน Gemini เองอยู่แล้ว ไม่ได้แทนผลิตภัณฑ์ที่จัดเก็บบท ทรานสคริปต์ และ Q&A ติดตามให้มนุษย์

คุณไม่ต้องตั้ง processing=agentic เอง

วาง URL YouTube หรือบรรยาย รับบทและทรานสคริปต์ จุดของตัวช่วยวิดีโอคือผลลัพธ์ — ไม่ใช่แฟล็กคอนฟิก API

การประหยัด usage มีค่าเมื่อคุณเก็บโน้ตไว้

บรรยาย 90 นาทียังต้องมีตราเวลาและการส่งออก การเรียก agentic ที่ถูกกว่าแต่คุณไม่เก็บไฟล์คือการเสียเปล่า สรุปแบบมีบทคือไฟล์

Gemini App และ Ask YouTube มาทีหลัง

การเปิดตัว 2026-09-01 คือ API + Google AI Studio + Gemini Enterprise Agent Platform สำหรับอัปโหลดและ URL YouTube ด้วยอัตรา usage มาตรฐานโดยไม่มีค่าเพิ่ม Gemini App สำหรับผู้บริโภคและ YouTube Ask YouTube ถูกระบุเป็นพื้นผิวทีหลัง — หน้าที่นี้ไม่สัญญาวันที่

5 การเปลี่ยนแปลงสำคัญ (อ่าน 90 วินาที)

การเปลี่ยนหัวข้อจากการเปิดตัว agentic video ของ Google เมื่อ 2026-09-01

  1. 1

    เป็นโหมด ไม่ใช่ชื่อ SKU ใหม่

    Agentic video understanding เป็นแฟล็กประมวลผลบนโมเดล Flash ที่มีอยู่ คุณไม่ต้องซื้อ Gemini ตัวที่สี่ นักพัฒนาตั้ง processing เป็น agentic ใน Gemini API

  2. 2

    ค้นหาแบบไดนามิกข้ามสามโมดอล

    โหมดคงที่สุ่มตัวอย่างที่ FPS คงที่ (ค่าเริ่มต้น 1) โหมด agentic ตัดสินใจว่าจะดูอะไร ด้วยความเร็วเท่าไร และจะอ่านเฟรม เสียง หรือทรานสคริปต์ — ดึงเฉพาะช่วงที่คำถามต้องการ

  3. 3

    ค่าสูงสุดประสิทธิภาพที่เผยแพร่

    Google รายงานลด usage ได้สูงสุด 88% ต้นทุนวิเคราะห์ต่ำลง 66% และความแม่นยำสูงขึ้น 7% เมื่อเทียบกับการประมวลผลแบบคงที่ เกณฑ์ฟอร์มยาว (1H-VideoQA, LVBench) แสดงการลด usage 88% เกณฑ์ reasoning ที่ยากกว่าประหยัดน้อยกว่า

  4. 4

    วันนี้ live ที่ไหน

    อัปโหลดวิดีโอและ URL YouTube ผ่าน Gemini API ใน Google AI Studio และ Gemini Enterprise Agent Platform อัตรา usage มาตรฐาน ไม่มีค่าเพิ่ม Gemini App และ YouTube Ask YouTube เป็นพื้นผิวทีหลัง

  5. 5

    3.8 Flash เป็นโมเดลที่เกี่ยวข้อง ไม่ใช่ URL นี้

    Gemini 3.8 Flash (2026-09-02) ระบุ agentic video understanding เป็น Preview หน้านี้คือการเปิดตัวความสามารถ 09-01 หนึ่งเจตนาหนึ่ง URL — อย่าแยกคำอธิบายที่สองสำหรับคำค้นเดียวกัน

3 สถานการณ์ทั่วไปสำหรับผู้ใช้ BibiGPT

ที่ไหนโหมด API สำคัญ — และที่ไหนตัวสรุปคือผลิตภัณฑ์จริง

คุณรัน Gemini เองอยู่แล้ว

เปิดการประมวลผล agentic สำหรับเอเจนต์วิดีโอยาว เพื่อเลิกจ่ายทุกเฟรม จากนั้นยังโยนวิดีโอสำเร็จเข้า BibiGPT ให้คนได้บท ไม่ใช่กอง usage ดิบ

คุณต้องการแค่โน้ตบรรยาย

วิดีโอคอร์ส 90 นาทีไม่ต้องการแฟล็ก API วาง URL ส่งออกทรานสคริปต์ ถามต่อ นั่นคือเส้นทาง BibiGPT

คุณกำลังเทียบ Omni กับ agentic video

Omni คือสร้างจากอินพุตใดก็ได้ Agentic video understanding คือวิเคราะห์ไฟล์ที่คุณมีอยู่แล้ว คงคำอธิบาย Omni สำหรับการสร้าง หน้านี้คือ URL โหมดวิเคราะห์

เป็นที่ชื่นชอบของครีเอเตอร์ นักเรียน และนักวิจัย

เหตุผลที่ผู้คนใช้ BibiGPT แปลงวิดีโอเป็นข้อความทุกวัน

ผู้ใช้กว่า 50,000 คนทั่วโลกไว้วางใจ

★★★★★

“แค่วางลิงก์ก็ได้ข้อความซับไตเติลที่เรียบร้อยในไม่กี่วินาที ช่วยประหยัดเวลาพิมพ์ซ้ำหลายชั่วโมงทุกสัปดาห์”

Maya R.

ครีเอเตอร์ · นำวิดีโอสั้นมาใช้ใหม่

★★★★★

“การส่งออกทรานสคริปต์ทำให้ฉันทบทวนคำศัพท์ใหม่ตามจังหวะของตัวเอง โดยไม่ต้องกดหยุดวิดีโอตลอดเวลา”

Daniel K.

ผู้เรียนภาษา · เรียนรู้จากวิดีโอจริง

★★★★★

“ข้อความแม่นยำพร้อมไทม์สแตมป์ที่นำไปอ้างอิงได้ทันที กลายเป็นส่วนหนึ่งของงานประจำวันของฉันไปแล้ว”

Priya S.

นักวิจัย · อ้างอิงงานบรรยายสาธารณะ

คำถามที่พบบ่อย

ถามอะไรก็ได้

Popular guides

ข้ามการตั้งค่า agentic เอาโน้ตไป

วาง URL YouTube บรรยาย หรือพอดแคสต์ยาวใน BibiGPT คุณได้บท ทรานสคริปต์ และ Q&A ติดตาม — โดยไม่ต้องตั้ง processing=agentic หรือเลือก Flash SKU