DeepSeek V4-Flash-Vision-Exp: Visual Agent gần Opus 4.8, chưa bằng hiểu cả đoạn video
Bạn vừa xem xong một buổi demo sản phẩm dài bốn mươi phút. Biên bản giọng nói viết rất gọn: tính năng, giá, bước tiếp theo. Rồi diễn giả chỉ vào một tấm hình và nói “nhìn xu hướng này”. Trong biên bản chỉ còn bốn chữ: xem biểu đồ. Bạn tua lại tìm khung hình đó, thanh tiến độ nhảy sang quảng cáo, biểu đồ đã sang trang kế.
Từ ngày 21 tháng 8 năm 2026, chuyện này không còn chỉ là “transcription đủ chưa”. Nó thành một quyết định Visual Agent: mô hình có nhìn thấy tấm hình đó không, và sau khi nhìn thấy, có nối được tới thứ bạn thực sự muốn mang đi không.
Phần lớn bài viết dừng ở “gần Opus-4.8”. Nửa còn lại bài này muốn tách ra là: Visual Agent nhìn được ảnh, chưa bằng hiểu cả đoạn video.
Mục lục
- Ngày 21 tháng 8 đã phát hành gì
- Văn bản giữ nguyên, thị giác nhảy vọt: đọc các con số thế nào
- Visual Agent còn thiếu lớp nào để hiểu cả đoạn video
- Điều này nghĩa là gì với creator, học sinh và dân văn phòng
- Nối hiểu hình ảnh vào workflow
- Dự đoán có thể bị vả mặt
- Câu hỏi thường gặp
Ngày 21 tháng 8 đã phát hành gì
Tính đến ngày 22 tháng 8 năm 2026: DeepSeek trên changelog chính thức đưa lên mô hình đa phương thức thử nghiệm DeepSeek-V4-Flash-Vision-Exp. Tên gọi API là deepseek-v4-flash-vision-exp. Cùng ngày DeepSeek Harness 0.1.1 đã hỗ trợ sẵn.
Chính thức tự kẻ hai đường:
- Phía văn bản ngang V4-Flash: Agent, reasoning, world knowledge không sụp vì thêm thị giác.
- Benchmark Visual Agent gần Opus-4.8: so với V4-Flash thuần văn bản, đây là một bước nhảy “nhìn được”.
Lớp API cũng khóa cứng biên chi phí: ảnh tính theo token, mỗi ảnh tối đa 384 token, giá giống V4-Flash; hỗ trợ Chat Completions, Messages, Responses; ảnh có thể đi base64, URL ngoài, hoặc Files API mới (upload miễn phí một lần, sau đó tái dùng bằng file_id). Cách vào thị giác xem API Guides - Vision. The Decoder bổ sung: JPEG / PNG / GIF / WebP được nhận dạng theo nội dung file, không theo phần mở rộng.
Nó vẫn mang hậu tố Exp. Chính thức chưa đồng thời mở source weight, cũng chưa viết nó thành trạng thái cuối của V4 đa phương thức.
Trang PPT trong khóa học online mới là thứ mô hình thị giác thực sự cần nhìn thấy:
Ảnh chụp: khung hình then chốt của slide và chữ tương ứng. Nguồn: BibiGPT.
Quy tắc thực tế: Đọc thông báo mô hình thử nghiệm, hãy tìm hậu tố trước.
Expdùng thử được, không phải cam kết sản phẩm.
Văn bản giữ nguyên, thị giác nhảy vọt: đọc các con số thế nào
Nguyên văn chính thức là “gần Opus-4.8”. The Next Web đọc hết cùng một bảng: mô hình mới thắng Opus-4.8 3 hạng mục trong 11, còn lại 8 hạng mục thua. NL2Repo là 57.7 đối 69.7, lệch 12 điểm; DSBench-Hard là 63.6 đối 71.7. Các hạng mục gần thì cũng thật gần: Terminal Bench 2.1 là 83.9 đối 85.0, Chartography là 64.3 đối 65.0.
Bước nhảy so với V4-Flash cụ thể hơn. ApexBench Pass@1 từ 26.2 lên 36.5, Agents’ Last Exam từ 25.2 lên 27.3. Chú thích của chính DeepSeek ghi rõ: ở hai hạng mục này, V4-Flash thuần văn bản “bỏ qua các phần tử đa phương thức trong đó”. Nói cách khác, một phần bước nhảy là gắn thêm một con mắt vào bài kiểm tra mù, chứ không phải năng lực văn bản đột ngột nhân đôi.
| Chiều | V4-Flash | V4-Flash-Vision-Exp | Hiểu cả đoạn video |
|---|---|---|---|
| Input | Văn bản | Văn bản + ảnh | Link / file + timeline |
| Agent xem ảnh | Không | Có | Hiểu hình + giọng nói cùng lúc |
| Lời chính thức | Baseline văn bản | Visual Agent gần Opus-4.8 | Workflow sản phẩm, không phải tên benchmark |
| Billing | Giá V4-Flash | Cùng giá, tối đa 384 token/ảnh | Theo lần output, không theo “xem một ảnh” |
Demo: Harness nối mô hình vào task thật như thế nào. Nguồn: giải thích công khai trên YouTube, đối chiếu DeepSeek Harness.
Quy tắc thực tế: Thấy “gần Opus”, hãy đếm nó thắng bao nhiêu hạng mục, thua bao nhiêu. Thắng 3 thua 8 vẫn có thể gọi là gần, nhưng không được viết thành dẫn đầu.
Lớp video dài, chúng tôi đã viết trong workflow ngữ cảnh 1 triệu token của DeepSeek V4; cách cài skill cho Harness xem dsh skill âm thanh-video. Bài này chỉ đánh “Visual Agent → hiểu hình ảnh video”.
Visual Agent còn thiếu lớp nào để hiểu cả đoạn video
Trả lời trước: Agent đọc được ảnh, mặc định ăn một tấm ảnh, một screenshot, một bảng. Cả đoạn video cần chuỗi khung hình liên tục trên timeline, rồi chồng thêm giọng nói, phụ đề, chương.
Kịch bản hợp lệ của V4-Flash-Vision-Exp rất rõ: mô tả ảnh, đọc chữ trên screenshot, xem biểu đồ, nối thứ đã nhìn thấy vào tool call. Đủ để làm GUI Agent, hỏi đáp báo cáo, kiểm tra slide. Thứ nó chưa đủ: trong demo bốn mươi phút biểu đồ chỉ xuất hiện 11 giây, thứ bạn cần là “tấm hình phút thứ 17 nói gì”, chứ không phải “tôi đã upload khung hình này”.
Trạm tiếp theo của office Agent không phải planning thông minh hơn, mà là có nhét được âm thanh-video vào hay không. Ghi hình họp, khóa học online, demo sản phẩm, mặc định vẫn kẹt ở lớp input. Ai nối “khung hình đã nhìn thấy” với “chương tìm kiếm được” trước, người đó mới phủ ba đường tần suất cao của creator, học sinh, dân văn phòng.
Khác biệt tồn đọng cũng nằm ở đây. Ngữ cảnh triệu token giải “một lần nhét được bao dài”; Harness giải “thư mục skill được runtime phát hiện thế nào”. Mô hình thị giác thử nghiệm giải “ảnh có vào Agent được không”. Ba đoạn đều cần, không đoạn nào bằng hiểu video.
Ảnh chụp: bảng phân tích khung hình then chốt. Nguồn: BibiGPT.
Quy tắc thực tế: Visual Agent nhìn được ảnh, chưa bằng xem được cả đoạn video. Thiếu timeline thì chỉ là hỏi đáp album ảnh.
Điều này nghĩa là gì với creator, học sinh và dân văn phòng
Creator. Bạn cần không phải “cover này đẹp”, mà là “clip giải thích 20 phút này có tách thành bài chữ-hình để đăng được không”. Visual Agent giúp bạn đọc một khung biểu đồ; tóm tắt nội dung hình ảnh video giúp bạn xem cả đoạn, rồi nối sang video thành bài chữ-hình.
Học sinh. Giá trị khóa học online thường nằm ở chữ trên bảng và PPT, không ở câu cửa miệng của thầy. Visual Agent hợp để kiểm một trang; cả môn cần lưới khung hình then chốt + phụ đề tương ứng, như lật slide chứ không xem lại bốn tiếng.
Dân văn phòng. Trong ghi hình họp tuần, thứ thực sự không được sót là số trên màn hình chia sẻ. Biên bản thuần văn bản sẽ viết “xem màn hình”. Visual Agent đọc được tấm bạn cắt ra; chương tìm kiếm được cho phép bạn nhảy lại từ “bảng ở phút 23”. Đã phục vụ hơn 1 triệu người dùng, tích lũy hơn 5 triệu lần tóm tắt, phủ 30+ nền tảng — thứ còn thiếu chưa bao giờ là gắn thêm một tên mô hình, mà là giữ khung hình đã nhìn thấy trên timeline.
Bộ lọc lựa chọn chỉ một câu: bạn cần “đọc một tấm ảnh”, hay “mang đi những tấm ảnh đáng nhìn trong cả đoạn video”.
Quy tắc thực tế: Đánh giá mô hình thị giác, hãy hỏi output rơi vào khung hình nào trước. Nói không rõ mốc thời gian thì vẫn chưa phải hiểu video.
Ảnh chụp: chọn mô hình phân tích khung hình then chốt. Nguồn: BibiGPT.
Nối hiểu hình ảnh vào workflow
Phần nhận định dừng ở đây. Cách dùng sản phẩm chỉ để trong mục này. Giả sử bạn đang có một video giải thích kèm biểu đồ:
- Dán link Bilibili / YouTube / podcast, ra chương kèm timestamp trước, đừng cắt ảnh trước.
- Mở tóm tắt trực quan, để hệ thống rút khung hình then chốt, thay vì tự kéo thanh tiến độ cầu may.
- Phân tích hình các khung có biểu đồ, code, chữ bảng, biến “xem biểu đồ” thành điểm chính đọc được.
- Khi cần phân phối lần hai, đi view chữ-hình hoặc slide, thay vì tự cắt cover.
- Quay lại đúng mốc gốc để đối chiếu, đừng coi mô tả của mô hình là sự thật cuối.
Demo đối chiếu: dán một link, xem hình ảnh biến thành điểm chính có thể trích dẫn thế nào.
Turn video frames into illustrated notes
The AI looks at the picture too — slides, charts, on-screen text — and writes it up.
Key frames

On-screen text: nanoGPT
Karpathy live-codes the bigram model — the simplest language model, predicting the next character from the current one.
Cổng tóm tắt chung vẫn là hướng dẫn AI tóm tắt video. Mô hình thị giác thử nghiệm có thể thành một mắt xích “đọc ảnh” trong pipeline này; nó không phải bản thân pipeline. Lúc bài này xuất bản, phía sản phẩm chưa viết mô hình thử nghiệm này là đã tích hợp — viết theo kiểu chủ đề về lần phát hành mô hình thì hợp lệ, gắn “do nó dẫn dắt” thì không.
Ảnh chụp: cổng video thành bài chữ-hình. Nguồn: BibiGPT.
Dự đoán có thể bị vả mặt
Nếu đến tháng 2 năm 2027, Visual Agent chủ đạo vẫn chỉ ăn ảnh đơn / screenshot ngắn, không căn được “bảng ở phút thứ N” trên timeline và viết ra chương tìm kiếm được, thì nhận định “Visual Agent gần flagship ≠ hiểu cả đoạn video” đứng vững. Nếu trong nửa năm xuất hiện benchmark công khai, tái lập được về “hiểu hình ảnh cả đoạn video”, và các mô hình thử nghiệm kiểu Flash Vision đánh ngang thẳng workflow sản phẩm, nhận định này hết hiệu lực.
Câu hỏi thường gặp
V4-Flash-Vision-Exp đã ngang hàng Opus 5 chưa? Chưa. Báo cáo chính thức và bên thứ ba so với Opus-4.8. TNW ghi rõ trong bảng không có cột Opus 5.
384 token một ảnh có đắt không? Lời chính thức là cùng giá với V4-Flash, trần một ảnh 384 token, không mở phí thị giác riêng. Files API miễn phí, hợp để hỏi đi hỏi lại cùng một ảnh.
Khác gì với bài ngữ cảnh triệu token? Bài đó đánh “một lần nhét được bao dài”. Bài này đánh “sau khi gắn mắt vào Agent, workflow video vẫn thiếu timeline”.
BibiGPT đã tích hợp mô hình thử nghiệm này chưa? Không viết theo kiểu bài tích hợp sản phẩm. Trước khi phát hành chưa tích hợp mô hình thử nghiệm này. Mô hình người dùng tự chọn có thể nêu tên; các bước hệ thống tự quyết không gắn “do X dẫn dắt”.
Chỉ muốn xem ảnh, không muốn tóm tắt video, còn cần pipeline này không? Chỉ đọc ảnh thì đi Vision API là đủ. Muốn mang đi biểu đồ, chữ bảng, giao diện demo trong cả đoạn video, vẫn cần chương + khung hình then chốt + timestamp nhảy lại được.
Đọc xong bảng rồi hãy quyết có theo phong trào hay không. Thứ gần flagship là benchmark Visual Agent, không phải “dán link là hiểu được demo bốn mươi phút”. Muốn giữ khung hình đã nhìn thấy trên timeline, dùng BibiGPT chạy thử một link của chính bạn trước.
Bắt đầu ngay, biến hình ảnh video thành điểm chính tìm kiếm được:
- 🌐 Website: https://bibigpt.co
- 📱 Mobile: https://bibigpt.co/app
- 💻 Desktop: https://bibigpt.co/download/desktop
- ✨ Phân tích hình ảnh: Tóm tắt trực quan
BibiGPT Team
Popular tools
More in this series
- Apple iOS 27 Opens Third-Party AI: The Era of Switchable Assistants Is Here — How to Choose for Audio and Video (2026)
- DeepSeek R1 + BibiGPT: A Practical Guide to AI-Powered Audio/Video Understanding in 2025
- DeepSeek-V4 đã đến! BibiGPT ra mắt bốn mô hình mới + 1M context ngay ngày đầu — Tóm tắt video & podcast bằng AI vừa lên cấp
- BibiGPT vs DeepSeek-V4 + Granite Speech Plus 2026: Self-Hosted Open Source vs Productized Stack
- Claude Opus 4.6 Agent Teams Are Here: How AI Agents Are Transforming Video Understanding with BibiGPT