DeepSeek V4 Preview × BibiGPT - hai phiên bản Pro và Flash
DeepSeek công bố dòng V4 Preview ngày 2026-04-24 - hai phiên bản V4-Pro (1.6T MoE / 49B kích hoạt) và V4-Flash (284B / 13B kích hoạt), cửa sổ ngữ cảnh 1 triệu token, cơ chế chú ý Hybrid CSA+HCA mới cùng ba chế độ API Fast / Expert / Vision. Người dùng BibiGPT sẽ chạy được phần tóm tắt video dài, podcast và nhiều tài liệu trên dòng Preview này sau khi nó được tích hợp vào lớp định tuyến.
Sự thật cốt lõi (đọc 90 giây)
Tính đến 2026-05-08: DeepSeek công bố dòng V4 Preview ngày 2026-04-24. Hai phiên bản ra cùng lúc - V4-Pro (1.6T MoE / 49B kích hoạt) và V4-Flash (284B / 13B kích hoạt) - đều có cửa sổ ngữ cảnh 1 triệu token, cơ chế chú ý Hybrid CSA + HCA mới và ba chế độ API Fast / Expert / Vision. So với bản V4 trước đó (được nói riêng ở /features/deepseek-v4-1m-context-explained), tin chính của V4 Preview là việc tách hai phiên bản, nâng cấp cơ chế chú ý Hybrid CSA+HCA và API ba chế độ rõ ràng - chứ không phải cú nhảy 1M. Với người dùng BibiGPT: V4-Flash là mặc định rẻ cho tóm tắt video dài và podcast, V4-Pro để dành cho suy luận khó hơn trên cùng bản ghi lời, còn chế độ Vision ghép tự nhiên với quy trình trích khung hình của BibiGPT. Nguồn chính thức: news260424 trên api-docs.deepseek.com và bộ sưu tập deepseek-ai trên Hugging Face.
Features
DeepSeek V4 Preview có gì mới?
Hai phiên bản ra mắt cùng ngày 2026-04-24 - V4-Pro và V4-Flash. Cả hai đều có cửa sổ ngữ cảnh 1 triệu token, cơ chế chú ý Hybrid CSA+HCA mới và truy cập được qua ba chế độ API.
Hai phiên bản Pro và Flash
V4-Pro là bản checkpoint 1.6T MoE với 49B tham số kích hoạt trên mỗi token. V4-Flash là bản checkpoint 284B MoE chỉ kích hoạt 13B trên mỗi token - cùng cửa sổ ngữ cảnh, cùng cơ chế chú ý, nhưng dấu chân suy luận nhẹ hơn nhiều và chi phí mỗi token chỉ bằng một phần.
Cơ chế chú ý Hybrid CSA + HCA
V4 Preview thay cơ chế chú ý thuần MoE cũ bằng Hybrid CSA + HCA (cross-shared attention kết hợp hierarchical-causal attention). Thiết kế lai này nhằm giữ tính nhất quán ngữ nghĩa xuyên suốt tài liệu dài - không suy giảm khi tiến về cuối cửa sổ ngữ cảnh.
Ba chế độ API - Fast / Expert / Vision
Mỗi phiên bản Preview đều mở ba chế độ. Fast ưu tiên thông lượng, Expert ưu tiên chất lượng suy luận, Vision bổ sung đầu vào đa phương thức trên cùng bộ khung - một bề mặt API, ba núm xoay để cân giữa chi phí, chất lượng và phương thức.
V4 Preview có ý nghĩa gì với người dùng BibiGPT
BibiGPT biến video dài và podcast thành ghi chú có cấu trúc. V4-Flash hạ mạnh chi phí mỗi token cho việc tóm tắt trong ngữ cảnh 1M, V4-Pro dành cho những lượt suy luận khó nhất, còn chế độ Vision ghép rất tự nhiên với quy trình phân tích màn hình - cùng một ngân sách ngữ cảnh, ba nấc điều chỉnh.
Ngữ cảnh 1M - podcast 8 tiếng trong một lượt
Một triệu token đủ chứa bản ghi hội nghị 8 tiếng, trọn một chuỗi khóa học nhiều buổi hay cả chồng tài liệu liên quan trong một câu lệnh. Dây chuyền cắt nhỏ rồi ghép lại của BibiGPT co về một lượt suy luận duy nhất, nên không còn mất tham chiếu từ giờ thứ nhất tới giờ thứ tám.
Tóm tắt ngữ cảnh dài giá rẻ với V4-Flash
V4-Flash chỉ kích hoạt 13B tham số trên mỗi token. Với khối lượng việc kiểu BibiGPT - đầu vào là bản ghi lời dài, đầu ra là dàn ý có cấu trúc - Flash là điểm tối ưu về chi phí và chất lượng ở bậc ngữ cảnh 1M. Pro để dành cho những lượt suy luận khó hơn trên cùng bản ghi lời đó.
Chế độ Vision + phân tích màn hình của BibiGPT
V4-Vision nhận ảnh chụp màn hình và khung hình video làm đầu vào. Quy trình phân tích màn hình sẵn có của BibiGPT - trích khung hình chính từ video rồi hỏi mô hình xem trên màn hình có gì - sẽ nối thẳng vào V4-Vision sau khi tích hợp vào lớp định tuyến, để hỏi đáp theo từng khung hình gói gọn trong một lượt suy luận.
5 thay đổi cốt lõi (đọc 90 giây)
Những thay đổi chính trong bản phát hành DeepSeek V4 Preview ngày 2026-04-24.
- 1
Hai phiên bản Pro và Flash
V4-Pro 1.6T MoE / 49B kích hoạt. V4-Flash 284B / 13B kích hoạt - cùng cửa sổ ngữ cảnh và cơ chế chú ý, nhưng tải suy luận nhẹ hơn hẳn. Flash dùng cho tóm tắt ngữ cảnh dài giá rẻ, Pro dùng cho suy luận khó hơn trên cùng bản ghi lời.
- 2
Cơ chế chú ý Hybrid CSA + HCA
Cross-shared attention kết hợp hierarchical-causal attention thay cho cơ chế chú ý thuần MoE của V4. Cơ chế lai này được thiết kế để giữ tính nhất quán ngữ nghĩa trên toàn bộ ngữ cảnh 1 triệu token - đúng kiểu lỗi mà tóm tắt video dài hay mắc phải.
- 3
Ba chế độ API - Fast / Expert / Vision
Mỗi phiên bản Preview mở Fast (thông lượng), Expert (chất lượng suy luận) và Vision (đầu vào đa phương thức) trên cùng một API. Một ngân sách ngữ cảnh, ba núm xoay để cân chi phí, chất lượng và phương thức.
- 4
Ngữ cảnh 1M, thân thiện với podcast 8 tiếng
Cả Pro lẫn Flash đều giữ cửa sổ ngữ cảnh 1 triệu token của họ V4. Bản ghi hội nghị 8 tiếng hay một khóa học nhiều buổi vào gọn trong một câu lệnh, giúp co dây chuyền cắt nhỏ rồi ghép lại của BibiGPT về một lượt suy luận duy nhất.
- 5
Trọng số mở trên Hugging Face cùng tuần
Các checkpoint V4 Preview lên bộ sưu tập deepseek-ai trên Hugging Face ngay trong tuần đó. Với khối lượng việc nhạy cảm về quyền riêng tư - nội dung khóa học trả phí, bản ghi họp nội bộ - bạn có thể tự vận hành mà không cần gửi âm thanh hay bản ghi lời sang API bên thứ ba.
3 kịch bản phổ biến của người dùng BibiGPT
Dựa trên nhóm người dùng BibiGPT thực tế - làm được ngay hôm nay: dùng BibiGPT trích bản ghi lời rồi gọi thẳng V4 Preview cho tới khi có định tuyến gốc.
Nhà sáng tạo - dàn ý podcast 8 tiếng trong một câu lệnh
Dùng BibiGPT trích bản ghi lời của một podcast 8 tiếng hay bản ghi hội nghị cả ngày, rồi định tuyến bước dàn ý và tóm tắt sang chế độ Expert của V4-Flash. Toàn bộ bản ghi lời nằm gọn trong ngữ cảnh 1M nên các tham chiếu chương giữ được sự nhất quán từ đầu tới cuối.
Sinh viên - hỏi đáp xuyên nhiều buổi của một khóa học
Nối các bản ghi lời bài giảng nhiều buổi trích từ BibiGPT. Trong khoảng dư 1M, câu hỏi kiểu buổi nào đã nói về X được giải quyết thẳng trong một lượt suy luận của V4-Flash - không cần chỉ mục tìm kiếm bên ngoài vốn hay bỏ sót trích dẫn nằm giữa ranh giới các buổi.
Người dùng nâng cao - phân tích màn hình theo từng khung hình với V4-Vision
Dùng BibiGPT trích khung hình chính từ bài thuyết trình slide hay video nhiều biểu đồ, rồi gửi khung hình kèm bản ghi lời sang V4-Vision. Hỏi đáp theo từng khung hình - trục Y của slide trang 14 là gì - gói gọn trong một lượt suy luận, không cần bộ mô tả ảnh riêng.
Được các nhà sáng tạo, sinh viên và nhà nghiên cứu yêu thích
Lý do mọi người dùng BibiGPT mỗi ngày để chuyển video thành văn bản.
Được hơn 50.000 người dùng trên toàn thế giới tin dùng
“Tôi chỉ cần dán liên kết là có ngay phụ đề sạch sẽ trong vài giây — tiết kiệm hàng giờ gõ lại mỗi tuần.”
Maya R.
Nhà sáng tạo nội dung · Tái sử dụng video ngắn
“Xuất bản ghi giúp tôi ôn từ mới theo nhịp độ riêng thay vì liên tục tạm dừng video.”
Daniel K.
Người học ngoại ngữ · Học qua video thực tế
“Văn bản chính xác kèm dấu thời gian, có thể trích dẫn trực tiếp. Nó đã lặng lẽ trở thành một phần công việc hằng ngày của tôi.”
Priya S.
Nhà nghiên cứu · Trích dẫn các buổi nói chuyện công khai
FAQ
Câu hỏi thường gặp
Hỏi chúng tôi bất cứ điều gì.
Popular guides
1 Công cụ tóm tắt video Bilibili bằng AI: BibiGPT tóm tắt 30+ nền tảng tức thì (2026)
Công cụ tóm tắt video Bilibili bằng AI tốt nhất 2026? BibiGPT hỗ trợ 30+ nền tảng với 1M+ người dùng. Dán bất kỳ liên kết Bilibili nào để có tóm tắt có cấu trúc tức thì. So sánh top 5 công cụ cộng tự động hóa AI agent.
2 Cách cài skill cho DeepSeek Harness: hướng dẫn thực chiến giúp dsh biết xem video
Cài skill tóm tắt video vào DeepSeek Harness chỉ cần copy thư mục — SKILL.md giống Claude Code. Không cần dsh: dán link Bilibili hoặc YouTube trên trình duyệt là có bản tóm tắt kèm mốc thời gian.
3 How to Reverse a Video Without an App — Free, In-Browser, No Download (2026)
Reverse any video free with no app and no download, right in your browser. Step-by-step for iPhone, Android, and PC, plus how to reverse audio (2026).
Chạy V4-Flash trên podcast trong ngữ cảnh 1M - bắt đầu bằng bản ghi lời từ BibiGPT
BibiGPT trích bản ghi lời dài từ liên kết YouTube, Bilibili và podcast bằng 5 ngôn ngữ. V4-Flash là điểm tóm tắt ngữ cảnh 1M rẻ nhất ở bậc này, V4-Pro dành cho suy luận khó nhất, còn V4-Vision cho phân tích theo từng khung hình. Khi V4 Preview được tích hợp vào định tuyến của BibiGPT, cả quy trình sẽ chạy trọn vẹn sau một liên kết duy nhất.