Nemotron-3 Nano Omni × BibiGPT
Ngày 2026-04-28 NVIDIA ra mắt Nemotron-3 Nano Omni - mô hình đa phương thức MoE lai Mamba-Transformer 30B-A3B, kích hoạt khoảng 3B tham số mỗi token để xử lý hợp nhất ảnh, video, âm thanh và văn bản. Có mặt trên Hugging Face ngay ngày đầu, cho phép dùng thương mại đầy đủ theo NVIDIA Open Model Agreement. BibiGPT kết hợp nhiều mô hình đa phương thức tiên tiến và tự chọn theo kịch bản để phục vụ việc hiểu video dài, hỏi đáp âm thanh ngữ cảnh dài và bóc tách tài liệu cho cả nhà sáng tạo lẫn doanh nghiệp.
Sự thật cốt lõi (đọc trong 90 giây)
Ngày 2026-04-28 NVIDIA ra mắt Nemotron-3 Nano Omni - mô hình đa phương thức MoE lai Mamba2-Transformer 30B-A3B, kích hoạt khoảng 3B mỗi token để xử lý hợp nhất ảnh, video, âm thanh và văn bản. Có trên Hugging Face ngày đầu, dùng thương mại đầy đủ theo NVIDIA Open Model Agreement, đồng thời lên OpenRouter và NIM tại build.nvidia.com. Dẫn đầu nhóm ở MMlongbench-Doc, OCRBenchV2, WorldSense và DailyOmni, với thông lượng đa phương thức cao gấp tối đa 9 lần so với mô hình cùng hạng. Với người dùng BibiGPT, đây chính là hình mẫu lớp mô hình đa phương thức đứng sau việc hiểu video dài, podcast và hỏi đáp tài liệu.
Features
Nemotron-3 Nano Omni là gì?
Bản đa phương thức đầu bảng trong họ Nemotron 3 Nano do NVIDIA ra mắt ngày 2026-04-28 - khung xương MoE lai Mamba2-Transformer 30B tham số, 128 chuyên gia, định tuyến top-6, kích hoạt khoảng 3B mỗi token. Một mô hình duy nhất hợp nhất khả năng hiểu ảnh, video, âm thanh và văn bản, dùng được trên Hugging Face ngay ngày đầu.
Khung xương đa phương thức MoE 30B-A3B
Tổng cộng 31B tham số, định tuyến MoE top-6 trên 128 chuyên gia nên chỉ khoảng 3B được kích hoạt mỗi token. Kiến trúc gồm 23 lớp không gian trạng thái chọn lọc Mamba (hiệu quả với ngữ cảnh dài), 23 lớp MoE và 6 lớp chú ý GQA - trí tuệ đa phương thức ngữ cảnh dài với chi phí suy luận chỉ 3B tham số kích hoạt.
Ảnh, video, âm thanh và văn bản trong một mô hình
CRADIO v4-H đảm nhận bộ mã hóa thị giác cho ảnh và khung hình video, còn Parakeet lo bộ mã hóa tiếng nói cho đầu vào âm thanh. Một mô hình xử lý hỏi đáp tài liệu, tóm tắt, gỡ băng và suy luận trên video - không cần dựng ngăn xếp riêng cho từng phương thức.
Có trên Hugging Face ngày đầu, thân thiện thương mại
Phát hành theo NVIDIA Open Model Agreement với quyền dùng thương mại đầy đủ. Cả ba biến thể BF16, FP8 và NVFP4 đều lên Hugging Face ngay ngày đầu (kèm OpenRouter và NIM trên build.nvidia.com) - triển khai cục bộ hay không máy chủ đều thẳng thớm.
Ý nghĩa với người dùng BibiGPT
BibiGPT là trợ lý AI cho âm thanh và video dành cho nhà sáng tạo lẫn doanh nghiệp - tóm tắt video dài, phân tích hình ảnh, bóc tách tài liệu và tạo sản phẩm tri thức. Nemotron-3 Nano Omni là ví dụ điển hình cho lớp mô hình đa phương thức đứng sau những việc đó.
Hiểu video dài trở nên rẻ hơn
Mô hình 30B-A3B chỉ kích hoạt khoảng 3B mỗi token nên chi phí suy luận thấp hơn hẳn một bậc so với mô hình dày đặc 30B, đồng thời dẫn đầu các phép đo video và âm thanh như WorldSense hay DailyOmni. Nghĩa là bài giảng, podcast và hội thảo dài được xử lý ở chất lượng cao mà không đốt ngân sách hạng đầu bảng.
Bóc tách tài liệu và âm thanh trong một lượt
Dẫn đầu nhóm trên MMlongbench-Doc và OCRBenchV2, cộng thêm phần âm thanh nhờ Parakeet. Đây chính là hướng để các luồng hỏi đáp tài liệu, dịch phụ đề và gỡ băng cuộc họp của BibiGPT gói lại trong một lượt xử lý đa phương thức duy nhất.
Mở đường cho biên và tự vận hành
Biến thể FP8 (khoảng 32.8 GB) và NVFP4 (khoảng 20.9 GB) khiến việc triển khai trên một GPU đơn trở nên khả thi. Với khách hàng API doanh nghiệp của BibiGPT, đây là lựa chọn đa phương thức chạy tại chỗ cho video nhạy cảm - thay vì buộc phải dùng mô hình đầu bảng chỉ có trên máy chủ.
5 thay đổi cốt lõi (đọc trong 90 giây)
Những điểm nổi bật trong đợt ra mắt Nemotron-3 Nano Omni ngày 2026-04-28.
- 1
MoE 30B-A3B bước sang đa phương thức
NVIDIA mở rộng họ Nemotron 3 Nano thành mô hình hợp nhất ảnh/video/âm thanh/văn bản. Tổng 31B, kích hoạt khoảng 3B mỗi token nhờ MoE top-6 trên 128 chuyên gia - đa phương thức ngữ cảnh dài với chi phí suy luận của một mô hình dày đặc 3B.
- 2
Khung xương lai Mamba2-Transformer
Kiến trúc xen kẽ 23 lớp không gian trạng thái chọn lọc Mamba, 23 lớp MoE và 6 lớp chú ý GQA. Mamba gánh phần nặng của ngữ cảnh dài, MoE cấp dung lượng có điều kiện, còn GQA lo phần chú ý ở những vị trí quan trọng nhất.
- 3
Hợp nhất bộ mã hóa thị giác và âm thanh
CRADIO v4-H xử lý ảnh và khung hình video, Parakeet xử lý âm thanh. Một mô hình phủ bóc tách tài liệu, hiểu video, gỡ băng và hỏi đáp âm thanh - không cần ngăn xếp riêng cho từng phương thức.
- 4
Hugging Face ngày đầu kèm giấy phép thương mại
Phát hành theo NVIDIA Open Model Agreement với quyền dùng thương mại đầy đủ. BF16, FP8 và NVFP4 lên Hugging Face ngay ngày đầu, kèm OpenRouter (có hạng miễn phí) và dịch vụ vi mô NIM tại build.nvidia.com.
- 5
Lượng tử hóa cho phép chạy trên một GPU đơn
Biến thể FP8 nặng khoảng 32.8 GB (8.5 bit mỗi trọng số, tính cả bộ nhớ đệm KV FP8), còn NVFP4 độ chính xác hỗn hợp khoảng 20.9 GB (khoảng 4.98 bit mỗi trọng số). Điều này mở đường tự triển khai cho doanh nghiệp cần suy luận đa phương thức tại chỗ.
3 tình huống tiêu biểu của người dùng BibiGPT
Những nơi Nemotron-3 Nano Omni mang lại giá trị lớn nhất cho nhà sáng tạo và khách hàng doanh nghiệp của BibiGPT.
Hiểu video dài với chi phí kích hoạt thấp
BibiGPT tóm tắt bài giảng 90 phút, podcast và hội thảo. Mô hình MoE 30B-A3B chỉ kích hoạt khoảng 3B mỗi token nên chi phí suy luận chỉ bằng một phần nhỏ so với mô hình dày đặc 30B, trong khi vẫn dẫn đầu các phép đo video và âm thanh WorldSense hay DailyOmni.
Hỏi đáp tài liệu và bóc tách âm thanh trong một mô hình
Nemotron-3 Nano Omni dẫn đầu nhóm ở MMlongbench-Doc và OCRBenchV2, đồng thời xử lý âm thanh nhờ Parakeet. Đây là hướng để các luồng hỏi đáp tài liệu, dịch phụ đề và gỡ băng cuộc họp của BibiGPT hội tụ vào một lượt xử lý đa phương thức duy nhất.
Đa phương thức tại chỗ cho khách hàng API doanh nghiệp
Biến thể FP8 (khoảng 32.8 GB) và NVFP4 (khoảng 20.9 GB) khiến triển khai trên một GPU đơn trở nên khả thi. Với khách hàng API doanh nghiệp của BibiGPT xử lý video nhạy cảm, Nemotron-3 Nano Omni là lựa chọn chạy tại chỗ thay vì buộc phải dùng mô hình đầu bảng chỉ có trên máy chủ.
Được các nhà sáng tạo, sinh viên và nhà nghiên cứu yêu thích
Lý do mọi người dùng BibiGPT mỗi ngày để chuyển video thành văn bản.
Được hơn 50.000 người dùng trên toàn thế giới tin dùng
“Tôi chỉ cần dán liên kết là có ngay phụ đề sạch sẽ trong vài giây — tiết kiệm hàng giờ gõ lại mỗi tuần.”
Maya R.
Nhà sáng tạo nội dung · Tái sử dụng video ngắn
“Xuất bản ghi giúp tôi ôn từ mới theo nhịp độ riêng thay vì liên tục tạm dừng video.”
Daniel K.
Người học ngoại ngữ · Học qua video thực tế
“Văn bản chính xác kèm dấu thời gian, có thể trích dẫn trực tiếp. Nó đã lặng lẽ trở thành một phần công việc hằng ngày của tôi.”
Priya S.
Nhà nghiên cứu · Trích dẫn các buổi nói chuyện công khai
FAQ
Câu hỏi thường gặp
Hỏi chúng tôi bất cứ điều gì.
Popular guides
1 Công cụ tóm tắt video Bilibili bằng AI: BibiGPT tóm tắt 30+ nền tảng tức thì (2026)
Công cụ tóm tắt video Bilibili bằng AI tốt nhất 2026? BibiGPT hỗ trợ 30+ nền tảng với 1M+ người dùng. Dán bất kỳ liên kết Bilibili nào để có tóm tắt có cấu trúc tức thì. So sánh top 5 công cụ cộng tự động hóa AI agent.
2 Cách cài skill cho DeepSeek Harness: hướng dẫn thực chiến giúp dsh biết xem video
Cài skill tóm tắt video vào DeepSeek Harness chỉ cần copy thư mục — SKILL.md giống Claude Code. Không cần dsh: dán link Bilibili hoặc YouTube trên trình duyệt là có bản tóm tắt kèm mốc thời gian.
3 How to Reverse a Video Without an App — Free, In-Browser, No Download (2026)
Reverse any video free with no app and no download, right in your browser. Step-by-step for iPhone, Android, and PC, plus how to reverse audio (2026).
Tóm tắt video dài với BibiGPT - đứng sau là lớp mô hình đa phương thức thế hệ mới
BibiGPT kết hợp nhiều mô hình AI đa phương thức tiên tiến để hiểu video, âm thanh và tài liệu dài. Dán liên kết Bilibili / YouTube / podcast hoặc tải tệp lên - bạn nhận tóm tắt, sơ đồ tư duy, hỏi đáp AI và cả bản dựng lại thành video ngắn mà không rời khỏi luồng làm việc.