Llama 4 × BibiGPT
Meta phát hành Llama 4 vào ngày 2025-04-05 — dòng Llama đa phương thức nguyên bản đầu tiên và cũng là dòng đầu tiên Meta áp dụng kiến trúc Mixture-of-Experts (MoE). Scout có 17B tham số hoạt động, 109B tổng tham số, 16 chuyên gia và ngữ cảnh 10M token; Maverick có 17B tham số hoạt động, 400B tổng tham số, 128 chuyên gia và ngữ cảnh 1M. Đây là một trong những nền tảng trọng số mở ngữ cảnh dài đáng chú ý cho tóm tắt video dài, hỏi đáp trên nhiều tài liệu và các quy trình tự vận hành, bên cạnh Mistral Medium 3.5 và DeepSeek-V4.
Sự thật cốt lõi (đọc trong 90 giây)
Tính đến ngày 2026-05-09: Meta công bố Llama 4 vào ngày 2025-04-05 — dòng Llama đa phương thức nguyên bản đầu tiên và cũng là dòng Llama đầu tiên dùng MoE. Scout có 17B tham số hoạt động, 109B tổng, 16 chuyên gia và ngữ cảnh 10M token; Maverick có 17B hoạt động, 400B tổng, 128 chuyên gia và ngữ cảnh 1M. Cả hai đều là trọng số mở, đều chạy được trên máy chủ cấp H100 đơn lẻ và phát hành theo giấy phép cộng đồng Meta Llama 4. Với người dùng BibiGPT, ngữ cảnh 10M của Scout đủ chứa trọn lời thoại hàng chục tập trong một lần yêu cầu — không cắt đoạn, không mất liên kết giữa các đoạn.
Features
Llama 4 thay đổi điều gì?
Hai bản trọng số mở — Scout và Maverick — đều đa phương thức nguyên bản và đều dùng MoE. Scout nhắm tới ngữ cảnh 10M trên một GPU H100 đơn lẻ, còn Maverick nhắm tới khả năng suy luận đa phương thức mạnh nhất phân khúc trên một máy chủ H100 DGX đơn lẻ.
Scout — 17B hoạt động / 109B tổng / ngữ cảnh 10M
Scout là mô hình MoE với 17 tỉ tham số hoạt động, 16 chuyên gia và tổng cộng 109 tỉ tham số. Ngữ cảnh 10M token là mức dài nhất trong nhóm trọng số mở, và khi lượng tử hoá Int4 thì mô hình nằm gọn trên một GPU NVIDIA H100.
Maverick — 17B hoạt động / 400B tổng / ngữ cảnh 1M
Maverick là mô hình MoE với 17 tỉ tham số hoạt động, 128 chuyên gia định tuyến cộng 1 chuyên gia dùng chung, tổng cộng 400 tỉ tham số. Ngữ cảnh 1M token nhắm tới suy luận văn bản dài trên một máy chủ H100 DGX đơn lẻ. Meta cho biết Maverick vượt GPT-4o và Gemini 2.0 Flash trên các bộ benchmark đa phương thức.
Trọng số mở, đa phương thức nguyên bản
Scout và Maverick được phát hành dưới dạng trọng số mở trên llama.com và Hugging Face. Cả hai nhận đầu vào văn bản và hình ảnh nguyên bản, không cần bộ chuyển đổi thị giác riêng, và có thể tự vận hành theo giấy phép cộng đồng Meta Llama 4 — hãy đọc kỹ điều khoản trước khi triển khai thương mại.
Ngữ cảnh 10M cộng trọng số mở có ý nghĩa gì với người dùng BibiGPT
Cốt lõi của BibiGPT là biến video dài và podcast thành ghi chú có cấu trúc. Ngữ cảnh 10M của Scout đủ chứa trọn lời thoại của hàng chục tập trong một lần yêu cầu, còn phần đa phương thức của Maverick coi nội dung thiên về hình ảnh như slide, ảnh chụp màn hình hay khung hình trích xuất là công dân hạng nhất.
Tóm tắt loạt bài giảng nhiều tập
Nạp trọn một khoá học YouTube 20 tập hoặc kho podcast cả năm vào ngữ cảnh 10M của Scout. Những câu hỏi bắc cầu giữa các tập như 'tập nào giới thiệu khái niệm X?' được giải quyết trong một lần suy luận, không cần chỉ mục tìm kiếm.
Hỏi đáp đa phương thức trên slide kèm lời thoại
Ghép lời thoại do BibiGPT trích xuất với ảnh chụp khung hình từ bài giảng hay video demo sản phẩm. Phần đa phương thức nguyên bản của Maverick trả lời được câu hỏi bắc cầu giữa các dạng dữ liệu như 'slide nào diễn giả trình bày sơ đồ kiến trúc?' mà không cần bước nhận dạng ký tự trước đó.
Tự vận hành cho nội dung nhạy cảm
Vì là trọng số mở, bạn có thể chạy Scout hoặc Maverick trên GPU của chính mình. Các cuộc họp nội bộ nhạy cảm, nội dung khoá học trả phí hay tài liệu đào tạo nội bộ đều được tóm tắt ngay trong hệ thống của bạn — âm thanh, lời thoại và khung hình không đi ra ngoài.
5 điểm cốt lõi (đọc trong 90 giây)
Những thay đổi chính trong đợt phát hành Llama 4.
- 1
Ra mắt ngày 2025-04-05
Meta phát hành Llama 4 Scout và Maverick ngày 5 tháng 4 năm 2025 — những bản Llama trọng số mở đầu tiên dùng đa phương thức nguyên bản và kiến trúc MoE.
- 2
Lần đầu Llama dùng MoE
Llama 4 là dòng Llama đầu tiên của Meta áp dụng định tuyến MoE. Dù tổng tham số là 109B (Scout) hay 400B (Maverick), mỗi token chỉ kích hoạt khoảng 17B nên chi phí suy luận vẫn ở mức của một mô hình dense 17B.
- 3
Scout — ngữ cảnh 10M token
Ngữ cảnh 10M của Scout dài hơn mọi bản Llama trọng số mở trước đó và vượt nhiều mô hình đóng cùng thời. Kết quả này đạt được nhờ các lớp attention xen kẽ không dùng position embedding và kỹ thuật điều chỉnh nhiệt độ attention khi suy luận.
- 4
Maverick — 400B / 128 chuyên gia / dẫn đầu đa phương thức
Maverick có 128 chuyên gia định tuyến cộng 1 chuyên gia dùng chung, tổng cộng 400 tỉ tham số. Meta cho biết mô hình vượt GPT-4o và Gemini 2.0 Flash trên các bộ benchmark đa phương thức, và triển khai được trên một máy chủ H100 DGX đơn lẻ.
- 5
Bản xem trước Behemoth (khoảng 2 nghìn tỉ tham số tổng)
Meta đồng thời giới thiệu bản xem trước Llama 4 Behemoth — mô hình dạy với khoảng 2 nghìn tỉ tham số tổng, được dùng để huấn luyện Scout và Maverick. Mô hình này chưa được phát hành dưới dạng trọng số mở.
3 tình huống tiêu biểu của người dùng BibiGPT
Dựa trên các nhóm người dùng BibiGPT thực tế, tất cả đều làm được ngay từ hôm nay.
Khoá học nhiều tập — tóm tắt trong một lần yêu cầu
Dùng BibiGPT trích lời thoại của một khoá học YouTube 20 tập, rồi chạy bước tóm tắt trên Llama 4 Scout. Toàn bộ 20 tập nằm gọn trong ngữ cảnh 10M nên các liên kết bắc cầu giữa các tập được giữ nguyên, và bạn không phải ghép lại các bản tóm tắt từng đoạn.
Hỏi đáp đa phương thức trên slide kèm lời thoại
Kết hợp lời thoại bài giảng do BibiGPT trích xuất với ảnh chụp khung hình. Phần đa phương thức nguyên bản của Maverick trả lời được câu hỏi bắc cầu giữa các dạng dữ liệu như 'slide nào diễn giả trình bày sơ đồ kiến trúc?' — không cần quy trình nhận dạng ký tự, không cần bước tạo chú thích trước.
Tự vận hành vì quyền riêng tư — đưa trọng số mở vào sản xuất
Theo giấy phép cộng đồng Llama 4, bạn vận hành Scout hoặc Maverick trên GPU của mình và đặt BibiGPT ở phía trước để trích lời thoại. Với các cuộc họp nội bộ nhạy cảm hay khoá học trả phí, âm thanh, lời thoại và khung hình không rời khỏi hệ thống, toàn bộ việc tóm tắt hoàn tất trong mạng nội bộ.
Được các nhà sáng tạo, sinh viên và nhà nghiên cứu yêu thích
Lý do mọi người dùng BibiGPT mỗi ngày để chuyển video thành văn bản.
Được hơn 50.000 người dùng trên toàn thế giới tin dùng
“Tôi chỉ cần dán liên kết là có ngay phụ đề sạch sẽ trong vài giây — tiết kiệm hàng giờ gõ lại mỗi tuần.”
Maya R.
Nhà sáng tạo nội dung · Tái sử dụng video ngắn
“Xuất bản ghi giúp tôi ôn từ mới theo nhịp độ riêng thay vì liên tục tạm dừng video.”
Daniel K.
Người học ngoại ngữ · Học qua video thực tế
“Văn bản chính xác kèm dấu thời gian, có thể trích dẫn trực tiếp. Nó đã lặng lẽ trở thành một phần công việc hằng ngày của tôi.”
Priya S.
Nhà nghiên cứu · Trích dẫn các buổi nói chuyện công khai
FAQ
Câu hỏi thường gặp
Hỏi chúng tôi bất cứ điều gì.
Popular guides
1 Công cụ tóm tắt video Bilibili bằng AI: BibiGPT tóm tắt 30+ nền tảng tức thì (2026)
Công cụ tóm tắt video Bilibili bằng AI tốt nhất 2026? BibiGPT hỗ trợ 30+ nền tảng với 1M+ người dùng. Dán bất kỳ liên kết Bilibili nào để có tóm tắt có cấu trúc tức thì. So sánh top 5 công cụ cộng tự động hóa AI agent.
2 Cách cài skill cho DeepSeek Harness: hướng dẫn thực chiến giúp dsh biết xem video
Cài skill tóm tắt video vào DeepSeek Harness chỉ cần copy thư mục — SKILL.md giống Claude Code. Không cần dsh: dán link Bilibili hoặc YouTube trên trình duyệt là có bản tóm tắt kèm mốc thời gian.
3 How to Reverse a Video Without an App — Free, In-Browser, No Download (2026)
Reverse any video free with no app and no download, right in your browser. Step-by-step for iPhone, Android, and PC, plus how to reverse audio (2026).
Tóm tắt khoá học 20 tập chỉ trong một lần yêu cầu
BibiGPT tự động chọn năng lực ngữ cảnh dài phù hợp cho việc tóm tắt video dài và podcast. Chỉ cần dán link YouTube, Bilibili hay podcast là bạn nhận bản tóm tắt trọn lời thoại cùng hỏi đáp AI ở 5 ngôn ngữ — không còn lỗi do cắt đoạn, không mất liên kết giữa các đoạn.