DeepSeek V4-Flash-Vision-Exp: 비전 Agent가 Opus 4.8에 가깝다고, 전체 영상을 이해한다는 뜻은 아니다
방금 마흔 분짜리 제품 데모를 다 봤습니다. 음성 회의록은 기능, 가격, 다음 단계까지 깔끔합니다. 그런데 발표자가 한 장을 가리키며 「이 추세 보세요」라고 합니다. 회의록에는 네 글자만 남습니다. 차트 참조. 그 프레임을 찾으러 되감으면 진행 바는 광고로 건너뛰고, 차트는 이미 다음 장으로 바뀌어 있습니다.
이 문제는 2026년 8월 21일부터 「전사만으로 충분한가」의 문제가 아닙니다. 비전 Agent 결정이 됩니다. 모델이 그 그림을 볼 수 있는가, 그리고 본 뒤에 당신이 실제로 가져가야 할 산출물까지 연결할 수 있는가.
대부분 기사는 「Opus-4.8에 근접」에서 멈춥니다. 이 글이 풀려는 건 다른 절반입니다. 비전 Agent가 그림을 볼 수 있다고 해서, 전체 영상을 이해한다는 뜻은 아닙니다.
목차
- 8월 21일에 무엇을 발표했나
- 텍스트는 동등, 비전은 도약: 숫자를 어떻게 읽을까
- 비전 Agent가 전체 영상을 이해하기까지 부족한 한 층
- 크리에이터·학생·직장인에게 각각 무엇을 의미하나
- 화면 이해를 워크플로에 연결하기
- 반증 가능한 예측
- 자주 묻는 질문
8월 21일에 무엇을 발표했나
2026년 8월 22일 기준: DeepSeek가 공식 changelog에 실험용 멀티모달 모델 DeepSeek-V4-Flash-Vision-Exp를 올렸습니다. 호출 이름은 deepseek-v4-flash-vision-exp입니다. 같은 날 DeepSeek Harness 0.1.1에도 내장 지원이 들어갔습니다.
공식은 스스로 두 줄을 그었습니다.
- 텍스트 측은 V4-Flash와 동등: Agent, 추론, 세계 지식이 비전을 붙였다고 무너지지 않습니다.
- 비전 Agent 벤치마크는 Opus-4.8에 근접: 순수 텍스트 V4-Flash 대비 「볼 수 있게」된 한 번의 도약입니다.
API 계층도 비용 경계를 못 박았습니다. 이미지는 토큰으로 과금되며 장당 최대 384 token, 가격은 V4-Flash와 동일합니다. Chat Completions, Messages, Responses를 지원하고, 이미지는 base64, 외부 URL, 또는 새로 올라온 Files API(한 번 무료 업로드 후 file_id로 재사용)로 넣을 수 있습니다. 비전 입문은 API Guides - Vision을 보세요. The Decoder는 JPEG / PNG / GIF / WebP를 확장명이 아니라 파일 내용으로 포맷을 인식한다고 보충합니다.
여전히 Exp 접미사가 붙어 있습니다. 공식은 가중치를 동시 오픈소스하지 않았고, V4 멀티모달의 최종형으로 쓰지도 않았습니다.
온라인 강의의 그 PPT 한 장이야말로 비전 모델이 진짜로 봐야 할 대상입니다.
캡션: 강의 자료 키프레임과 대응 텍스트. 출처: BibiGPT.
실무 규칙: 실험 모델 공고를 읽을 때는 먼저 접미사를 찾으세요.
Exp는 써볼 수 있다는 뜻이지, 제품 약속이 아닙니다.
텍스트는 동등, 비전은 도약: 숫자를 어떻게 읽을까
공식 원문은 「Opus-4.8에 근접」입니다. The Next Web은 같은 표를 끝까지 읽었습니다. 새 모델은 11개 항목 중 Opus-4.8을 3개에서 이겼고, 나머지 8개는 뒤처집니다. NL2Repo는 57.7 대 69.7로 12점 차이, DSBench-Hard는 63.6 대 71.7입니다. 가까운 항목은 정말 가깝습니다. Terminal Bench 2.1은 83.9 대 85.0, Chartography는 64.3 대 65.0입니다.
V4-Flash 대비 도약은 더 구체적입니다. ApexBench Pass@1은 26.2에서 36.5로, Agents’ Last Exam은 25.2에서 27.3으로 올랐습니다. DeepSeek 자체 각주는 이 두 항목에서 순수 텍스트 V4-Flash가 「그중 멀티모달 요소를 무시」한다고 밝힙니다. 즉 도약의 일부는 블라인드 테스트에 눈을 하나 달아 준 것이지, 텍스트 능력이 갑자기 두 배가 된 게 아닙니다.
| 차원 | V4-Flash | V4-Flash-Vision-Exp | 전체 영상을 봄 |
|---|---|---|---|
| 입력 | 텍스트 | 텍스트 + 이미지 | 링크 / 파일 + 타임라인 |
| Agent 이미지 인식 | 아니오 | 예 | 화면 + 음성을 함께 이해 |
| 공식 표현 | 텍스트 기준선 | 비전 Agent가 Opus-4.8에 근접 | 제품 워크플로, 벤치마크 이름이 아님 |
| 과금 | V4-Flash 가격 | 동일 가격, 이미지 장당 최대 384 token | 산출 단위, 「이미지 한 장 보기」 단위가 아님 |
데모: Harness가 모델을 실제 작업에 연결하는 방식. 출처: YouTube 공개 해설, 대조 DeepSeek Harness.
실무 규칙: 「Opus에 근접」을 보면 먼저 이긴 항목과 진 항목을 세요. 3승 8패여도 근접은 가능하지만, 선도로 쓸 수는 없습니다.
긴 영상 계층은 DeepSeek V4 백만 컨텍스트 워크플로에서 다뤘고, Harness skill 설치는 dsh 음영상 skill을 보세요. 이 글은 「비전 Agent → 영상 화면 이해」만 다룹니다.
비전 Agent가 전체 영상을 이해하기까지 부족한 한 층
답을 먼저 말합니다. 이미지를 읽는 Agent가 기본으로 먹는 건 이미지 한 장, 스크린샷 한 장, 표 한 장입니다. 전체 영상이 필요한 건 타임라인 위의 연속 화면이고, 그 위에 음성·자막·챕터가 겹칩니다.
V4-Flash-Vision-Exp의 합법적 장면은 분명합니다. 이미지 설명, 스크린샷 텍스트 읽기, 차트 보기, 본 것을 도구 호출에 연결하기. 이 정도면 GUI Agent, 리포트 Q&A, 슬라이드 샘플 검수에 충분합니다. 부족한 건 이겁니다. 마흔 분 데모에서 차트가 11초 등장했고, 당신이 원하는 건 「17분째 그 장이 무슨 말이냐」이지 「이 프레임을 업로드했다」가 아닙니다.
업무 Agent의 다음 정거장은 더 똑똑한 계획이 아니라, 음영상을 넣어줄 수 있는가입니다. 회의 녹화, 온라인 강의, 제품 데모는 여전히 기본이 입력 계층에서 막힙니다. 「본 프레임」을 「검색 가능한 챕터」에 먼저 연결하는 쪽이 크리에이터·학생·직장 세 갈래 고빈도 경로를 덮습니다.
기존 차이도 여기에 있습니다. 백만 컨텍스트는 「한 번에 얼마나 길게 넣을지」를 풀고, Harness는 「skill 폴더를 runtime이 어떻게 찾을지」를 풉니다. 비전 실험 모델은 「이미지가 Agent에 들어갈 수 있는지」를 풉니다. 세 구간 모두 필요하지만, 어느 한 구간도 영상을 이해했다는 뜻은 아닙니다.
캡션: 키프레임 분석 패널. 출처: BibiGPT.
실무 규칙: 비전 Agent가 그림을 볼 수 있다고 해서, 전체 영상을 볼 수 있는 건 아닙니다. 타임라인이 없으면 앨범 Q&A일 뿐입니다.
크리에이터·학생·직장인에게 각각 무엇을 의미하나
크리에이터. 원하는 건 「이 커버가 예쁘다」가 아니라 「이 20분 해설을 배포 가능한 아티클로 쪼갤 수 있느냐」입니다. 비전 Agent는 차트 프레임 하나를 읽어 주고, 영상 화면 콘텐츠 요약은 전체를 본 뒤 영상→아티클로 이어 줍니다.
학생. 온라인 강의의 가치는 종종 판서와 PPT에 있지, 선생님의 입버릇에 있지 않습니다. 비전 Agent는 특정 페이지 샘플 검수에 맞고, 한 과목 전체에는 키프레임 그리드 + 대응 자막이 필요합니다. 네 시간을 다시 보는 게 아니라 강의 자료를 넘기는 감각입니다.
직장인. 주간 회의 녹화에서 정말 놓치면 안 되는 건 공유 화면 위의 숫자입니다. 순수 텍스트 회의록은 「화면 참조」로 씁니다. 비전 Agent는 당신이 잘라 둔 그 장을 읽고, 검색 가능한 챕터는 「23분째 표」로 되돌아갈 수 있게 합니다. 이미 100만 명 이상 사용자, 누적 500만 회 이상 요약, 30+ 플랫폼을 다루고 있으며, 부족한 건 모델 이름을 하나 더 붙이는 일이 아니라 본 프레임을 타임라인에 남기는 일입니다.
선택 필터는 한 문장뿐입니다. 원하는 게 「이미지 한 장 읽기」인가, 「전체 영상에서 봐야 할 그 장들을 가져가기」인가.
실무 규칙: 비전 모델을 평가할 때는 먼저 산출이 어느 프레임에 떨어지는지 물으세요. 시점 설명이 안 되면 아직 영상 이해가 아닙니다.
캡션: 키프레임 분석의 모델 선택. 출처: BibiGPT.
화면 이해를 워크플로에 연결하기
판단 장은 여기까지입니다. 제품을 어떻게 쓰는지는 이 절에만 둡니다. 차트 있는 해설 영상 하나가 손에 있다고 가정합니다.
- Bilibili / YouTube / 팟캐스트 링크를 붙여 넣고, 먼저 타임스탬프 챕터를 뽑으세요. 스크린샷부터 하지 마세요.
- 시각화 요약을 열어 시스템이 키프레임을 뽑게 하세요. 진행 바를 직접 끌어 운에 맡기지 마세요.
- 차트·코드·판서가 있는 프레임에 화면 분석을 돌려 「차트 참조」를 읽을 수 있는 요점으로 바꾸세요.
- 2차 배포가 필요하면 아티클 또는 강의 자료 뷰로 가세요. 커버를 또 손으로 따지 마세요.
- 원래 시점으로 돌아가 대조하세요. 모델 설명을 최종 사실로 두지 마세요.
대조 데모: 링크 하나를 붙여 넣고, 화면이 인용 가능한 요점으로 바뀌는 과정을 보세요.
영상 화면을 그림+글 노트로
AI는 소리뿐 아니라 화면도 봅니다——슬라이드, 도표, 화면 속 글자까지 정리해 줍니다.
주요 장면

화면 속 글자: nanoGPT
Karpathy가 bigram 모델을 라이브 코딩 — 현재 글자로 다음 글자를 예측하는 가장 단순한 모델.
범용 요약 입구는 여전히 AI 영상 요약 가이드입니다. 비전 실험 모델은 이 생산 라인에서 「이미지 읽기」 한 고리가 될 수 있습니다. 생산 라인 자체는 아닙니다. 이 글 발행 시점에 제품 측은 해당 실험 모델을 이미 연동했다고 쓰지 않았습니다. 토픽형으로 모델 발표를 쓰는 건 합법이고, 전속 엔진 마케팅으로 묶는 건 합법이 아닙니다.
캡션: 영상→아티클 입구. 출처: BibiGPT.
반증 가능한 예측
2027년 2월까지 주류 비전 Agent가 여전히 단일 이미지 / 짧은 스크린샷만 먹고, 타임라인에서 「N분째 그 표」에 정렬해 검색 가능한 챕터를 쓰지 못한다면, 「비전 Agent가 플래그십에 근접 ≠ 전체 영상을 이해」라는 판단은 성립합니다. 반년 안에 공개·재현 가능한 「전체 영상 화면 이해」 벤치마크가 나오고 Flash Vision급 실험 모델이 제품 워크플로를 직접 따라잡으면, 이 판단은 폐기됩니다.
자주 묻는 질문
V4-Flash-Vision-Exp가 이미 Opus 5를 겨냥한 건가요? 아닙니다. 공식과 제3자 보도가 비교하는 건 Opus-4.8입니다. TNW는 표에 Opus 5 열이 없다고 명시했습니다.
이미지당 384 token은 비싼가요? 공식 표현은 V4-Flash와 동일 가격, 장당 상한 384 token이며 별도 비전 전용 요금은 없습니다. Files API는 무료라 같은 이미지를 반복 질의하기에 맞습니다.
백만 컨텍스트 그 글과는 뭐가 다른가요? 그 글은 「한 번에 얼마나 길게 넣을지」를 다룹니다. 이 글은 「눈을 Agent에 붙인 뒤, 영상 워크플로에 아직 타임라인이 빠진다」를 다룹니다.
BibiGPT가 이미 이 실험 모델을 연동했나요? 제품 통합 원고로는 쓰지 않았습니다. 발행 전 해당 실험 모델은 연동되지 않았습니다. 사용자가 고를 수 있는 모델은 이름을 말해도 되고, 시스템이 자동 결정하는 구간은 전속 엔진 카피로 묶지 않습니다.
이미지만 보고 싶고 영상 요약은 안 해도 되는데, 이 생산 라인이 필요한가요? 이미지만 읽으면 비전 API로 충분합니다. 전체 영상 안의 차트·판서·데모 UI를 가져가려면 여전히 챕터 + 키프레임 + 되돌아갈 수 있는 타임스탬프가 필요합니다.
표를 다 읽고 나서 유행을 따를지 결정하세요. 플래그십에 가까운 건 비전 Agent 벤치마크이지, 「링크를 붙여 넣으면 마흔 분 데모를 이해한다」가 아닙니다. 본 프레임을 타임라인에 남기려면 BibiGPT로 당신 링크 하나부터 돌려 보세요.
지금 시작해서, 영상 화면을 검색 가능한 요점으로 바꾸세요.
- 🌐 공식 사이트: https://bibigpt.co
- 📱 모바일: https://bibigpt.co/app
- 💻 데스크톱: https://bibigpt.co/download/desktop
- ✨ 화면 분석: 시각화 요약
BibiGPT 팀
이 시리즈의 다른 글
- Apple iOS 27, 서드파티 AI 개방: 자유롭게 전환할 수 있는 AI 어시스턴트 시대 — 영상·오디오 환경에서 어떻게 선택할까 (2026)
- DeepSeek R1 + BibiGPT: 2025 AI 오디오·비디오 이해 실전 가이드
- DeepSeek-V4 출시! BibiGPT 당일 4개 신규 모델 + 1M 컨텍스트 탑재 — AI 영상·팟캐스트 요약 경험 한 단계 업그레이드
- BibiGPT vs DeepSeek-V4 + Granite Speech Plus 2026 비교: 셀프 호스팅 vs 원스톱 제품
- Claude Opus 4.6 Agent Teams 등장: AI 에이전트가 BibiGPT로 영상 이해를 혁신하는 방법