DeepSeek V4-Flash-Vision-Exp: 비전 Agent가 Opus 4.8에 가깝다고, 전체 영상을 이해한다는 뜻은 아니다
트렌드

DeepSeek V4-Flash-Vision-Exp: 비전 Agent가 Opus 4.8에 가깝다고, 전체 영상을 이해한다는 뜻은 아니다

게시일 · 작성자: BibiGPT 팀
BibiGPT을 Google 선호 소스로 추가 주요 뉴스와 AI 답변에서 BibiGPT를 더 자주 만나보세요.

방금 마흔 분짜리 제품 데모를 다 봤습니다. 음성 회의록은 기능, 가격, 다음 단계까지 깔끔합니다. 그런데 발표자가 한 장을 가리키며 「이 추세 보세요」라고 합니다. 회의록에는 네 글자만 남습니다. 차트 참조. 그 프레임을 찾으러 되감으면 진행 바는 광고로 건너뛰고, 차트는 이미 다음 장으로 바뀌어 있습니다.

이 문제는 2026년 8월 21일부터 「전사만으로 충분한가」의 문제가 아닙니다. 비전 Agent 결정이 됩니다. 모델이 그 그림을 볼 수 있는가, 그리고 본 뒤에 당신이 실제로 가져가야 할 산출물까지 연결할 수 있는가.

대부분 기사는 「Opus-4.8에 근접」에서 멈춥니다. 이 글이 풀려는 건 다른 절반입니다. 비전 Agent가 그림을 볼 수 있다고 해서, 전체 영상을 이해한다는 뜻은 아닙니다.

목차

8월 21일에 무엇을 발표했나

2026년 8월 22일 기준: DeepSeek가 공식 changelog에 실험용 멀티모달 모델 DeepSeek-V4-Flash-Vision-Exp를 올렸습니다. 호출 이름은 deepseek-v4-flash-vision-exp입니다. 같은 날 DeepSeek Harness 0.1.1에도 내장 지원이 들어갔습니다.

공식은 스스로 두 줄을 그었습니다.

  1. 텍스트 측은 V4-Flash와 동등: Agent, 추론, 세계 지식이 비전을 붙였다고 무너지지 않습니다.
  2. 비전 Agent 벤치마크는 Opus-4.8에 근접: 순수 텍스트 V4-Flash 대비 「볼 수 있게」된 한 번의 도약입니다.

API 계층도 비용 경계를 못 박았습니다. 이미지는 토큰으로 과금되며 장당 최대 384 token, 가격은 V4-Flash와 동일합니다. Chat Completions, Messages, Responses를 지원하고, 이미지는 base64, 외부 URL, 또는 새로 올라온 Files API(한 번 무료 업로드 후 file_id로 재사용)로 넣을 수 있습니다. 비전 입문은 API Guides - Vision을 보세요. The Decoder는 JPEG / PNG / GIF / WebP를 확장명이 아니라 파일 내용으로 포맷을 인식한다고 보충합니다.

여전히 Exp 접미사가 붙어 있습니다. 공식은 가중치를 동시 오픈소스하지 않았고, V4 멀티모달의 최종형으로 쓰지도 않았습니다.

온라인 강의의 그 PPT 한 장이야말로 비전 모델이 진짜로 봐야 할 대상입니다.

영상에서 뽑은 강의 자료 키프레임과 해당 구간의 텍스트 캡션: 강의 자료 키프레임과 대응 텍스트. 출처: BibiGPT.

실무 규칙: 실험 모델 공고를 읽을 때는 먼저 접미사를 찾으세요. Exp는 써볼 수 있다는 뜻이지, 제품 약속이 아닙니다.

텍스트는 동등, 비전은 도약: 숫자를 어떻게 읽을까

공식 원문은 「Opus-4.8에 근접」입니다. The Next Web은 같은 표를 끝까지 읽었습니다. 새 모델은 11개 항목 중 Opus-4.8을 3개에서 이겼고, 나머지 8개는 뒤처집니다. NL2Repo는 57.7 대 69.7로 12점 차이, DSBench-Hard는 63.6 대 71.7입니다. 가까운 항목은 정말 가깝습니다. Terminal Bench 2.1은 83.9 대 85.0, Chartography는 64.3 대 65.0입니다.

V4-Flash 대비 도약은 더 구체적입니다. ApexBench Pass@1은 26.2에서 36.5로, Agents’ Last Exam은 25.2에서 27.3으로 올랐습니다. DeepSeek 자체 각주는 이 두 항목에서 순수 텍스트 V4-Flash가 「그중 멀티모달 요소를 무시」한다고 밝힙니다. 즉 도약의 일부는 블라인드 테스트에 눈을 하나 달아 준 것이지, 텍스트 능력이 갑자기 두 배가 된 게 아닙니다.

차원V4-FlashV4-Flash-Vision-Exp전체 영상을 봄
입력텍스트텍스트 + 이미지링크 / 파일 + 타임라인
Agent 이미지 인식아니오화면 + 음성을 함께 이해
공식 표현텍스트 기준선비전 Agent가 Opus-4.8에 근접제품 워크플로, 벤치마크 이름이 아님
과금V4-Flash 가격동일 가격, 이미지 장당 최대 384 token산출 단위, 「이미지 한 장 보기」 단위가 아님

데모: Harness가 모델을 실제 작업에 연결하는 방식. 출처: YouTube 공개 해설, 대조 DeepSeek Harness.

실무 규칙: 「Opus에 근접」을 보면 먼저 이긴 항목과 진 항목을 세요. 3승 8패여도 근접은 가능하지만, 선도로 쓸 수는 없습니다.

긴 영상 계층은 DeepSeek V4 백만 컨텍스트 워크플로에서 다뤘고, Harness skill 설치는 dsh 음영상 skill을 보세요. 이 글은 「비전 Agent → 영상 화면 이해」만 다룹니다.

비전 Agent가 전체 영상을 이해하기까지 부족한 한 층

답을 먼저 말합니다. 이미지를 읽는 Agent가 기본으로 먹는 건 이미지 한 장, 스크린샷 한 장, 표 한 장입니다. 전체 영상이 필요한 건 타임라인 위의 연속 화면이고, 그 위에 음성·자막·챕터가 겹칩니다.

V4-Flash-Vision-Exp의 합법적 장면은 분명합니다. 이미지 설명, 스크린샷 텍스트 읽기, 차트 보기, 본 것을 도구 호출에 연결하기. 이 정도면 GUI Agent, 리포트 Q&A, 슬라이드 샘플 검수에 충분합니다. 부족한 건 이겁니다. 마흔 분 데모에서 차트가 11초 등장했고, 당신이 원하는 건 「17분째 그 장이 무슨 말이냐」이지 「이 프레임을 업로드했다」가 아닙니다.

업무 Agent의 다음 정거장은 더 똑똑한 계획이 아니라, 음영상을 넣어줄 수 있는가입니다. 회의 녹화, 온라인 강의, 제품 데모는 여전히 기본이 입력 계층에서 막힙니다. 「본 프레임」을 「검색 가능한 챕터」에 먼저 연결하는 쪽이 크리에이터·학생·직장 세 갈래 고빈도 경로를 덮습니다.

기존 차이도 여기에 있습니다. 백만 컨텍스트는 「한 번에 얼마나 길게 넣을지」를 풀고, Harness는 「skill 폴더를 runtime이 어떻게 찾을지」를 풉니다. 비전 실험 모델은 「이미지가 Agent에 들어갈 수 있는지」를 풉니다. 세 구간 모두 필요하지만, 어느 한 구간도 영상을 이해했다는 뜻은 아닙니다.

키프레임 분석 패널: 먼저 화면을 뽑고, 비전 모델이 각 프레임을 읽음 캡션: 키프레임 분석 패널. 출처: BibiGPT.

실무 규칙: 비전 Agent가 그림을 볼 수 있다고 해서, 전체 영상을 볼 수 있는 건 아닙니다. 타임라인이 없으면 앨범 Q&A일 뿐입니다.

크리에이터·학생·직장인에게 각각 무엇을 의미하나

크리에이터. 원하는 건 「이 커버가 예쁘다」가 아니라 「이 20분 해설을 배포 가능한 아티클로 쪼갤 수 있느냐」입니다. 비전 Agent는 차트 프레임 하나를 읽어 주고, 영상 화면 콘텐츠 요약은 전체를 본 뒤 영상→아티클로 이어 줍니다.

학생. 온라인 강의의 가치는 종종 판서와 PPT에 있지, 선생님의 입버릇에 있지 않습니다. 비전 Agent는 특정 페이지 샘플 검수에 맞고, 한 과목 전체에는 키프레임 그리드 + 대응 자막이 필요합니다. 네 시간을 다시 보는 게 아니라 강의 자료를 넘기는 감각입니다.

직장인. 주간 회의 녹화에서 정말 놓치면 안 되는 건 공유 화면 위의 숫자입니다. 순수 텍스트 회의록은 「화면 참조」로 씁니다. 비전 Agent는 당신이 잘라 둔 그 장을 읽고, 검색 가능한 챕터는 「23분째 표」로 되돌아갈 수 있게 합니다. 이미 100만 명 이상 사용자, 누적 500만 회 이상 요약, 30+ 플랫폼을 다루고 있으며, 부족한 건 모델 이름을 하나 더 붙이는 일이 아니라 본 프레임을 타임라인에 남기는 일입니다.

선택 필터는 한 문장뿐입니다. 원하는 게 「이미지 한 장 읽기」인가, 「전체 영상에서 봐야 할 그 장들을 가져가기」인가.

실무 규칙: 비전 모델을 평가할 때는 먼저 산출이 어느 프레임에 떨어지는지 물으세요. 시점 설명이 안 되면 아직 영상 이해가 아닙니다.

비전 모델 선택기: 같은 키프레임 묶음에 다른 이미지 인식 모델을 바꿀 수 있음 캡션: 키프레임 분석의 모델 선택. 출처: BibiGPT.

화면 이해를 워크플로에 연결하기

판단 장은 여기까지입니다. 제품을 어떻게 쓰는지는 이 절에만 둡니다. 차트 있는 해설 영상 하나가 손에 있다고 가정합니다.

  1. Bilibili / YouTube / 팟캐스트 링크를 붙여 넣고, 먼저 타임스탬프 챕터를 뽑으세요. 스크린샷부터 하지 마세요.
  2. 시각화 요약을 열어 시스템이 키프레임을 뽑게 하세요. 진행 바를 직접 끌어 운에 맡기지 마세요.
  3. 차트·코드·판서가 있는 프레임에 화면 분석을 돌려 「차트 참조」를 읽을 수 있는 요점으로 바꾸세요.
  4. 2차 배포가 필요하면 아티클 또는 강의 자료 뷰로 가세요. 커버를 또 손으로 따지 마세요.
  5. 원래 시점으로 돌아가 대조하세요. 모델 설명을 최종 사실로 두지 마세요.

대조 데모: 링크 하나를 붙여 넣고, 화면이 인용 가능한 요점으로 바뀌는 과정을 보세요.

영상 화면을 그림+글 노트로

AI는 소리뿐 아니라 화면도 봅니다——슬라이드, 도표, 화면 속 글자까지 정리해 줍니다.

샘플 체험:

주요 장면

화면 속 글자: nanoGPT

Karpathy가 bigram 모델을 라이브 코딩 — 현재 글자로 다음 글자를 예측하는 가장 단순한 모델.

범용 요약 입구는 여전히 AI 영상 요약 가이드입니다. 비전 실험 모델은 이 생산 라인에서 「이미지 읽기」 한 고리가 될 수 있습니다. 생산 라인 자체는 아닙니다. 이 글 발행 시점에 제품 측은 해당 실험 모델을 이미 연동했다고 쓰지 않았습니다. 토픽형으로 모델 발표를 쓰는 건 합법이고, 전속 엔진 마케팅으로 묶는 건 합법이 아닙니다.

영상 링크를 화면 분석에 넘김. 입구는 링크이지 앨범이 아님 캡션: 영상→아티클 입구. 출처: BibiGPT.

반증 가능한 예측

2027년 2월까지 주류 비전 Agent가 여전히 단일 이미지 / 짧은 스크린샷만 먹고, 타임라인에서 「N분째 그 표」에 정렬해 검색 가능한 챕터를 쓰지 못한다면, 「비전 Agent가 플래그십에 근접 ≠ 전체 영상을 이해」라는 판단은 성립합니다. 반년 안에 공개·재현 가능한 「전체 영상 화면 이해」 벤치마크가 나오고 Flash Vision급 실험 모델이 제품 워크플로를 직접 따라잡으면, 이 판단은 폐기됩니다.

자주 묻는 질문

V4-Flash-Vision-Exp가 이미 Opus 5를 겨냥한 건가요? 아닙니다. 공식과 제3자 보도가 비교하는 건 Opus-4.8입니다. TNW는 표에 Opus 5 열이 없다고 명시했습니다.

이미지당 384 token은 비싼가요? 공식 표현은 V4-Flash와 동일 가격, 장당 상한 384 token이며 별도 비전 전용 요금은 없습니다. Files API는 무료라 같은 이미지를 반복 질의하기에 맞습니다.

백만 컨텍스트 그 글과는 뭐가 다른가요? 그 글은 「한 번에 얼마나 길게 넣을지」를 다룹니다. 이 글은 「눈을 Agent에 붙인 뒤, 영상 워크플로에 아직 타임라인이 빠진다」를 다룹니다.

BibiGPT가 이미 이 실험 모델을 연동했나요? 제품 통합 원고로는 쓰지 않았습니다. 발행 전 해당 실험 모델은 연동되지 않았습니다. 사용자가 고를 수 있는 모델은 이름을 말해도 되고, 시스템이 자동 결정하는 구간은 전속 엔진 카피로 묶지 않습니다.

이미지만 보고 싶고 영상 요약은 안 해도 되는데, 이 생산 라인이 필요한가요? 이미지만 읽으면 비전 API로 충분합니다. 전체 영상 안의 차트·판서·데모 UI를 가져가려면 여전히 챕터 + 키프레임 + 되돌아갈 수 있는 타임스탬프가 필요합니다.

표를 다 읽고 나서 유행을 따를지 결정하세요. 플래그십에 가까운 건 비전 Agent 벤치마크이지, 「링크를 붙여 넣으면 마흔 분 데모를 이해한다」가 아닙니다. 본 프레임을 타임라인에 남기려면 BibiGPT로 당신 링크 하나부터 돌려 보세요.

지금 시작해서, 영상 화면을 검색 가능한 요점으로 바꾸세요.

BibiGPT 팀

'모델 업데이트' 글 47편 모두 보기 →

이 AI 도구를 사용해 보세요