중국 AI 기업 딥시크가 텍스트 모델 V4-Flash에 이미지 이해 기능을 추가한 실험적 멀티모달 모델 'V4-Flash-Vision-Exp'를 공개했다. 자체 벤치마크에서 이 모델은 에이전트 작업 성능이 앤스로픽 오퍼스 4.8에 근접하는 것으로 나타났다. 이미지는 Base64, 공개 URL, 신규 무료 Files API 등 세 가지 방식으로 전송할 수 있으며, 이미지 한 장당 최대 384토큰이 소요되고 한 요청에 최대 600장까지 첨부할 수 있다. 모델은 OpenAI의 Chat Completions·Responses API와 Anthropic Messages 엔드포인트를 모두 지원하며, 딥시크는 이를 구동하는 하니스 프레임워크 0.1.1버전도 함께 출시했다.
- •V4-Flash-Vision-Exp는 딥시크 V4-Flash에 이미지 이해 기능을 추가한 실험적 멀티모달 모델
- •자체 에이전트 벤치마크에서 앤스로픽 오퍼스 4.8에 근접하는 성능 기록
- •이미지 처리 비용은 장당 최대 384토큰, 한 요청당 최대 600장 첨부 가능
- •OpenAI·Anthropic 양쪽 API 포맷을 모두 지원하며 전용 하니스 0.1.1도 함께 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks

- 1.딥시크, 텍스트 모델 V4-Flash에 이미지 이해 기능을 더한 실험판 V4-Flash-Vision-Exp 공개
- 2.자체 멀티모달 에이전트 벤치마크에서 Opus 4.8에 근접하거나 일부 앞서는 성능 기록
- 3.OpenAI·Anthropic API와 호환, 신규 Harness 프레임워크 0.1.1도 함께 공개
- 4.요청당 최대 600개 이미지 처리 가능, 이미지 1장당 최대 384토큰 소비
왜 중요한가?
중국 오픈 계열 모델이 자체 벤치마크에서 최상위 폐쇄형 모델 Opus 4.8과 근접한 비전·에이전트 성능을 주장하면서, 비전 기반 에이전트 워크플로우 시장에서 가격 대비 성능 경쟁이 한층 치열해질 전망이다.
본문 미리보기
Deepseek has released V4-Flash-Vision-Exp, an experimental multimodal model that adds image understanding to V4-Flash's text capabilities. On the company's own multimodal agent benchmarks, it approaches Opus 4.8 and sometimes beats it. The article Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
