에이전트 평가업체 컴포지오가 딥시크-V4 플래시를 클로드 코드, 코덱스, 오픈코드, 오 마이 파이 등 4개 하네스로 지메일·깃허브·슬랙 등 실제 업무 30개 과제에서 240회 테스트한 결과, 같은 모델이라도 구동 하네스에 따라 과제 완료율이 46.7%에서 56.7%까지 최대 10%포인트 벌어졌다. 비용 차이는 더 커서 성공당 비용이 오 마이 파이 0.073달러, 클로드 코드 0.195달러로 2.7배 차이가 났고, 속도는 반대로 클로드 코드가 122.7초로 가장 빨랐다. 이는 엔터프라이즈 AI 에이전트 도입의 성패가 모델 벤치마크 점수보다 재시도 로직, 도구 호출 방식 등 하네스 아키텍처 최적화에 좌우된다는 점을 보여준다.
- •딥시크-V4 플래시, 4개 하네스로 30개 실무 과제 240회 테스트한 컴포지오 실험 결과 공개
- •과제 완료율 46.7~56.7%로 하네스에 따라 최대 10%포인트 차이, 4개 환경 모두 성공한 과제는 6개뿐
- •성공당 비용은 오 마이 파이 0.073달러 vs 클로드 코드 0.195달러로 2.7배 차이
- •딥시크-V4 플래시는 지능지수 50점으로 이전 버전보다 성능·토큰 효율 개선, 오픈라우터 토큰 사용량 1위 기록
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
"하네스 따라 성과 10% 차"…'딥시크-V4 플래시' 테스트 결과 공개

- 1.컴포지오 테스트 결과, 딥시크-V4 플래시 성능이 모델보다 구동 '하네스'에 최대 10%p 좌우됨
- 2.4개 하네스(클로드코드·코덴스·오픈코드·오마이파이) 240회 실행서 평균 완료율 53.8%
- 3.오마이파이가 성공당 비용 0.073달러로 최저, 클로드코드는 0.195달러로 2.7배 비씣
- 4.딥시크-V4 플래시, 지능지수 50점으로 V4프로(45점) 상회…오픈라우터 토큰사용량 1위 등극
왜 중요한가?
동일 모델이라도 에이전트 실행 프레임워크(하네스) 설계에 따라 성공률·비용·속도가 최대 2~3배 차이 나는 것으로 확인돼, 기업의 AI 에이전트 도입 성패가 모델 선택 못지않게 하네스 최적화에 달려 있음을 보여준다.
본문 미리보기
뛰어난 가성비로 인기를 끌고 있는 '딥시크-V4 플래시'가 실제 복잡한 기업용 에이전트 환경에서는 모델 자체보다 구동 환경인 '하네스'에 따라 성능이 크게 좌우되는 것으로 나타났다.에이전트 평가 프레임워크인 컴포지오(Composio)는 최근 지메일, 깃허브, 슬랙, 구글 시트 등 실제 업무 도구를 활용하는 30개의 다단계 작업에 대한 딥시크-V4 플래시 테스트 결과를 발표했다. 이번 실험은 클로드 코드, 코덱스, 오픈코드, 오 마이 파이(Oh My Pi) 등 4개의 에이전트 실행 하네스를 적용해 도합 240회의 워크플로우 실행 테스
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

