Anthropic의 Opus 4.7 출시는 **두 가지 이야기**를 동시에 담고 있다. (1) 공개된 모델: SWE-bench Verified **80.8→87.6%**, SWE-bench Pro 53.4→64.3%(GPT-5.4 57.7% 추월), CursorBench 58→70%, Rakuten 프로덕션 태스크 **3배 해결**. 가격은 $5/$25로 동결 — '같은 가격, 크게 개선'. (2) 숨겨진 모델: Claude **Mythos Preview**가 여전히 최강 모델이지만 공개 안 함. Opus 4.7은 '이 기능을 쓸 수 있게 하기 전에 배포 인프라 테스트'용 rung. CyberGym에서 Opus 4.7 73.1%로 의도적 평탄화, Mythos는 83.1%. 안전 아키텍처(Cyber Verification Program·자동 차단)가 Opus 4.7에서 먼저 증명돼야 Mythos-급 배포 가능. GPQA Diamond에서 Opus 4.7/GPT-5.4 Pro/Gemini 3.1 Pro 94.2~94.4% **포화** — 순수 추론이 아닌 '긴 태스크 실행'이 경쟁 축.
- •Opus 4.7: SWE-bench Pro 64.3%로 GPT-5.4(57.7%)·Gemini 3.1 Pro(54.2%) 앞섬, CursorBench 58→70%.
- •Rakuten 프로덕션 태스크 3배 해결 — 데모 아닌 실사용 지표.
- •Claude Mythos Preview가 최강이지만 봉인 유지 — Opus 4.7이 '배포 안전 인프라' 테스트베드.
- •CyberGym 의도적 평탄화(4.7 73.1% vs Mythos 83.1%) — 정책 선택이지 능력 한계 아님.
- •GPQA Diamond 94.2~94.4% 포화 — '순수 추론' 경쟁 종식, '긴 태스크 실행' 경쟁 시작.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Anthropic Launched a Flagship While Admitting It Has Something Scarier in Reserve
- 1.Opus 4.7이 SWE-bench Pro 64.3%로 프런티어 뚫음, Rakuten 3배 프로덕션 해결.
- 2.Anthropic이 공개 모델에서 일부 사이버 능력 의도적 축소 명시.
- 3.Mythos는 여전히 봉인 — Opus 4.7이 배포 안전 인프라 테스트베드.
- 4.가격 동결($5/$25)에 성능 대폭 개선 — 업그레이드 인센티브 강함.
- 5.GPQA Diamond 포화로 '긴 태스크 실행' 경쟁으로 축 이동.
왜 중요한가?
Anthropic이 '봉인된 상위 모델이 존재한다'는 사실을 제품 출시와 동시에 공개하는 것은 IPO 준비중($30B 매출) 상황에서 규제자·엔터프라이즈 바이어에 보내는 시그널. 한국 AI 엔터프라이즈 도입팀은 '현재 쓸 수 있는 Opus 4.7 + 봉인된 Mythos'라는 계층형 배포 구조를 참고해 자체 AI 거버넌스 수립 가능.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:34AI 초안

