확산 언어모델(Diffusion LLM) 전문 기업 인셉션 랩스가 8일 신모델 '머큐리 2.5'를 공개했다. 이전 버전 머큐리 2보다 지능 성능이 40% 향상됐으며, 엔비디아 GPU에서 초당 1107토큰을 생성하고 최대 26만 토큰 컨텍스트를 지원한다. 가격은 입력 100만 토큰당 0.20달러, 출력 0.75달러이며 출시 초기 80% 할인가로 제공된다. 검색 서비스 오픈콜은 응답 지연시간 중앙값을 약 170밀리초로 낮췄고, 코딩 플랫폼 어그먼트 코드는 컨텍스트 압축 지연을 150초에서 27초로 줄이며 비용을 90% 절감했다고 밝혔다. 음성 특화 모델 '머큐리 보이스'와 모델 자동 라우팅 '머큐리 라우터'의 프리뷰도 함께 공개됐다.
- •인셉션 랩스, 확산 LLM '머큐리 2.5' 공개, 전작 대비 지능 성능 40% 향상
- •엔비디아 GPU에서 초당 1107토큰 생성, 최대 26만 토큰 컨텍스트 지원
- •가격은 입력 100만 토큰당 0.20달러·출력 0.75달러, 출시 초기 80% 할인 제공
- •오픈콜은 응답 지연 170ms, 어그먼트 코드는 컨텍스트 압축 지연 82%·비용 90% 절감 효과 확인
- •음성 특화 '머큐리 보이스', 모델 자동 배분 '머큐리 라우터' 프리뷰도 함께 발표
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
인셉션, 초당 1107토큰 생성하는 ‘머큐리 2.5’ 공개..."지능·비용 다 잡았다"
- 1.인셉션 랩스, 확산 언어모델 '머큐리 2.5' 공개...머큐리 2 대비 지능 40% 향상
- 2.엔비디아 GPU에서 초당 1107토큰 생성, 최대 26만 토큰 컨텍스트 지원
- 3.가격은 입력 100만토큰당 0.20달러·출력 0.75달러, 출시 초기 80% 할인
- 4.어그먼트 코드는 컨텍스트 압축 지연시간 150초→27초로 82% 단축, 비용 90% 절감
왜 중요한가?
확산 언어모델 특유의 빠른 응답 속도로 검색·음성·코딩 등 다중 호출이 누적되는 실시간 에이전트 작업에서 지연시간과 비용을 동시에 줄일 수 있음을 실제 고객 사례로 입증했다.
인셉션 랩스가 초당 1107토큰을 생성하는 고성능 저비용 확산 LLM '머큐리 2.5'를 공개하며 상용 LLM 시장에 새로운 선택지를 제시했습니다. 이는 국내 기업들이 LLM 도입 시 가장 중요하게 고려하는 응답 속도와 비용 문제를 해결하여, 한국 시장에서의 LLM 활용 확산에 긍정적인 영향을 미칠 수 있습니다. 특히 경량급 모델의 지능과 효율성을 동시에 잡으려는 시도는 국내 스타트업 및 중소기업에게 더 현실적인 대안을 제공할 것입니다.
본문 미리보기
확산 언어모델(Diffusion LLM)로 유명한 인셉션 랩스(Inception Labs) 기존 LLM의 약점으로 꼽혀온 느린 응답 속도와 높은 비용 문제를 개선한 새 모델을 선보였다.인셉션은 8일(현지시간) 생성 품질을 크게 높이면서도 초저지연·저비용 특성을 유지한 ‘머큐리 2.5(Mercury 2.5)’를 공개했다.머큐리 2.5가 현재까지 출시된 가장 뛰어나며 가장 큰 규모의 확산 LLM이라는 점을 강조했다. 이전 버전인 머큐리 2보다 지능 성능이 40% 향상됐다. 비용 효율성이 중요한 경량급 프론티어 모델 'GPT-5.6 루나
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

