프랑스 스타트업 콕(Kog)이 일반 데이터센터 GPU에서 소프트웨어 최적화만으로 추론 속도를 대폭 끌어올리는 콕 추론 엔진(KIE)을 개발 중이다. AMD MI300X와 엔비디아 H200에서 진행한 시연에서 20억 파라미터 규모 모델 '레인포머 2B'로 초당 3,000토큰을 기록했으며, 목표는 대형 언어모델에서도 최대 30배 빠른 추론을 구현하는 것이다. CEO 가엘 들랄로는 하드웨어 교체 없이도 기존 GPU의 메모리 대역폭을 충분히 활용할 수 있다고 주장한다. 11명 규모의 팀은 GPU마다 수주에서 수개월씩 저수준 엔지니어링을 투입하는 방식으로 접근하며, 9월 중 첫 대형 모델에서 10배 속도 달성을 목표로 시리즈A 투자 유치를 준비 중이다. 추론 속도와 비용이 AI 서비스의 병목으로 떠오른 상황에서, 기존 GPU 자산을 그대로 활용하려는 기업들에게 실질적 대안이 될 수 있다.
- •콕은 AMD MI300X, 엔비디아 H200 등 범용 GPU에서 소프트웨어만으로 추론 속도를 높이는 '콕 추론 엔진(KIE)'을 개발한다.
- •20억 파라미터 모델 '레인포머 2B' 시연에서 초당 3,000토큰을 기록했고, 목표는 LLM에서 최대 30배 속도 향상이다.
- •CEO 가엘 들랄로는 오펜시브 보안(화이트해커) 출신으로, 리버스엔지니어링 접근법을 GPU 최적화에 적용한다.
- •11명 팀 규모로 GPU 1종당 수주~수개월의 저수준 엔지니어링이 필요해 확장 속도가 제한적이다.
- •9월 대형 모델 10배 속도 달성을 목표로 시리즈A 투자 유치를 계획 중이다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Kog is going deeper to squeeze more inference out of GPUs
본문 미리보기
The idea that GPUs are poorly suited for agentic workflows may be a misconception, according to French startup Kog.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:47AI 초안

