카카오가 옴니 모델 '카나나-오(Kanana-o)'의 음성 생성 기술을 업데이트해 자연어 지시만으로 말투·감정·억양을 제어할 수 있게 했다. "톤을 낮춰서 빠르게 슬픈 목소리로" 같은 복합 지시나 사투리 스포츠 중계 스타일까지 구현하며, 발화 지시 이행 벤치마크 'InstructTTSEval' 한국어 평가에서 94.50점으로 GPT-4o-미니-tts(91.10점)를 앞섰고 제미나이-2.5-플래시-프리뷰-tts(95.38점)에 근접했다. 자체 음성 토크나이저 'LM-SPT'로 더 적은 토큰으로 음성을 압축해 생성 속도·효율을 높였으며, Mimi·DualCodec·CosyVoice2 대비 우수한 성능과 전문가 청취 평가 최고점을 기록했다. 향후 웃음·한숨 등 비언어 표현 생성과 음성 이해·생성 통합 구조 연구를 이어갈 계획이다.
- •자연어 지시만으로 말투·감정·억양·속도 제어, 복합 지시도 처리 가능
- •InstructTTSEval 한국어 94.50점으로 GPT-4o-미니-tts(91.10점) 추월, 제미나이-2.5-플래시(95.38점)에 근접
- •자체 음성 토크나이저 'LM-SPT'로 토큰 수를 줄여 생성 속도·효율 향상
- •LM-SPT는 Mimi·DualCodec·CosyVoice2 대비 우수 성능, 전문가 청취 평가 최고점
- •웃음·한숨 등 비언어 표현 생성과 음성 이해·생성 통합 구조 연구 진행 중
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
"AI 음성 말투·감정 자유자재로"...카카오, 옴니 AI '카나나-오' 업데이트
- 1.카카오, 옴니 모델 '카나나-오' 음성 생성 개선…자연어 지시로 말투·감정·억양 제어 가능
- 2.한국어 InstructTTSEval 94.5점, GPT-4o-미니-tts(91.1점) 상회·제미나이 2.5 플래시에 근접
- 3.자체 음성 토크나이저 'LM-SPT'로 적은 토큰으로 음성 압축, 생성 속도·효율 향상
- 4.Mimi·DualCodec·CosyVoice2 대비 우수 평가, 웃음·한숨 등 비언어 표현 생성도 개발 예정
왜 중요한가?
국산 옴니 모델이 한국어 TTS 지시 이행 벤치마크에서 GPT-4o-미니를 넘어섰다는 점에서, 카카오 서비스 전반의 음성 인터페이스 경쟁력과 국내 음성 AI 기술 자립 가능성을 구체적 수치로 보여준다.
카카오의 '카나나-오' 업데이트는 한국어 AI 음성 생성 기술의 정교함을 한 단계 끌어올렸다는 점에서 주목됩니다. 감정, 억양, 사투리까지 자유자재로 구현 가능해지면서 국내 콘텐츠 제작, 고객 서비스, 교육 등 다양한 분야에서 AI 활용도가 크게 확장될 것으로 기대됩니다.
본문 미리보기
카카오(대표 정신아)는 옴니 모델 '카나나-오(Kanana-o)'의 음성 생성 기술을 개선했다고 4일 밝혔다.이번 개선으로 이용자는 자연어 지시만으로 원하는 말투와 감정, 억양까지 제어할 수 있게 됐으며, 자체 토크나이저를 통해 생성 속도와 효율도 높였다는 설명이다.AI는 속도, 음량, 음높이를 포함해 감정과 억양, 강도까지 세밀하게 반영해 "아주 빠르게" "슬픈 목소리로" "경상도 사투리로 스포츠 중계하듯" 등 다양한 표현을 구현할 수 있다. 여기에 "톤을 낮춰서 빠르게 슬픈 목소리로 읽어줘"와 같은 복합 지시도 가능하다.카나나-
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:35AI 초안
