마이크로소프트, 코히어, 타버스, 신세시아, 이디오그램, 크리에이티파이 랩스가 잇따라 신규 AI 모델을 공개했다. 마이크로소프트는 100ms 수준 초저지연의 실시간 음성인식 모델 'MAI-트랜스크라이브-2-스트리밍'과 23개 언어를 지원하는 음성합성 모델 'MAI-보이-2.1'을 선보였다. 코히어는 128K 토큰 문맥창과 100개 이상 언어를 지원하는 멀티모달 임베딩 모델 '임베드5'를, 타버스는 사람과 구별하기 어려운 수준으로 비디오 튜링 테스트를 통과했다고 주장하는 대화형 아바타 모델 '그리핀'을 발표했다. 이 외에 신세시아의 인터랙티브 아바타 '세션', 이디오그램의 멀티턴 편집 모델 '아이디오그램 4.5', 크리에이티파이 랩스의 광고 영상 생성 모델 '보리얼-H3'도 함께 공개됐다.
- •MS, 100ms급 초저지연 실시간 음성인식 'MAI-트랜스크라이브-2-스트리밍' 공개
- •코히어 '임베드5', 128K 토큰·100개 이상 언어 지원하는 멀티모달 임베딩 모델
- •타버스 '그리핑', 실시간 인터랙션 지원 아바타로 비디오 튜링 테스트 통과 주장(48% 사람으로 오인)
- •신세시아 '세션'은 대규모 인터뷰·코칭용 인터랙티브 아바타 기능
- •이디오그램 4.5는 반복 편집 시 화질 저하 없는 정밀 이미지 편집 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
[AI 모델 신작] MS 음성인식 'MAI-트랜스크라이브-2-스트리밍' 등 6종
- 1.MS, 100ms 초저지연 실시간 음성인식 'MAI-트랜스크라이브-2-스트리밍' 등 신모델 공개
- 2.코히어, 128K 컨텍스트·100개 언어 지원 임베딩모델 '임베드5' 프로·패스트 2종 출시
- 3.타버스 '그리핀'이 비디오 튜링테스트 첫 통과(사람으로 오인 48% vs 기존 3%미만)
- 4.이디오그램4.5는 반복편집 아티팩트 제거, 보리얼-H3는 광고영상 브랜드 재현율 85.3%
왜 중요한가?
음성·임베딩·아바타·이미지편집·광고영상 등 서로 다른 영역에서 동시다발적으로 초저지연·고재현율 모델들이 쏟아지며, 실시간 음성 에이전트와 멀티모달 콘텐츠 제작 파이프라인 전반의 실무 적용 문턱이 빠르게 낮아지고 있음을 보여준다.
본문 미리보기
■ MS, 'MAI-트랜스크라이브-2-스트리밍' 및 'MAI-보이-2.1' 시리즈 공개마이크로소프트 AI가 실시간 음성 인식 모델(MAI-Transcribe-2-Streaming)과 음성 합성 모델(MAI-Voice-2.1), 고속 버전(MAI-Voice-2.1-Flash)을 선보였다. 이번 실시간 음성 인식 모델은 100밀리초(ms_ 수준의 초저지연을 달성해 화자의 말이 끝나기 전 첫 텍스트를 출력하며, 음성 합성 모델은 23개 언어를 단일 목소리 및 현지 자국어 발음으로 지원한다.Introducing 3 new models: M
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

