미국 산타모니카칼리지·서던캘리포니아대 연구진이 LLM에 음성으로 지시하는 방식이 타이핑보다 결과가 더 나쁘다는 연구 결과를 내놨다. 연구팀은 HIVE라는 프롬프트 변형 도구로 음성·키보드·붙여넣기 세 경로의 입력 오류를 시뮬레이션해 5개 모델에 6개 벤치마크로 55만 건의 응답을 평가했다. 그 결과 음성 입력은 타이핑 오류보다 약 3배 더 정확도를 떨어뜨렸으며, 특히 음성을 매끄럽게 다듬어 재구성한 전사본이 가장 큰 손상을 일으켰다. 연구진은 딕테이션 도구 개발자에게 발화를 재구성하지 말고 최소한의 잡음 제거만 하라고 권고한다.
- •음성 입력이 키보드 오타보다 LLM 정확도를 약 3배 더 떨어뜨림
- •HIVE 도구로 음성·키보드·붙여넣기 입력을 시뮬레이션, 5개 모델·6개 벤치마크에서 55만 건 평가
- •가장 큰 손상은 음성을 매끄럽게 재구성한 '정제된' 전사본에서 발생
- •필러 단어 제거 자체보다 문장 구조 재구성이 정확도 손상의 핵심 원인
- •코드 생성·연산 등 답을 직접 구성해야 하는 작업이 객관식보다 더 취약
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Voice Is Currently the Worst Way to Communicate With AI

본문 미리보기
New research suggests that sci-fi's most popularly-depicted method of interfacing with AI may actually produce worse results than even badly-typed prompts. From HAL to Deep Thought, from C3P0 to Wall-E, the idealized form of human/AI relations has always centered around voice-control; and this has manifested in the real world, from early assistant systems such as Siri and Alexa, to language-based querying and colloquy with the current range of frontier LLMs. This idea emerged during less…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:47AI 초안

