구글 리서치와 테크니온 연구진이 LLM의 환각 중 상당수가 지식 부재가 아니라 저장된 정보를 꺼내지 못하는 '기억 인출 실패' 때문이라는 연구 결과를 발표했다. GPT-5와 제미나이 3 프로 같은 최신 모델은 테스트 사실의 95~98%를 매개변수에 저장하고 있었지만, 별도 추론 없이는 저장된 사실의 25~33%를 직접 회상하지 못했으며 모델이 고도화될수록 인출 실패의 비중이 오히려 커지는 경향을 보였다. 연구진이 2150개 위키피디아 사실로 구축한 '위키프로파일' 벤치마크로 13개 LLM의 450만건 응답을 분석한 결과, 단순 모델 스케일업은 인출 실패율을 개선하지 못했지만 '생각(thinking)' 단계를 추가하는 추론 계산을 적용하자 회상하지 못했던 지식의 40~65%가 복구됐다. 연구진은 환각 대응 전략을 세우기 전에 오류가 지식 부재인지 접근 실패인지부터 진단해야 한다고 조언했다.
- •GPT-5·제미나이 3 프로 등 최신 모델은 테스트 사실의 95~98%를 저장하지만 25~33%는 직접 회상하지 못한다.
- •모델이 고도화될수록 전체 오류 중 지식 부재보다 인출 실패가 차지하는 비중이 커진다.
- •젬마3의 매개변수를 10억→270억개로 늘려도 회상 실패율은 오히려 상승했다.
- •'생각' 단계를 부여하는 추론 계산으로 회상하지 못했던 지식의 40~65%가 복구됐다.
- •연구진은 환각 대응 전 오류가 지식 부재인지 인출 실패인지 진단이 우선이라고 조언했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
구글 “LLM 환각 원인은 지식 부족 아닌 '기억 인출' 실패”
- 1.구글·테크니온 연구: LLM 환각 상당수는 지식 부재가 아닌 '기억 인출 실패' 때문이라는 결과 발표
- 2.GPT-5, 제미나이3 프로 등 프론티어 모델은 사실의 95~98%를 저장하지만 25~33%는 추론 없이 회상 못해
- 3.젬마3를 10억→270억 매개변수로 키워도 회상 실패율은 오히려 상승, 단순 스케일업은 해법 아님
- 4.추가 추론('생각') 단계를 부여하자 회상 못하던 지식의 40~65%가 복구, 위키프로파일 벤치마크로 13개 모델 검증
왜 중요한가?
환각 대응을 위해 모델을 무작정 키우거나 RAG를 일괄 도입하기보다, 오류가 '지식 부재'인지 '인출 실패'인지부터 진단해야 불필요한 지연·비용을 피할 수 있다는 실무적 시사점을 제시한다.
LLM의 환각 원인이 지식 부족이 아닌 '기억 인출 실패' 때문이라는 구글의 연구 결과는 매우 중요합니다. 이는 국내 AI 개발사들이 무조건적인 모델 크기 확장이나 외부 검색 의존에서 벗어나, 환각 해결을 위한 보다 근본적이고 효율적인 접근 방식을 모색하는 데 새로운 방향을 제시할 것입니다.
본문 미리보기
대형언어모델(LLM)이 사실과 다른 답변을 내놓는 ‘환각’의 상당수가 모델에 지식 자체가 없어서가 아니라, 이미 저장된 정보를 제대로 꺼내지 못하는 '기억 인출 실패' 때문이라는 연구 결과가 나왔다. 이에 따라 모델 크기를 무작정 키우거나 외부 검색(RAG)에 의존하던 기존 환각 대응 방식에서 벗어나, AI에게 '스스로 생각할 시간'을 부여하는 방식으로의 패러다임 전환이 필요할 것으로 보인다.구글 리서치와 이스라엘 테크니온 연구진은 최근 발표한 논문 ‘빈 선반인가, 잃어버린 열쇠인가(Empty Shelves or Lost Keys?
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
