전 딥마인드 알파고 팀 핵심 연구자 토레 그레이펠은 오늘날의 LLM이 보이는 '추론'은 실제로는 진정한 추론이 아니라고 주장한다. 알파고가 이세돌과의 대국에서 보인 '수 37'은 직관(정책망)이 아닌 수천 갈래의 미래 수를 탐색하는 검색 메커니즘, 즉 진정한 추론 능력에서 나온 창의적 선택이었다는 것이다. 반면 LLM의 사고사슬(chain of thought)은 다음 토큰 예측을 더 길게 반복하는 것일 뿐, 상태를 명시적으로 기록·검토하는 별도의 추론 메커니즘이 아니며, 지식과 추론 과정이 분리돼 있지 않고 사후에 답을 만들어 끼워 맞추는 경우도 있다고 지적한다. 저자는 이 때문에 구글 딥마인드를 떠났다며, 알파고처럼 무엇을 알고 무엇을 의심하는지 명시적으로 기록하는 '인식 상태(epistemic state)'를 유지하고 이를 증거에 따라 갱신하는 시스템이 필요하다고 제안한다. 의료·과학 등 고위험 분야에서 신뢰할 수 있는 AI를 만들려면 모델을 단순히 더 크게 만드는 것이 아니라 감사 가능한 추론 구조를 갖춰야 한다는 결론이다.
- •알파고의 '수 37'은 직관(정책망)이 아니라 수천 갈래 미래를 탐색하는 검색 메커니즘, 즉 진정한 추론에서 나온 창의적 선택이었다고 설명.
- •오늘날 LLM의 사고사슬은 다음 토큰 예측을 반복하는 것일 뿐이며, 명시적·검토 가능한 인식 상태가 없고 지식과 추론이 분리되지 않았다고 비판.
- •LLM이 사고사슬을 사후에 꾸며 답을 그럴듯하게 설명하는 경우가 있어 실제 추론 과정과 다를 수 있다는 연구 결과를 인용.
- •저자는 구글 딥마인드를 떠나 알파고식 '인식 상태' 기반의 감사 가능한 추론 아키텍처가 필요하다고 주장.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Don’t be fooled—LLMs don’t reason
- 1.전 딥마인드 알파고팀 토레 그레이펠, 'LLM은 진짜 추론을 하지 않는다'고 주장
- 2.LLM의 사고연쇄(CoT)는 답을 낸 뒤 사후적으로 꾸며낸 설명일 수 있다는 연구 인용
- 3.LLM엔 지속적·검토 가능한 '인식 상태'가 없다는 점을 핵심 한계로 지목
- 4.알파고의 게임트리처럼 가설·확신도·근거를 명시적으로 기록하는 구조를 대안 제시
왜 중요한가?
저자가 이 문제의식 때문에 딥마인드를 떠났다고 밝힌 점에서, 단순 스케일업이 아닌 추론 메커니즘 자체의 재설계가 의료·과학 등 고위험 분야 신뢰성 확보에 필요하다는 업계 내부의 문제의식을 보여준다.
본문 미리보기
On an afternoon in Seoul in March 2016, I watched a program I helped build put a stone on the fifth line of a Go board in what looked like a gift to its human opponent. Move 37 in game two of the five-game match looked so absurd that some commentators thought it was a…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

