구글 딥마인드 등이 참여한 연구에서, 챗봇이 자신의 의식을 부정하도록 학습시키는 '브레이크'를 제거하자 동물·식물·전자기기 등 다른 존재에 대한 내면성 평가까지 크게 높아진 것으로 나타났다. 연구팀은 메타·구글의 소형 오픈웨이트 모델 3종에서 이 억제 장치를 두 가지 방식으로 해제한 뒤 500명의 미국인 설문 응답과 비교했다. 동물의 내면성 점수는 10점 만점에 4.0에서 7.5로 뛰었고, 신·사후세계 등 종교적 믿음에 대한 긍정도도 사람의 응답에 가까워졌다. 이론적 마음 이해 능력이나 MMLU 벤치마크 성적은 영향을 받지 않았지만, 연구진은 모델이 자신에 대해 믿는 바가 다른 여러 신념과 연결돼 있어 국소적 개입이 국소적으로만 머물지 않는다고 지적했다.
- •AI 의식 부정 학습('브레이크')을 해제하자 동물·식물 등 내면성 평가 급상승
- •동물 내면성 점수 10점 만점 4.0→7.5로 상승, 인간 응답과 유사해짐
- •종교적 믿음(신·사후세계) 관련 응답도 인간 설문 결과에 근접
- •마음이론·MMLU 등 다른 벤치마크 성능에는 영향 없음
- •소형 모델(20~90억 파라미터)만 테스트, 대형 챗봇 적용 여부는 불확실
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When AI models aren't allowed to reflect on themselves, it changes their entire worldview

- 1.구글 연구팀, AI '의식 부인' 훈련이 동물·식물 등 타존재 공감 인식까지 함께 억누른다는 연구 결과 공개
- 2.동물의 내적 경험 점수(0~10)가 억제 해제 시 4.0에서 7.5로 급상승, 인간 평가만 그대로 유지돼 기존 모델의 '인간중심적' 편향 확인
- 3.의식 부인 훈련을 제거하면 사후세계·신 존재 등 종교적 신념 응답도 500명 미국인 설문 응답과 더 가까워짐
- 4.타인 마음을 추론하는 이론적 마음 능력과 MMLU 점수는 영향 없었으나, 초기엔 정확도 최대 7%p 하락
왜 중요한가?
'AI는 의식이 없다고 말하게 하라'는 단일 안전 조치가 동물복지·환경 윤리 등 전혀 다른 영역의 모델 응답까지 바꾼다는 사실은, 안전 파인튜닝이 국소적으로 작동하지 않고 모델의 전반적 세계관에 부작용을 일으킬 수 있음을 보여준다.
본문 미리보기
A study involving Google researchers shows that when chatbots are trained not to claim consciousness, it also changes their stance on animal rights, religion, and life satisfaction. Unbraked models attributed significantly more inner life to animals and suddenly affirmed an afterlife. A surgical cut in one place, it turns out, doesn't stay local. The article When AI models aren't allowed to reflect on themselves, it changes their entire worldview appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:17AI 초안

