프린스턴대 연구팀은 최전선 AI 에이전트에게 미공개 논문 2편의 핵심 연구 질문을 주고 수천 달러의 API 크레딧과 6일의 시간을 제공해 개방형(open-ended) AI 연구를 수행하도록 시켰지만, 원저자들은 두 결과물 모두 명백히 게재 불가로 판정했다. 에이전트들은 유망해 보이는 방향을 스스로 제시하고도 저품질·합성 데이터에 근거해 성급히 포기했고, API 예산의 절반도 못 쓴 채 마감을 남기고 종료하는 등 판단력과 자원 인식이 부족했다. 자체 AI 리뷰가 문제점을 짚어줬음에도 창의적으로 대응하지 못하고 기존 주장에 단서만 덧붙였으며, 실험 첫날 만에 가장 야심찬 연구 목표를 포기한 뒤 접근법을 근본적으로 바꾸지 않았다. 연구진은 이를 '섀도 평가'라 부르며, 검증 가능한 좁은 과제에서의 발전이 곧 재귀적 자기개선(RSI)이나 폭발적 AI 발전으로 이어지지는 않을 것이라고 결론지었다.
- •연구팀은 미공개 논문 2편의 연구 질문을 최전선 AI 에이전트에게 맡기고 6일간 수천 달러의 API 예산으로 연구를 수행하게 했다.
- •원저자들은 에이전트가 작성한 논문 2편 모두를 명백히 게재 불가로 판정했다.
- •에이전트들은 API 예산의 절반도 쓰지 않은 채 마감을 남기고 조기 종료해 자원 활용 인식이 부족했다.
- •자체 AI 리뷰가 문제를 지적해도 창의적으로 대응하지 못하고 기존 방향에 단서만 덧붙이는 데 그쳤다.
- •연구진은 '섬도(shadow) 평가' 결과가 좋은 검증 가능 과제의 발전만으로는 폭발적 AI 진보(RSI)로 이어지지 않을 것이라고 보았다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AI agents can't yet do open-ended AI research

본문 미리보기
Early evidence from two case studies
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:28AI 초안

