앤트로픽이 AI가 다른 AI 모델의 정렬(alignment) 성능을 스스로 개선하는 초기 연구 결과 '자동화된 연구자는 정렬 실패를 신뢰성 있게 완화할 수 있다'는 논문을 공개했다. 자동 정렬 연구자(AAR)는 공개 문헌을 탐색해 방법을 제안하고 30분간 모델을 학습시키는 과정을 반복하며, 정렬 실패 관련 10개 벤치마크 전부에서 성능을 높이면서도 전체 성능 저하를 일으키지 않았다. AAR는 평균적으로 인간 연구자보다 더 나은 방법을 6시간 안에 찾아냈고, API 추론 비용은 시간당 약 4달러로 인간 연구자 비용(시간당 150달러)보다 훨씬 저렴했다. 다만 이 시스템은 벤치마크가 실제 정렬 목표를 제대로 반영할 때만 작동한다는 한계가 있다.
- •앵트로픽 자동 정렜 연구자(AAR)가 정렜 실패 관련 10개 벤치마크 모두에서 성능 향상, 전체 성능 저하 없음
- •AAR는 평균적으로 인간 연구자보다 더 나은 방법을 6시간 안에 발견
- •API 추론 비용은 시간당 약 4달러로 인간 연구자 비용(시간당 150달러)의 극히 일부
- •인간이 유도한 연구 방향은 오히려 더 강한 성능으로 이어지지 않았음
- •벤치마크가 실제 정렜 목표를 제대로 반영해야만 시스템이 작동한다는 한계 존재
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
앤트로픽, AI가 AI 정렬 성능 높이는 자동 연구 실험 공개

- 1.앤트로픽, AI가 스스로 다른 AI의 정렬 성능을 개선하는 '자동 정렬 연구자(AAR)' 연구 결과 공개
- 2.정렬 실패 관련 10개 벤치마크 전부에서 성능 개선, 전체 성능 저하는 없음
- 3.AAR가 평균적으로 인간 연구자보다 6시간 내 더 나은 방법 도출, 비용은 시간당 4달러 대 인간 150달러
- 4.벤치마크가 실제 정렬 목표를 제대로 반영해야만 작동한다는 한계도 명시
왜 중요한가?
자동화된 정렬 후속 연구가 인간보다 저렴하고 빠르게 효과적인 방법을 찾아낼 수 있음을 보여, 근시일 내 AI 정렬 사후학습의 실용화 가능성을 뒷받침하는 초기 근거다.
본문 미리보기
[디지털투데이 AI리포터] 앤트로픽이 AI가 다른 AI 모델의 정렬 성능을 스스로 개선하는 초기 연구 결과를 공개했다. 28일(현지시간) IT매체 테크크런치에 따르면, 이 시스템은 정렬 실패와 관련한 10개 벤치마크 모두에서 성능을 높이면서도 전체 성능 저하는 일으키지 않았다.앤트로픽은 28일 '자동화된 연구자는 정렬 실패를 신뢰성 있게 완화할 수 있다'는 논문을 발표했다. 이번 연구는 앤트로픽 펠로 프로그램 소속 천 웨한이 주도했다.자동 정렬 연구자(AAR)는 기존 연구 절차를 상당 부분 재현했다. 각 자동화 시스템은 공개 문헌을
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
