MIT와 사카나 AI 연구진이 AI 코딩 에이전트의 '검증 비용 병목'을 줄이는 자가개선 프레임워크 'SIFT'를 공개했다. 코딩 모델 자체를 재학습하는 대신 프롬프트·도구·제어 로직 등 에이전트 하네스만 진화시키며, 모든 변종을 직접 벤치마크로 검증하는 대신 LLM 심사자가 코드 변경점을 쌍으로 비교해 브래들리-테리 모델로 순위를 매긴 뒤 유망한 후보만 선별 평가한다. 폴리글롯 코딩 벤치마크에서 SIFT는 5시간, 약 42 CPU시간과 API 비용 150달러만으로 35.1%의 정확도를 달성했으며, 기존 헉슬리-괴델 머신보다 3분의 1 적은 CPU 시간으로 비슷하거나 더 나은 성능을 냈다. LLM 심사자를 제거하자 정확도가 29.8%로 떨어져 기존 다윈 괴델 머신(30.7%)보다도 낮아지는 등, 저비용 심사자 기반 선별이 자가진화형 AI 에이전트의 실용화를 앞당길 핵심 요소임을 보여줬다.
- •MIT·사카나 AI, 코딩 에이전트 자가개선의 '검증 비용 병목' 해결하는 SIFT 프레임워크 공개
- •모델 재학습 대신 프롬프트·도구 등 에이전트 하네스만 LLM 심사자로 저비용 평가·진화
- •폴리글롯 벤치마크서 5시간·42 CPU시간·API비용 150달러로 정확도 35.1% 달성
- •헉슬리-괴델 머신보다 CPU시간 3분의 1 적게 쓰면서 동등 이상 성능
- •LLM 심사자 제거 시 정확도 29.8%로 하락, 다윈 괴델 머신(30.7%)보다도 낮아 심사자 효과 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MIT·사카나, 자가 진화 AI 에이전트 'SIFT' 발표...'검증 비용 병목' 해결
- 1.MIT·사카나 AI가 코딩 에이전트의 자가개선 속도를 높이는 프레임워크 'SIFT' 공개
- 2.모델 재학습 대신 '에이전트 하네스'만 진화시키고, LLM 심사자가 브래들리-테리 순위로 후보를 저비용 선별
- 3.폴리글롯 코딩 벤치마크에서 5시간·CPU 42시간·API 150달러로 정확도 35.1% 달성, 기존보다 약 3분의 1 자원만 사용
- 4.LLM 심사자를 제거하면 정확도가 29.8%로 떨어져 다윈 괴델 머신(30.7%)보다도 낮아지는 등 심사자 기여도 확인
왜 중요한가?
자가진화형 AI 에이전트 연구의 최대 걸림돌이었던 '검증 비용 병목'을 값싼 LLM 심사자로 대체해 해결함으로써, 대규모 컴퓨팅 없이도 에이전트 하네스를 실용적으로 자동 개선할 수 있는 길을 열었다는 점에서 RSI 연구의 실용화에 직접 기여한다.
본문 미리보기
AI 에이전트가 스스로 문제 해결 방식을 개선하는 ‘재귀적 자기개선(RSI)’ 연구가 활발하지만, 수많은 변종 후보를 일일이 검증하는 데 막대한 비용과 시간이 들어 실용화의 걸림돌이 돼 왔다. 이러한 ‘검증 비용 병목(Evaluation Bottleneck)’을 대폭 줄여 에이전트 자가 진화의 실현 가능성을 끌어올린 새로운 기술이 등장했다.MIT와 사카나 AI 연구진은 최근 코딩 에이전트가 스스로 자신의 지침과 도구, 코드를 수정하면서 더 나은 버전을 찾아갈 수 있도록 하는 새로운 프레임워크 ‘SIFT(Recursive Self-I
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

