메릴랜드대와 AWS 연구진이 단일 사진에서 편집 가능한 블렌더 3D 장면을 코드로 생성하는 레고 애니싱을 공개했다. 코딩 에이전트가 이미지를 보고 코드를 작성하고 실행하고 검토하며 반복적으로 장면을 수정하는 이미지 투 코드 방식을 사용한다. 연구진이 함께 내놓은 벤치마크 레고 벤치에서 최고 성능 모델인 GPT 6 아스트라도 실내 장면 53.4%, 실외 장면 39.6%의 복원 정확도에 그쳤으며, 특히 모델이 자신의 결과가 개선됐는지 스스로 판단하는 능력은 거의 무작위 수준으로 낮았다. 이에 연구진은 자가 판단 대신 구체적 측정값을 활용하는 레고 플러그인을 개발해 약한 모델일수록 최대 62.7퍼센트포인트의 성능 향상을 이끌어냈다.
- •메릴랜드대와 AWS가 단일 사진에서 편집 가능한 블렌더 3D 장면을 코드로 생성하는 레고 애니싱 발표
- •코딩 에이전트가 이미지를 보고 코드를 작성하고 실행하고 검토하고 수정을 반복하는 이미지 투 코드 방식
- •벤치마크 레고 벤치에서 최고 모델 GPT 6 아스트라가 실내 53.4%, 실외 39.6% 정확도 기록
- •모델의 자가 성능 판단 능력은 거의 무작위 수준, 되돌림 편집으로 오히려 성능이 급락하는 사례도 확인
- •구체적 측정값으로 자가 판단을 대체하는 레고 플러그인 적용 시 약한 모델은 최대 62.7퍼센트포인트 성능 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AI agents build 3D scenes from photos but have no idea if they got it right

- 1.메릴랜드대·AWS, 사진 한장을 편집 가능한 Blender 3D 코드로 바꾸는 'LEGO-Anything' 공개
- 2.벤치마크 LEGO-Bench, 208개 이미지·443개 에셋으로 유효성·정확도·외관 유사도 평가
- 3.최고 모델 GPT-6 Astra도 실내 53.4%·실외 39.6%에 그치고 자가판단은 거의 무작위 수준
- 4.무훈련 플러그인 LEGO-Plugin 적용 시 약한 모델은 최대 62.7%p 개선
왜 중요한가?
코딩 에이전트가 사진을 실행 가능한 3D 프로그램으로 바꾸는 능력은 확보됐지만 자기 결과를 스스로 판단하지 못한다는 한계가 드러나, 에이전트 자기평가 신뢰성이 공간 이해 응용의 핵심 과제로 떠올랐다.
본문 미리보기
A new approach called LEGO-Anything turns single photos into editable Blender code for 3D scenes. GPT-6 Astra leads the accompanying benchmark with up to 53 percent reconstruction accuracy. The biggest weakness across all tested agents is that they can't judge their own geometric accuracy any better than a coin flip. The article AI agents build 3D scenes from photos but have no idea if they got it right appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안

