SearchEyes는 멀티모달 검색 에이전트의 멀티홉 추론 학습에서 훈련 데이터, 검색 환경, 보상 신호가 따로 만들어지는 구조적 단절을 타입 지식그래프 기반 '시뮬레이션 검색 세계'로 통합한 프레임워크다. Wikidata5M의 시각-지식 교집합에서 제약된 멀티홉 경로를 샘플링하는 Perception-Knowledge Chains(PKC)로 홉 수준 엔티티 메타데이터를 보존해, 자체 완결적 검색 세계와 스텝 수준 보상 앵커를 동시에 정의한다. 이 앵커를 재활용하는 Hop-Anchored Policy Optimization(HaPO)은 별도 프로세스 보상 모델 없이 스텝 수준 크레딧 할당을 수행한다. 6개 멀티모달 지식 집약 벤치마크에서 오픈소스 멀티모달 검색 에이전트 중 최고 성능을 기록했으며, SearchEyes-27B는 최강 오픈소스 베이스라인을 평균 6.2점 앞섰다.
- •타입 지식그래프로 훈련 데이터·검색 환경·보상을 통합한 시뮬레이션 검색 세계 구축
- •Wikidata5M 시각-지식 교집합에서 멀티홉 경로를 샘플링하는 PKC 제안
- •별도 보상 모델 없이 스텝 수준 크레딧 할당을 수행하는 HaPO 최적화 기법
- •6개 멀티모달 지식 집약 벤치마크에서 오픈소스 최고 성능
- •SearchEyes-27B가 최강 오픈소스 베이스라인 대비 평균 +6.2점
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
- 1.SearchEyes 공개: 타입 지식그래프 기반 '시뮬레이션 검색 월드'로 멀티모달 검색 에이전트 학습
- 2.PKC로 Wikidata5M 시각-지식 교차 영역에서 다중홉 경로를 샘플링, 홉 단위 보상 앵커 확보
- 3.HaPO는 별도 프로세스 보상 모델 없이 앵커를 재사용해 스텝 단위 credit assignment 수행
- 4.SearchEyes-27B가 6개 멀티모달 지식 벤치마크에서 최강 오픈소스 대비 평균 6.2점 향상, SOTA 달성
왜 중요한가?
기존 파이프라인은 학습 데이터·검색 환경·보상 신호를 따로 구축해 메타데이터가 버려지고 보상이 궤적 수준에서 희소했는데, 지식그래프 하나로 세 요소를 통합해 재현 가능한 환경과 스텝 단위 보상을 동시에 해결했다. 외부 검색엔진 의존 없이 멀티모달 검색 에이전트를 RL로 훈련하려는 팀에 직접 참고가 되는 설계다.
언급 프로젝트
본문 미리보기
arXiv:2607.05943v1 Announce Type: new Abstract: Training multimodal search agents to perform multi-hop reasoning remains challenging due to a fundamental structural disconnect: existing pipelines construct training data, search environments, and reward signals independently, causing synthesized structural metadata to be discarded, environments to rely on irreproducible external engines, and RL rewards to remain sparse at the trajectory level. We present \textbf{SearchEyes}, which uses a typed k
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

