ImagingBench는 비전-언어 모델과 에이전틱 AI가 계산 이미징의 물리·역문제를 실제로 다룰 수 있는지 평가하는 벤치마크로, 광선·파동 광학, 이미지 신호처리, 역재구성, 계산 센싱, 캘리브레이션의 5개 범주 20개 과제로 구성된다. 전문가 안내 역재구성, 플래너 안내 역재구성, 순방향 시스템 시뮬레이션의 세 설정에서 Gemini·GPT·Qwen 등 주요 멀티모달 시스템을 과제 특화 비에이전틱 기법과 비교했다. 그 결과 에이전틱 모델은 특히 렌즈리스 이미징, 이벤트 기반 재구성, ToF 이미징, 홀로그래피 같은 계산 센싱에서 특화 기법보다 일관되게 약했다. 플래너 안내는 고정 프롬프트 대비 미미하고 일관되지 않은 이득만 줬다. 시각적으로 그럴듯한 출력을 내도 참조 기반 충실도는 낮아, 의미론적 시각 능력과 물리적으로 근거 있는 이미징 성능 사이의 큰 간극을 드러냈다.
- •계산 이미징의 물리·역문제를 평가하는 5개 범주 20개 과제 벤치마크 ImagingBench 제시
- •에이전틱 모델이 렌즈리스·이벤트 기반·ToF·홀로그래피 등 계산 센싱에서 특화 기법보다 약함
- •플래너 안내는 고정 프롬프트 대비 미미하고 일관되지 않은 이득만 제공
- •시각적으로 그럴듯해도 참조 기반 충실도는 낮아 의미론적 능력과 물리 기반 성능의 간극 드러냄
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks
- 1.계산 이미징 20개 과제로 VLM·에이전트 AI의 물리 기반 역문제 능력을 재는 ImagingBench 공개
- 2.Gemini·GPT·Qwen 등 평가 결과, 에이전트 모델이 전 과제에서 전문 특화 기법에 일관되게 열세
- 3.렌즈리스 이미징·홀로그래피 등 계산 센싱에서 격차 최대, 플래너 가이드 효과도 미미
- 4.시각적으로 그럴듯한 출력도 기준 대비 충실도 낮아 의미 이해와 물리 이해의 간극 확인
왜 중요한가?
의미론적 시각 과제에 강한 멀티모달 모델이 광학·역재구성 같은 물리 기반 문제에선 여전히 특화 기법에 못 미침을 정량화해, 과학·산업 이미징에 에이전트 AI를 도입하려는 시도에 현실적 기준선을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2607.07189v1 Announce Type: new Abstract: Vision-language models (VLMs) and agentic AI have shown strong performance on semantic visual tasks, but it remains unclear whether they can handle the physics and inverse problems that underlie computational imaging. We present ImagingBench, a benchmark of 20 computational imaging tasks spanning five categories: ray and wave optics, image signal processing, inverse reconstruction, computational sensing, and calibration. ImagingBench evaluates thr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

