비전-언어 모델(VLM)이 인간처럼 시각 탐색을 하는지 고전 심리물리학 패러다임으로 검증한 연구다. 특징 vs 결합 탐색, T-vs-L 공간 배치 탐색, 개수 세기, 기울기 탐색 비대칭 등 4개 패러다임을 프런티어·중급 모델에 제시하고, 반응시간 대신 시행당 추론(thinking) 토큰 수를 탐색 노력의 지표로 사용해 Wolfe 등(2010)의 인간 벤치마크와 비교했다. 모델들은 특징 탐색에서 노력이 평탄하고 결합 탐색에서 항목 수에 따라 증가하는 인간의 특성을 재현했지만, 표적 존재 시 노력 기울기가 부재 시보다 큰 역전 현상, 인간이 셀 수 없는 개수도 정확히 세는 등 흥미로운 차이도 보였다. 심리물리학 패러다임이 기계 시각 인지를 저렴하고 예리하게 탐침하는 도구가 될 수 있음을 시사한다.
- •반응시간 대신 추론 토큰 수를 탐색 노력의 모델 내 유사 지표로 사용하는 새 방법론
- •특징 탐색은 평탄, 결합 탐색은 항목 수에 비례 — 인간의 병렬/직렬 탐색 서명을 재현
- •표적 존재 시 노력 기울기가 부재 시보다 커 인간과 반대 순서 — 기계 특유의 탐색 패턴
- •인간이 수를 놓치는 영역에서도 정확한 개수 세기 유지, 적응형 추론 모델은 탐지 과제에서 숙고 자체를 생략
- •심리물리학 패러다임이 기계 시각 인지의 저렴한 진단 도구가 될 수 있음을 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms
- 1.고전 시각탐색 심리물리학 패러다임 4가지를 VLM에 적용해 인간과 비교
- 2.추론('생각') 토큰 수를 반응시간 대용으로 사용, Wolfe 2010 인간 벤치마크 대조
- 3.특징 탐색은 평탄, 결합 탐색은 세트 크기에 따라 노력 증가로 인간 재현
- 4.타겟 존재 기울기가 부재보다 크고 세기는 정확한 등 인간과 다른 분기도 포착
왜 중요한가?
반응시간을 잴 수 없는 VLM에 추론 토큰 수를 '탐색 노력'의 대용 지표로 삼아, 심리물리학 패러다임이 기계 시각 인지를 값싸게 탐침하는 도구가 될 수 있음을 보인다. 인간과 일치하는 신호뿐 아니라 어긋나는 지점(타깃 존재 기울기 역전, 세기 정확성 유지)도 모델 인지 특성을 드러내는 정보가 된다.
본문 미리보기
arXiv:2606.25066v1 Announce Type: new Abstract: Visual search has been one of the most productive paradigms in the study of visual attention: the way reaction time scales with the number of items distinguishes parallel, "pop-out" search from serial, attention-demanding search. I ask whether vision-language models (VLMs) exhibit the same behavioral signatures. I adapt four classic paradigms: feature versus conjunction search, spatial-configuration (T-vs-L) search, enumeration, and the tilted/ver
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

