2억 개 이상의 천체로 학습된 39개 모달리티 트랜스포머 AION-1을 인과적 개입으로 감사한 결과, 이미지 토큰은 그대로 두고 서베이 분할지도(segmentation map)만 바꿔도 광도·크기·타원율·적색편이 등 모델이 보고하는 모든 값이 위약 대비 110~4400배 변했다. 원인은 실제로 마스크가 감싼 빛이 아니라 시야 중심에 탐지가 존재하는지 여부(탐지 게이팅)였으며, 잘못된 카탈로그 광도측정 정보를 주면 메타데이터를 아예 주지 않은 경우보다 9배 더 나쁜 결과를 냈다. Legacy Survey 파이프라인은 대상의 3.68%에 해당 위치를 덮는 세그먼트가 없는데, 이 누락률을 반영하면 층위별 평균 적색편이가 LSST DESC 요구치의 중앙값 0.71배만큼 이동하고 12건은 이를 초과했으며, 분광 관측을 활용하거나 탐지 채널 자체를 제거하면 이 효과가 사라졌다.
- •이미지 토큰은 고정하고 서베이 분할지도만 바꿔도 예측값이 위약 대비 110~4400배 변동
- •원인은 빛의 내용이 아닌 '시야 중심 탐지 여부'에 의존하는 탐지 게이팅 현상
- •잘못된 카탈로그 광도측정 정보가 메타데이터 미제공보다 9배 더 나쁘 결과 유발
- •탐지 누락률 반영 시 층위별 평균 적색편이가 LSST DESC 요구치의 중간값 0.71배만큼 이동
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A survey detection channel overrides the pixels in an astronomical foundation model, and biases tomographic mean redshifts
- 1.39모달 천문 파운데이션모델 AION-1 인과감사, 분할지도만 바꿔도 광량·적색편이 등 출력 110~4400배 변함
- 2.원인은 실제 빛 분포가 아닌 '탐지 게이팅'(대상이 영상 중심에 검출됐는지)에 있음, 322개 실제 블렌드서 모델은 광원 분할방식을 사실상 무시
- 3.위치 놓친 3.68% 대상 비율 전파 시 적색편이 추정치가 LSST DESC 요구정확도 중앙값 0.71배까지 흔들리고 40개 중 12개는 초과
- 4.분광데이터 사용이나 탐지채널 제거 시 오류 사라지며, 이 효과는 모델 규모가 커질수록 오히려 심해짐
왜 중요한가?
차세대 대형 서베이(LSST 등)가 의존할 파운데이션 모델이 카탈로그의 숨은 결측 패턴을 흡수해 계통오차를 만들 수 있음을 실증, 천문 AI 모델의 배포 전 인과 검증 필요성을 제기한다.
언급 프로젝트
본문 미리보기
arXiv:2608.23626v1 Announce Type: new Abstract: Foundation models for astronomy are trained on survey pixels together with the catalogue products derived from those pixels. Those catalogues are incomplete at a measurable rate, and a model trained on both inherits that incompleteness as a systematic. We audit AION-1, a 39-modality transformer trained on more than 200 million objects, using causal interventions on its inputs. Holding the image tokens byte-identical and editing only the survey s
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
