Ai2가 공개한 DiScoFormer는 데이터 포인트 집합을 입력받아 재학습 없이 단일 포워드 패스로 그 분포의 밀도(density)와 스코어(score)를 동시에 추정하는 트랜스포머다. 어텐션 헤드의 가중치가 사실상 가우시안 커널임을 해석적으로 보여 KDE(커널 밀도 추정)를 특수 사례로 포함하며, 배치마다 새 가우시안 혼합모델(GMM)을 샘플링해 정확한 정답으로 지도학습한다. 100차원에서 최적 튜닝된 KDE 대비 스코어 오차를 약 6.5배, 밀도 오차를 37배 이상 줄였고, 학습에 없던 모드 수나 Laplace·Student-t 같은 비가우시안 분포에도 일반화한다. 스코어 추정은 확산 생성모델·베이지안 추론·과학 시뮬레이션의 공통 의존성이어서, 문제마다 재학습이 필요 없는 사전학습 플러그인 추정기는 이 비용을 한꺼번에 줄일 수 있다.
- •단일 트랜스포머가 밀도와 스코어를 한 번의 포워드 패스로 추정, 크로스 어텐션으로 데이터가 없는 지점에서도 평가 가능
- •스코어=로그밀도의 기울기 관계를 이용한 라벨 없는 일관성 손실로, 추론 시 몇 번의 그래디언트 스텝만으로 분포 외 입력에 자체 적응
- •어텐션이 KDE의 엄밀한 일반화임을 해석적으로 증명, 고전 기법을 포함하면서 개선
- •100차원에서 최적 KDE 대비 스코어 오차 약 6.5배, 밀도 오차 37배 이상 감소, 샘플이 늘수록 계속 개선
- •GMM의 보편 근사성과 닫힌형 정답을 활용해 사실상 무한한 학습 분포 생성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DiScoFormer: One transformer for density and score, across distributions

- 1.Ai2, 밀도와 스코어를 한 번의 순전파로 동시 추정하는 DiScoFormer 트랜스포머 공개
- 2.100차원에서 최적 KDE 대비 스코어 오차 6.5배·밀도 오차 37배 이상 감소
- 3.크로스어텐션이 KDE를 특수 사례로 포함하며 다중 스케일을 학습해 일반화
- 4.GMM으로 학습, 라플라스·t분포 등 미학습 분포에도 정확한 플러그인 추정기
왜 중요한가?
스코어 추정은 확산 생성모델·베이지안 추론·과학 시뮬레이션에 공통으로 쓰이지만 기존엔 분포마다 재학습이 필요했다. 재학습 없이 고차원에서 정확한 사전학습 추정기는 이들 분야의 비용을 동시에 줄일 수 있다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 03:38AI 초안

