NxN E-valuation은 별도의 사례별 검증 절차나 전용 귀무가설을 만들지 않고도, 충분히 큰 데이터셋만 있으면 가설을 검증할 수 있는 e-value 기반 가설 인증 알고리즘이다. 특히 LLM이 가설 제안에는 뛰어나지만 환각에 취약해 결과를 그대로 신뢰하기 어려운 LLM 기반 탐색 시스템에 적합하며, 기존 순환 검증이나 홀드아웃 테스트가 가짜 상관관계로 실패하는 문제를 보완한다. 이 방법은 이미 존재하는 대규모 학습 데이터셋을 활용해 서로 다른 샘플이 상호 귀무가설 역할을 하도록 하여 조건부 무작위화 검정(CRT)을 직접 구현한다. LLM 생성 결과가 개별 샘플에 적용되는 가설인 경우, 순환 검증과 홀드아웃 테스트를 대체할 보편적으로 더 나은 방법이 될 수 있다.
- •사례별 검증 절차 없이 e-value로 가설을 인증하는 알고리즘
- •LLM 환각으로 인한 순환 검증·홀드아웃 테스트의 한계를 보완
- •샘플 간 상호 귀무가설 역할로 조건부 무작위화 검정 구현
- •LLM 기반 가설 탐색 시스템에 특히 적합
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NxN E-valuation: Hypothesis Certification via a Conformal CRT Null
본문 미리보기
arXiv:2608.06621v1 Announce Type: new Abstract: We propose NxN E-valuation, a handy, e-value-based hypothesis-certification algorithm that lets a hypothesis be verified without building any case-specific certification procedure---such as constructing a dedicated null hypothesis---as long as a large enough dataset is available. The method is especially suited to LLM-based exploration systems, where LLMs are remarkably good at proposing hypotheses but suffer badly from hallucination; this halluci
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

