이 연구는 과학 방정식 발견 벤치마크 LSR-Synth가 기존 공식을 단순 암기하는지 실제로 데이터를 이용하는지 구분하기 어려운 문제를, 확립된 과학적 메커니즘에 새로운 합성 항을 삽입하는 방식으로 완화했다는 데서 출발해, 더 좁은 질문 즉 언어모델이 제공하는 과학적 사전지식이 과업 의미론에 접근하지 않는 전통적 연산자 탐색과 실제로 구분되는지를 검증한다. 공개적으로 출처가 명시된 고정 어휘 기반의 의미론-무관 기준선을 구축하고, 의미론 블라인딩·어휘 약화·매칭된 연산자군 제거를 통해 후보 범위의 역할을 평가했다. 현재의 과업 스냅샷·탐색 예산·채점 프로토콜 하에서는 고정 어휘가 이미 대부분의 과업을 커버해, 언어모델이 생성한 후보가 풀 수 있는 문제 집합을 거의 확장하지 못했으며, 어휘 커버리지가 선택적으로 훼손됐을 때만 언어모델의 기여가 뚜렷해졌다. 엄격한 분포외(OOD) 평가에서도 모든 방법의 절대 성공률은 낮아지지만 이 관계 자체는 바뀌지 않아, 현재 과업 대부분은 미지의 표현식을 맞추고 재조합하는 능력 평가에는 적합하지만 고정 탐색 공간을 넘어서는 사전지식의 기여를 식별하기에는 부족하다는 제한적 결론을 제시한다.
- •과학 방정식 발견 벤치마크 LSR-Synth에서 언어모델 사전지식의 기여가 전통적 연산자 탐색과 구분되는지 검증했다.
- •공개 출처의 고정 어휘 기반 의미론-무관 기준선을 만들어 후보 범위의 역할을 분리 평가했다.
- •현재 과업에서는 고정 어휘만으로 대부분 해결돼 언어모델 후보의 추가 기여가 미미했다.
- •어휘 커버리지를 선택적으로 훼손했을 때만 언어모델의 기여가 띄렬하게 드러났다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery
본문 미리보기
arXiv:2607.28684v1 Announce Type: new Abstract: Existing benchmarks for scientific equation discovery are largely composed of well-known equations available in the public domain, making it difficult to determine whether a model is discovering laws from data or merely recalling answers from its training corpus. LSR-Synth mitigates this problem by introducing novel synthetic terms into established scientific mechanisms and filtering the resulting tasks for novelty, solvability, and scientific pla
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

