이 연구는 법적 판단 예측처럼 사건에 적용할 시점상 올바른 법 버전을 식별하는 '시간적 적용법 판단' 능력을 LLM이 신뢰성 있게 수행할 수 있는지 벤치마크로 검증했다. 실험 결과 LLM은 법적으로 관련된 사실이 언제 발생했는지와 무관하게 가장 최근 제정된 법을 적용하는 강한 편향을 보였다. 이 편향은 법이 시간적 범위를 갖는다는 이해 부족이나 과거 법령 지식 부족 때문이 아니었으며, 오히려 강화학습으로 형성된 명시적 추론이 일반 추론 능력은 향상시키면서도 추론 경로의 다양성을 줄여 현재 법 적용으로 수렴시키는 핵심 기제로 확인됐다. 그 결과 일반 추론 능력이 강한 모델일수록 시간적 법적 추론에서 오히려 더 나쁜 성능을 보이는 역설적 역상관 관계가 나타났다.
- •LLM이 사실 발생 시점과 무관하게 최근 제정법을 적용하는 강한 편향 확인
- •이해 부족이나 지식 부족이 원인이 아님을 실험적으로 입증
- •강화학습 기반 명시적 추론이 추론 경로 다양성을 줄여 현행법 수렴을 유발
- •일반 추론력이 강한 모델일수록 시간적 법적 추론은 오히려 약해지는 역상관 발견
- •법률 적용 벤치마크를 새롭게 구축해 LLM의 법적 추론 개선 방향 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning
- 1.LLM의 '시간적 준거법 판단' 능력 평가하는 새 벤치마크 구축, 최근제정법을 대는 강한 편향 확인
- 2.이 편향은 법의 시간적 적용범위 이해 부족이나 과거 법령 지식 부족 때문이 아니라는 점을 입증
- 3.강화학습 기반 추론은 일반 추론력을 높이지만 현행법 수렴을 유도, 추론력 강할수록 시간적 법률 추론은 오히려 저하
왜 중요한가?
법률 판단 예측(LJP) 등 실무에 LLM을 적용할 때 사건 발생 시점의 법이 아닌 최신 법을 무비판적으로 적용하는 편향은 실제 오판으로 이어질 수 있어, 추론 능력 향상이 곧 법률 정확도 향상을 보장하지 않는다는 점을 보여준다.
본문 미리보기
arXiv:2608.14610v1 Announce Type: new Abstract: Legal reasoning tasks such as legal judgment prediction (LJP) require identifying the temporally correct version of the law governing a case -- a capability we term temporal applicable-law determination. However, whether large language models (LLMs) can reliably perform this task remains unexplored. In this paper, we construct a benchmark to evaluate LLMs on temporal applicable-law determination, and systematically investigate why they fail at tem
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
