LaTeX·Typst·마크다운 등 마크업 소스가 컴파일 오류를 일으켰을 때 LLM이 이를 복구하는 능력을 평가하는 다중 포맷 벤치마크 'TeXFix-Bench'가 공개됐다. 기존 문서 복구 평가는 임의적인 수정으로 결함을 주입해 실증적 결함 모델이 부재했다는 문제를 해결하기 위해, TeX 스택 익스체인지와 깃허브 커밋 등에서 크래시 결함 168건을 수집·분류해 18개 범주의 결함 분류 체계와 이를 구현한 결함 주입 도구 'DocMut'(48개 연산자)을 만들었다. 7개 LLM으로 제로샷 프로토콜 하에 4만8651회 복구 시도(약 200달러 추론 비용)를 수집한 결과, DocMut이 만든 결함은 기존 패턴 기반 변형보다 5.6~9.2%포인트 더 어려웠고 Typst가 LaTeX·마크다운보다 확연히 어려운 것으로 나타났다. 또한 컴파일에는 성공해도 13.6~18.5%의 복구가 문서 내용을 실질적으로 바꿔놓아, 컴파일 성공률만으로는 복구 품질을 온전히 평가할 수 없다는 점도 확인됐다.
- •TeX 스택 익스체인지·깃허브 등에서 수집한 결함 168건 기반 18개 범주 결함 분류체계 구축
- •DocMut 결함 주입 도구는 기존 패턴 기반 변형보다 5.6~9.2%포인트 더 어려운 결함 생성
- •7개 LLM, 총 48,651회 복구 시도(약 200달러 추론 비용)로 대규모 평가 수행
- •Typst가 LaTeX·마크다운보다 확연히 복구 난이도가 높음
- •컴파일 성공률과 실제 내용 보존율이 다르게 나타나 컴파일 성공만으로는 품질 평가 불충분
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair
본문 미리보기
arXiv:2608.07617v1 Announce Type: new Abstract: Scientific and technical writing depends on markup sources that must compile: LaTeX, Typst, and Markdown pipelines fail on missing delimiters, mismatched environments, broken imports, or package conflicts. Existing document-repair evaluations inject faults with ad-hoc edits that lack an empirical fault model. We present TeXFix-Bench, a multi-format benchmark for LLM-based full-source document repair grounded in a mined fault taxonomy. A Grounded-T
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

