소형 로컬 LLM과 결정론적 기호 컴포넌트를 결합해 LEED v4.1 BD+C 친환경 건축 인증 문서를 자동 심사하는 신경-기호 파이프라인 연구다. 대학 건물 4곳(PDF 484개, 크레딧 판정 153건) 실험에서 4B 파라미터 gemma3:4b가 텍스트 전용 검증기로 67.3% 정확도를 기록해 8B llama3.1:8b를 앞섰고, 결정론적 수치 검사기는 EA-p2 크레딧 정확도를 50%에서 100%로 끌어올렸다. 다만 전체 신경-기호 구성은 추출 실패와 보수적 판정 탓에 61.6%로 텍스트 전용 기준선에 못 미쳤다. 저해상도 도면 이미지(150~300dpi) 추가는 오히려 정확도를 일관되게 떨어뜨렸으며, 문서가 풍부한 프로젝트엔 루브릭 프롬프트, 빈약한 프로젝트엔 CoT 프롬프트가 유리했다. 문서 집약적 인증 심사의 로컬 LLM 자동화에 대한 재현 가능한 기준점을 제공한다.
- •4B 모델 gemma3:4b가 67.3% 정확도로 8B llama3.1:8b를 능가하는 역전 결과
- •결정론적 수치 검사기가 EA-p2 크레딧 정확도를 50%→100%로 개선
- •전체 신경-기호 구성은 61.6%로 추출 실패 탓에 텍스트 전용 기준선에 열세
- •저해상도 도면 이미지 추가는 오히려 정확도를 일관되게 하락시킴
- •프롬프트 효과는 프로젝트 문서 풍부도에 따라 달라짐(루브릭 vs CoT)
Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts
- 1.로컬 4B 모델 gemma3:4b가 LEED 문서 검증 정확도 67.3%로 더 큰 llama3.1:8b를 상회
- 2.결정적 수치 검사기가 산술 오류를 교정, EA-p2 크레딧 정확도 50%→100% 개선
- 3.전체 뉴로심볼릭 구성은 61.6%로 텍스트 전용 베이스라인에 못 미침(추출 실패 탓)
- 4.150~300dpi 저해상도 도면 이미지 추가는 오히려 정확도를 일관되게 하락시킴
왜 중요한가?
LEED 인증 심사처럼 수백 페이지 문서를 다루는 실무에서 소형 로컬 모델+수치 검사기 조합의 가능성과 한계를 재현 가능한 기준점으로 제시했다. 저품질 멀티모달 입력이 오히려 성능을 해친다는 반직관적 결과도 주목할 만하다.
🏷️ 언급 프로젝트
본문 미리보기
arXiv:2607.15647v1 Announce Type: new Abstract: LEED v4.1 BD+C certification remains a document-intensive process that requires reviewers to read hundreds of pages of project evidence and apply credit-specific threshold logic by hand. This paper investigates whether small, locally deployed language models can perform meaningful screening of LEED documentation and how deterministic symbolic components should share that work. A neuro-symbolic pipeline is introduced that aligns project PDFs to LEE
전체 내용이 궁금하다면?
원문을 직접 읽어보세요