기업 데이터에 대한 자연어 인터페이스는 불명확한 요청을 통제된 실행 가능 동작으로 변환하면서 잘못된 질의, 정책 위반, 비용, 비결정성을 함께 관리해야 한다. SemPlan Benchmark는 영어와 브라질 포르투갈어로 구성된 1,800건(과학적 평가용 고정 부분집합 1,200건)의 결정론적 합성 벤치마크로 이 설계 공간을 평가한다. 직접 SQL 생성(A1), 제한된 도구-에이전트(A2), 구조화된 의미 요청 생성 후 결정론적 계획·실행(A3), 명확화/상태유지 의미계획 변형(A4) 네 아키텍처를 비교한 결과, 답변 정확도는 절대적으로 낮았으며(A1 22.25%, A2 22.58%, A3 25.67%, A4 24.25%) A3가 가장 높은 정확도로 나머지를 유의하게 앞섰지만 A1은 정책 준수율이 가장 높고 위험·무효 응답률이 가장 낮았다. A4는 평균 API 비용과 잘못된 거절률이 가장 낮았다. 150건 안정성 부분집합에서 정답 재현율은 92~98.67%로, 결과는 구조적 제약이 실패 양상과 효율성을 바꿀 뿐 정확도를 일관되게 높이거나 모호성·다중턴 상태 일관성 문제를 해결하지는 못하는 트레이드오프임을 보여준다.
- •영어·포르투갈어 1,800건 결정론적 합성 벤치마크로 기업 데이터 자연어 질의 설계 4가지를 비교.
- •답변 정확도는 22.25~25.67%로 전체적으로 낮았고, 구조화 의미계획(A3)이 가장 높았다.
- •직접 SQL 생성(A1)은 정책 준수율이 가장 높고 위험·무효 응답률은 가장 낮았다.
- •구조적 제약이 실패 양상과 효율을 바꿀 뿐 정확도를 일관되게 높이지는 않는 트레이드오프임을 확인.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data
- 1.LLM 기반 기업 데이터 쿼리
- 2.구조화된 시맨틱 플래닝
- 3.SemPlan 벤치마크 개발
왜 중요한가?
기업 데이터에 대한 자연어 인터페이스는 부정확한 요청을 통제하고 비용을 관리하면서 실행 가능한 쿼리로 변환하는 것이 중요하며, 이 연구는 이러한 시스템의 성능을 평가하는 벤치마크를 제공하여 실제 적용 가능성을 높입니다.
언급 프로젝트
국내 기업들은 데이터 활용도를 높이기 위해 LLM 기반의 자연어 인터페이스 도입에 큰 관심을 보이고 있습니다. SemPlan 벤치마크는 이러한 시스템이 기업 환경에서 실제로 얼마나 효과적이고 안전하게 작동하는지 평가하는 중요한 기준으로 활용될 수 있습니다. 한국 기업들이 AI 도입 시 직면하는 데이터 거버넌스 및 비용 관리 문제를 해결하는 데 실질적인 지침을 제공할 것입니다.
본문 미리보기
arXiv:2608.13612v1 Announce Type: new Abstract: Natural-language interfaces to enterprise data must translate underspecified requests into governed, executable behavior while controlling invalid queries, policy failures, cost, and nondeterminism. SemPlan Benchmark evaluates this architectural design space with a deterministic synthetic bilingual benchmark containing 1,800 cases in English and Brazilian Portuguese; 1,200 cases form the frozen scientific evaluation subset. Four architectures are
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

