기업용 SQL 생성에서 문법 유효성, 역할·스키마 정책 준수, 증명 가능한 보장, 감사 기록을 동시에 제공하는 문법 제약 디코딩 엔진 GRID(Grammar-Railed Decoding)를 제안했다. 토큰 시퀀스가 아닌 파서 구성(렉서 스캔 상태 × LALR(1) 스택)에 정확한 다음 토큰 마스크를 키잉하고, 역할 기반 접근제어를 문법 자체에 컴파일해 금지된 동사·식별자를 마스크 수준에서 원천 차단한다. Rust 커널로 토큰당 마스크 비용이 3.6~6.7μs로 llguidance보다 빠르고, 토큰 위치가 늘어도 비용이 평탄하다. Spider 벤치마크에서 0.5B 모델의 실행 정확도를 13%p 올렸고, 검사기 유도 수리 1회를 더하면 7B 모델이 94.5% 실행 가능률에 도달했다. 해시 체인 감사 추적은 100% 변조 탐지로 비트 단위 재현이 가능해, 규제 환경의 LLM SQL 배포에 실질적 기반을 제공한다.
- •파서 구성(렉서 상태 × LALR(1) 스택) 기반 정확한 토큰 마스킹으로 건전성·완전성·종료·근상수 비용 4대 보장
- •RBAC를 문법에 컴파일해 금지 동사·식별자를 마스크 수준에서 도달 불가능하게 차단
- •토큰당 마스크 3.6~6.7μs, n=16,000에서도 위치 무관 비용, 거짓 거부 0건
- •Spider에서 0.5B 모델 실행 정확도 +13%p, 수리 패스 추가 시 7B 모델 94.5% 실행 가능
- •해시 체인 감사 추적이 비트 단위 재현과 100% 변조 탐지 제공, 마스크의 한계도 명시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GRID: Grammar-Railed Decoding for Enterprise SQL Generation
- 1.기업 SQL 생성용 문법 제약 디코딩 엔진 GRID 제안, LALR(1) 파서를 마스크 오라클로 활용
- 2.역할 기반 접근제어를 문법에 컴파일 — 금지 구문·식별자는 마스크 단계에서 도달 불가
- 3.Rust 커널로 토큰당 3.6~6.7마이크로초, 1.6만 토큰까지 비용 평탄 유지
- 4.Spider서 0.5B 모델 실행 정확도 +13점, 복구 패스 포함 시 7B 모델 94.5% 실행 가능
왜 중요한가?
'그럴듯한 SQL'과 '증명 가능하게 안전한 SQL'의 간극을 메운 시스템으로, 접근제어를 프롬프트가 아닌 문법 차원에서 강제하고 해시체인 감사 추적까지 갖춰 규제 산업의 텍스트-투-SQL 배포 요건을 정면으로 겨냥했다. 마스크가 못 하는 것을 명시한 점도 드물게 정직하다.
언급 프로젝트
본문 미리보기
arXiv:2607.11951v1 Announce Type: new Abstract: Large language models can write SQL, but enterprise deployment demands more than plausible text: outputs must be syntactically valid, must respect per-role and per-schema policy, must carry provable (not best-effort) guarantees, must not slow down as generations grow, and must leave a compliance-grade record of every decision. We present GRID (Grammar-Railed Decoding), a grammar-constrained decoding engine that keys exact next-token masks on parse
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

