LLM이 생성하는 RTL(레지스터 전송 수준) 하드웨어 코드는 기능 정확성은 빠르게 개선되고 있지만, 보안 취약점은 배포 후 패치가 불가능한 실리콘 특성상 소프트웨어보다 훨씬 위험하다. 연구팀은 5개 CWE 취약점군과 4개 하드웨어 언어(Verilog·SystemVerilog·VHDL·Python)에 걸친 392개 과제로 구성된 벤치마크 SECRTL-GEN을 구축해 5개 최신 LLM을 평가한 결과, 일반 프롬프트로는 기능 테스트 통과율이 73~79%인 반면 보안 테스트 통과율은 14~35%에 그쳤고 기능이 뛰어난 모델일수록 보안이 강한 것도 아니었다. 명세서에 보안 요건이 암묵적으로 누락된 것이 근본 원인임을 확인한 연구팀은, LLM이 명세에서 기능-의미 그래프를 추출하면 기호 추론 엔진이 CWE 패턴과 대조해 누락된 보안 요건을 찾아내고 이를 반영해 코드를 재생성하는 신경-기호 프레임워크 'RTL-Obliger'를 제안했다. 이 방법은 기존 보안 생성 기법 대비 전체 통과율을 49.6~51.4%에서 61.6%로 끌어올렸다.
- •LLM 생성 RTL 코드, 기능 통과율 73~79% 대비 보안 통과율은 14~35%로 큰 격차
- •392개 과제·5개 CWE군·4개 HDL로 구성된 보안 벤치마크 SECRTL-GEN 공개
- •명세서에 보안 요건이 암묵적으로 누락된 것이 근본 원인, 기능 우수 모델도 안전하지 않음
- •신경-기호 프레임워크 'RTL-Obliger'로 전체 통과율 49.6~51.4%→61.6% 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation
- 1.4개 HDL·5개 CWE패미리·392개 과제로 구성된 RTL 보안 벤치마크 SECRTL-GEN 공개
- 2.5개 최신 LLM이 기본 프롬프트에서 기능 테스트는 73-79% 통과하지만 보안 테스트는 14-35%에 그침
- 3.병목은 방어적 RTL 작성 능력 부족이 아니라 명세서의 약점 인지 부재임을 확인
- 4.암묵적 보안 의무를 추론하는 뉴로-심볼릭 프레임워크 RTL-Obliger로 전체 통과율을 51%에서 61.6%로 향상
왜 중요한가?
배포 후 패치가 불가능한 실리콘 칩에 들어갈 RTL 코드에서 LLM이 기능은 맞히면서도 보안 의무를 놓치기 쉽다는 점을 실증해, 하드웨어 설계 자동화에 보안 검증 단계를 필수로 넣어야 함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2608.26588v1 Announce Type: new Abstract: Large Language Models (LLMs) generate register-transfer-level (RTL) code with rapidly improving functional correctness. Security of LLM-generated code, however, has been studied mainly for software, where flaws can still be patched after deployment. Insecure RTL offers no such remedy once taped out into silicon. We construct SECRTL-GEN, a multi-language resource-access security benchmark grounded in real SoC IP: 392 tasks over five CWE families an
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

