이 연구는 LLM과 소형 언어모델(SLM)이 보안 규정을 준수하는 Terraform 코드를 생성할 수 있는지 7개 모델(Claude Opus 4, GPT-5.4, Gemini 2.5 Pro 등 폐쇄형 3종과 Qwen2.5-Coder-14B 등 오픈 SLM 4종)로 벤치마킹했다. Checkov와 Trivy 스캐너를 GitLab CI/CD 파이프라인에 통합해 17개 시나리오에서 평가한 결과, 문법적으로 올바른 코드를 만드는 것과 실제로 안전한 코드를 만드는 것은 서로 거의 무관한 것으로 드러났다. WizardCoder-33B는 77.8%의 유효성 통과율을 보였지만 Checkov 준수율은 0%였고, 반면 Claude Opus 4는 상세한 보안 프롬프트 하에서 Checkov 23.1%, Trivy 92.5%의 통과율을 기록했다. 이는 프롬프트 엔지니어링만으로는 충분하지 않으며, 모델이나 프롬프트 전략과 무관하게 자동화된 다중 도구 스캐닝이 반드시 병행돼야 함을 시사한다.
- •Claude Opus 4·GPT-5.4·Gemini 2.5 Pro 등 폐쇄형 3종, 오픈 SLM 4종을 17개 시나리오로 벤치마크
- •Checkov·Trivy를 GitLab CI/CD에 통합해 코드의 실질적 보안 준수 여부 측정
- •WizardCoder-33B는 문법 유효성 77.8%지만 Checkov 준수율 0%로 괴리
- •Claude Opus 4는 상세 보안 프롬프트 하 Checkov 23.1%, Trivy 92.5% 통과율 기록
- •프롬프트 엔지니어링만으로는 불충분, 자동 다중 도구 스캐닝 병행 필요성 강조
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation
본문 미리보기
arXiv:2608.02672v1 Announce Type: new Abstract: Cloud misconfiguration remains a leading cause of security incidents, yet whether LLMs and SLMs can generate security-compliant Infrastructure-as-Code is an open question. We benchmark seven models, three closed LLMs (Claude Opus 4, GPT-5.4, Gemini 2.5 Pro) and four open SLMs (Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B, Magicoder-S-CL-7B), on AWS Terraform generation across 17 scenarios, integrating Checkov and Trivy scanners into a GitLab
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



