이 연구는 Claude Fable 5, Opus 4.8, Opus 5 세 프론티어 모델이 보안을 명시하지 않은 상태에서 SOC 2가 요구하는 암호화·접근제한·로깅·보존 통제를 스스로 적용하는지, 그리고 SOC 2를 언급하는 한 문장이 결과를 얼마나 바꾸는지 검증했다. S3 CLI, 인증 서비스, RDS Terraform 모듈, 파일 업로드 핸들러 네 가지 사례를 중립적 지시와 SOC 2 언급 지시로 각각 생성해 24개 결과물을 신뢰서비스기준(Trust Services Criteria)에 매핑된 이분법 채점표로 평가했다. 프롬프트 없는 상태의 준수율은 47~88%에 그쳤고, 원격코드실행이 가능한 Werkzeug 디버거 노출, 인증 없는 다운로드, 이메일 전체 노출 같은 실제 취약점이 포함됐음에도 첫 체크리스트에서는 걸러지지 않았다. SOC 2를 언급한 한 문장만으로 모든 사례가 86~100%로 상승하고 취약한 구성이 모두 사라졌지만, MFA 훅이나 쿠키 플래그처럼 모델이 과제 범위 밖으로 여기는 통제는 여전히 누락됐다. 모델 간 차이는 크지 않았던 반면, 패턴매칭 채점기는 216건 중 27건에서 의미론적 채점과 불일치해 신뢰도에 한계가 있음을 시사한다.
- •보안 언급 없는 중립 프롬프트에서 SOC 2 준수율은 47~88%에 그침
- •Werkzeug 디버거 노출, 미인증 다운로드, 이메일 전체 노출 등 실제 취약점이 체크리스트 통과
- •SOC 2를 명시하는 한 문장만으로 모든 사례 준수율이 86~100%로 상승하고 취약한 구성이 사라짐
- •MFA 훅, 쿠키 플래그 등 과제 범위 밖으로 여기는 통제는 프롬프트 추가에도 여전히 누락
- •패턴매칭 채점기가 216건 중 27건에서 의미론적 채점과 불일치해 신뢰성 한계 지적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Can AI Write Compliant Code, and to What Extent? Evaluating SOC 2 Compliance of Claude Fable 5, Claude Opus 4.8, and Claude Opus 5 Across Four Use Cases
본문 미리보기
arXiv:2608.07776v1 Announce Type: new Abstract: Software teams now delegate production code to language models, including code that provisions storage, handles credentials, and stores regulated data, so we asked whether a model applies the controls a SOC~2 program expects (encryption, restricted access, logging, retention) when nobody mentions security, and how much one sentence naming the standard changes the answer. We tested three frontier models (Claude Fable~5, Opus~4.8, and Opus~5) across
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



