KAIST 전기및전자공학부 김준모 교수 연구팀이 대형언어모델(LLM)의 레드팀 검증 기술 한계를 극복한 새 프레임워크 '스테이블-지플로우넷(Stable-GFlowNet)'을 개발했다. 기존 강화학습 기반 공격 생성 방식은 한두 가지 성공 공격만 반복하는 모드 붕괴 문제가 있었는데, 연구팀은 대조 궤적 균형(CTB), 노이즈 경사 가지치기(NGP), 유창성 안정화 장치(MKS) 세 기술을 결합해 이를 해결했다. 그 결과 기존 기술이 찾아낸 17개 공격 유형보다 약 7배 많은 134개의 고유 공격 유형을 발굴하면서도 92%의 높은 공격 성공률을 유지했으며, 서로 다른 공격 기법으로 평가하는 교차 공격 시험에서도 우수한 방어 성능을 보였다. 이 연구는 ICML 2026에서 상위 2.2%에 해당하는 스포트라이트 논문으로 선정됐으며, 신약 후보 물질 생성 등 다른 생성형 AI 분야에도 활용될 수 있을 것으로 기대된다.
- •KAIST 김준모 교수팀, LLM 레드팀 기술 한계를 극복한 '스테이블-지플로우넷' 개발
- •대조 괼적 균형(CTB)·노이즈 경사 가지치기(NGP)·유창성 안정화(MKS) 세 기술로 모드 붕괴 문제 해결
- •기존 17개 공격 유형보다 약 7배 많은 134개 공격 유형 발굴, 공격 성공률 92% 유지
- •ICML 2026 상위 2.2% 스포트라이트 논문 선정, 신약 후보 물질 생성 등에도 활용 가능성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
"AI가 스스로 숨은 약점 찾는다"…KAIST 김준모 교수팀, AI 안전성 검증 기술 ‘스테이블-지플로우넷’ 개발
본문 미리보기
튼튼한 성을 만들려면 먼저 약한 곳을 찾아야 한다. 생성형 인공지능(AI)도 마찬가지다. KAIST 연구진이 AI의 숨은 취약점을 기존보다 약 7배 더 다양하게 찾아내는 안전성 검증 기술을 개발했다. 더욱 안전하고 신뢰할 수 있는 AI 개발의 기반이 될 것으로 기대된다.KAIST 전기및전자공학부 김준모 교수 연구팀이 대형언어모델(LLM)의 안전성을 검증하는 레드팀(Red Teaming) 기술의 한계를 극복한 새로운 프레임워크 ‘스테이블-지플로우넷(Stable-GFlowNet)'을 개발했다고 30일 밝혔다.생성형 AI의 레드팀은 프로
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:29AI 초안
