구글 딥마인드가 27일(현지시간) 세계 최초로 자체 개발한 AI 이중맹검(Double-blind) 평가 기술을 시범 운영한다고 발표했다. 구글 클라우드의 '기밀 공간' 기술을 활용해 평가자는 모델 가중치를, 개발사는 평가자의 테스트 프롬프트를 서로 볼 수 없는 암호학적 검증 환경을 구축해 벤치마크 사전 학습으로 인한 '벤치마크 오염' 문제를 해결하려는 시도다. 이번 시범에서는 싱가포르 AI안전연구소, 오픈마인드, AVERI, ML커먼스 등과 협력해 '제미나이 2.5 플래시 라이트' 모델을 ML커먼스의 비공개 벤치마크 'AILuminate'로 검증했다. 구글은 이 방식이 향후 정부·평가 기관의 AI 검증 표준으로 자리잡을 수 있다고 기대했다.
- •구글 딥마인드, 세계 최초 AI 이중맹검 평가 기술 보고서 공개 및 시범 운영
- •구글 클라우드 '기밀 공간' 활용, 모델 가중치와 테스트 프롬프트를 상호 비공개로 검증
- •싱가포르 AISI·오픈마인드·AVERI·ML커먼스와 협력해 제미나이 2.5 플래시 라이트 검증
- •ML커먼스 비공개 벤치마크 'AILuminate'로 벤치마크 오염 방지 효과 시험
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
구글, 세계 첫 AI 이중맹검 평가 시범 운영…'벤치마크 오염' 방지 나서

- 1.구글 딥마인드, 세계 최초 이중맹검(Double-blind) AI 평가 기술 보고서 공개…벤치마크 오염 방지 목표
- 2.구글 클라우드 '기밀 공간' GPU 인클레이브로 평가자·모델사 양측 데이터 비공개 유지
- 3.싱가포르 AISI·오픈마인드·AVERI·ML커먼스와 협력, '제미나이 2.5 플래시 라이트' 성능 검증에 시범 적용
- 4.비공개 벤치마크 'AILuminate' 활용해 보안 환경 내 평가 진행
왜 중요한가?
벤치마크 사전 학습으로 성능이 부풀려지는 문제를 암호학적으로 원천 차단하는 방식을 최초 제시해, 특히 보안·정부 영역의 AI 안전성 감독 표준으로 확산될 가능성이 있다.
본문 미리보기
구글이 암호화 기술을 활용해 개발한 최첨단 AI 모델에 대한 이중맹검(Double-blind) 평가를 시범 운영한다고 발표했다. AI 모델이 평가 전에 문제 데이터를 미리 학습해 성능 점수가 인위적으로 부풀려지는 '벤치마크 오염' 문제를 기술적으로 해결하겠다는 취지다.구글 딥마인드는 27일(현지시간) 세계 최초로 자체 개발한 이중맹검 평가 기술 보고서를 공개했다. 그동안 AI 업계의 한계로 지적되어 온 성능 평가 체계를 다듬기 위한 시도라는 설명이다.현재는 평가자가 벤치마크 문제를 공개하면, 개발사가 이를 모델에 학습할 위험이 있다
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
