정부 '독자 AI 파운데이션 모델(독파모)' 2차 단계평가가 1차와 동일하게 벤치마크·전문가·이용자 평가로 구성되며, 이번엔 이용자 평가를 전문 이용자와 일반 국민 200명이 참여하는 방식으로 나눴다고 14일 관계부처가 밝혔다. 과기정통부는 LLM 자체 성능을 보는 전문 이용자 평가에서는 도구 호출을 제한하고, 전문가 평가에서는 자유롭게 허용해 에이전틱 역량을 구분해 살핀다. 참여 모델 4종의 실제 업무수행 벤치마크(GDPval-AA)에서는 모티프테크놀로지스 '모티프 3'가 39%로 가장 높았고 업스테이지 '솔라 오픈2' 31%, SK텔레콤 '에이닷엑스 K2' 30%, LG AI연구원 'K-엑사원 2.0' 24% 순이었다. 전문가들은 벤치마크 점수를 넘어 실제 업무 환경에서의 활용성 검증이 중요하다고 지적한다.
- •독파모 2차 평가, 이용자 평가를 전문 이용자·일반 국민 200명 참여 방식으로 분리
- •전문 이용자 평가는 도구 호출 제한(LLM 자체 성능), 전문가 평가는 도구 호출 자유 허용해 에이전튱 역량 구분
- •GDPval-AA 실무업 벤치마크: 모티프 39%, 솔라오픈2 31%, 에이닷엑스 K2 30%, K-액사원2.0 24%
- •전문가들은 벤치마크 성적 넘어 실제 업무 환경 실증 검증 필요성 강조
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
독파모 2차, 에이전틱AI 평가 어떻게?..."전문가 평가선 툴 호출 허용"

- 1.정부 독파모 2차 평가, 전문가 평가에서는 도구 호출을 자유롭게 허용해 에이전틱 역량을 별도 측정
- 2.1차와 달리 이용자 평가를 전문이용자·일반국민 200명 참여하는 '일반 이용자 평가'로 확대
- 3.실무 수행능력 GDPval-AA에서 모티프 3이 39%로 1위, 타우3 뱅킹·터미널벤치에서도 최고점
- 4.참여 4개 모델(모티프·업스테이지·SKT·LG AI연구원) 모두 3대 글로벌 벤치마크 결과 공개
왜 중요한가?
국내 독자 파운데이션 모델의 경쟁력을 단순 벤치마크가 아닌 실제 도구 활용 능력까지 검증하는 체계로 평가해, 정부 지원 AI 모델의 실전 활용성을 가늠할 잣대를 제공한다.
본문 미리보기
[디지털투데이 손슬기 기자] 글로벌 거대언어모델(LLM) 경쟁 중심이 단순 질의응답을 넘어 외부 도구와 데이터를 활용해 실제 업무를 수행하는 '에이전틱 AI'로 이동하면서 정부 '독자 AI 파운데이션 모델' 프로젝트가 관련 역량을 어떻게 평가하는지에도 관심이 쏠린다.14일 관계부처 등에 따르면 독파모 2차 단계평가는 1차와 동일하게 ▲벤치마크 평가 ▲전문가 평가 ▲이용자 평가로 구성된다. 다만 1차에서는 AI 기업 대표 등 49명의 전문 이용자가 이용자 평가에 참여했던 것과 달리, 2차에서는 이용자 평가를 전문 이용자와 일반 국민
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안
