과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 '독자 AI 파운데이션 모델' 프로젝트에 참여한 네이버클라우드·업스테이지·SKT·NC AI·LG AI연구원 등 5개팀이 1차 단계평가에서 확보한 데이터 29종(약 3,544만건, 약 1.56조 토큰)을 AI허브에 공개했다. 이는 이론적으로 700억~800억 파라미터급 대형 모델 학습에 활용 가능한 규모로, 대규모 사전학습 데이터셋부터 멀티모달·레드티밍 데이터까지 다양하게 구성됐다. 업스테이지는 1조 토큰 규모 사전학습 데이터, SKT는 한국형 레드티밍 데이터 약 1만건, LG AI연구원은 국내 50개 가정에서 촬영한 17만개 이상의 피지컬 AI 영상 클립을 각각 구축했다. NIA와 TTA의 품질·개인정보·유해성 검증을 거쳤으며, 국내 기업·연구자·학생은 누구나 무료로 다운로드할 수 있다.
- •과기정통부·NIA, 독자 AI 파운데이션 모델 5개팀의 데이터 29종(3,544만건·1.56조 토큰) AI허브 공개
- •네이버클라우드는 영상 286만건과 텍스트 1,550만건·음성 질의응답 1,200만건 구축
- •업스테이지 1조 토큰 사전학습 데이터, SKT 한국형 레드티밍 데이터 약 1만건 포함
- •LG AI연구원, 국내 50개 가정서 촬영한 17만개 이상 피지컬 AI 멀티모달 영상 클립 확보
- •NIA·TTA 품질·개인정보·유해성 검증 거쳐 국내 누구나 무료 다운로드 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
독자 AI 파운데이션 모델 5개 정예팀, AI 학습 데이터 29종 전격 개방
- 1.과기정통부·NIA, '독자 AI 파운데이션 모델' 5개 정예팀 학습데이터 29종(약 3544만건, 1.56조 토큰) AI허브에 공개
- 2.700억~800억 파라미터급 모델 학습이 가능한 규모로, 네이버클라우드·업스테이지·SKT·NC AI·LG AI연구원이 각자 전략으로 구축
- 3.업스테이지는 1조 토큰 사전학습 데이터, SKT는 수학·과학·법률 고난도 추론 데이터와 한국형 레드팀밍 데이터 1만건 포함
- 4.품질·개인정보·유해성 검증 거쳐 무료 개방, 네이버클라우드·업스테이지·SKT·NC AI는 데이터 전량 개방
왜 중요한가?
정부 예산으로 구축된 대규모 학습 데이터가 국내 AI 기업·연구자에게 무료 개방됨으로써, 데이터 확보 장벽이 높은 중소 스타트업·연구기관도 대형 모델 개발 인프라에 접근할 수 있는 기반이 마련됐다.
본문 미리보기
과학기술정보통신부(부총리 겸 과학기술정보통신부 장관 배경훈, 이하 과기정통부)와 한국지능정보사회진흥원(원장 김형철, 이하 NIA)은 '독자 AI 파운데이션 모델' 프로젝트 5개 정예팀이 1차 단계평가 과정에서 확보한 총 29종(약 3,544만건, 약 1.56조 토큰 규모)의 데이터를 AI허브 누리집(보기)에 공개한다고 27일 밝혔다.이번에 공개되는 데이터는 약 1.56조 토큰(추정) 규모로, 이론적으로 약 700억~800억(70~80B) 파라미터 수준의 대형 AI 모델 학습에 활용할 수 있는 규모다.이번 데이터 개방은 ‘AI 3대
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안
