REDI는 대규모 과학 데이터셋을 AI 학습용으로 변환하는 오픈소스 데이터 준비(data readiness) 프레임워크다. 수집·전처리·변환·구조화·출력의 5단계 파이프라인에 단계별 계측을 붙여 재현성을 확보하고, 에이전트가 호출 가능한 스킬 형태로 배포하며, 동반 도구 SetGo가 FAIR 준수와 카탈로그 게시를 자동화한다. 기후, 프로테오믹스, 재료과학, 핵융합 4개 분야에서 원시 데이터를 AI-ready 상태로 변환해 도메인 전문가 기준으로 검증했고, 기후 데이터의 경우 Frontier 슈퍼컴퓨터 100노드까지 거의 이상적인 병렬 확장을 보였다. 프로파일링 결과 파일 I/O가 파이프라인 비용의 지배 요인이며 포맷 선택이 1차 최적화 수단임을 밝혔다. 과학 AI의 병목인 데이터 준비를 재사용 가능한 커뮤니티 자산으로 바꾸려는 시도다.
- •수집→전처리→변환→구조화→출력의 5단계 통합 파이프라인 + 단계별 계측으로 재현성 확보
- •동반 도구 SetGo가 FAIR 준수와 카탈로그 게시를 자동화, 에이전트 호출 가능 스킬로 배포
- •기후·프로테오믹스·재료과학·핵융합 4개 도메인에서 검증, 기후 데이터는 Frontier 100노드 근사 이상적 병렬 확장
- •파일 I/O가 지배적 비용 요인, 포맷 선택이 1차 최적화 레버임을 프로파일링으로 규명
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Automated Data Readiness for Scientific AI
- 1.REDI 공개: 과학 데이터를 AI 훈련용으로 변환하는 5단계 파이프라인 오픈소스 프레임워크
- 2.기후·단백질체·재료과학·핵융합 데이터를 모두 AI-ready로 변환, 전문가 기준 대비 검증 완료
- 3.Frontier 슘퍼컴퓨터에서 100노드까지 준이상적 병렬 확장성 확인(기후 데이터 사례)
- 4.프로파일링 결과 파일 I/O가 최대 병목, 포맷 선택이 1순위 최적화 레버로 확인
왜 중요한가?
과학 AI의 실질 병목인 데이터 준비 단계를 자동 변환·준비도 평가·출처 추적·에이전트 호출형 배포까지 통합한 첫 프레임워크라는 점이 핵심이다. 데이터 준비를 일회성 수작업에서 재현 가능한 커뮤니티 자산으로 바꿔 과학 AI 개발 속도를 높일 수 있다.
본문 미리보기
arXiv:2607.02771v1 Announce Type: new Abstract: Leadership computing facilities steward large-scale scientific datasets that routinely require substantial transformation before serving as AI training data. However, no existing framework fully unifies automated transformation, readiness assessment, provenance tracking, and agent-native deployment. We present REDI, an open-source framework that addresses this gap through a unified five-stage pipeline (ingest, preprocess, transform, structure, and
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

