AI2(Allen Institute for AI)가 자사 GPU 클러스터의 연구 영향력을 높이기 위해 우선순위 기반 스케줄러를 GPU 시간 예산제와 계층적 공정 분배(fair-share), 시간 분할 계약으로 교체했다고 소개했다. 기존 방식은 '좀비 작업 선점'과 우선순위 인플레이션 같은 공유자원의 비극을 낳았으나, 관리자가 사전에 GPU 시간을 프로젝트별로 배분하는 예산 기반 소유권 모델로 전환해 이를 해결했다. 30일 테스트 기간 동안 팀들은 배정된 GPU 시간의 98%를 전달받았고, 점유율은 변경 전후 모두 98%를 유지했으며, 디버그 작업의 대기시간은 2시간에서 30초로 크게 줄었다. 유지보수가 필요한 수동 개입은 74% 감소했지만, 장시간 세션을 사용하는 대화형 작업 흐름에는 여전히 과제가 남아 있다고 밝혔다.
- •기 우순위 스쿨똄똄똄 'GPU 좀미 '과 우순위 인혔똄이 똄 둸
- •똄자거 에 GPU 시걸똄 뻏c뻏c현똄 모뤸똄 쿨, 똄저걸 똄 현
- •30일 테스트에서 팀똄이 뻏c GPU 시걸의 98% 수, 98%
- •똄뻏c깅 p90 똄시걸 2시걸→3, 최똄 H100 클똄터 현 똄시걸 5뵀→24똄 똄축
- •지분 똄 입 74% 감, 똄신 시걸 똄화 션 작업 호에똄 뙸았
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Impactful scheduling for GPU clusters
- 1.Ai2가 우선순위 기반 GPU 스케줄러를 버리고 GPU 시간 예산·계층적 페어셰어·시간분할 계약으로 전환
- 2.H100·B200·B300 수천개, 88~1024 GPU 클러스터 환경서 디버그 작업 p90 대기시간이 2시간→30초로 단축
- 3.30일 테스트서 팀들이 받아야 할 GPU 시간의 98%를 실제로 수령, 15팀 중 13팀이 95% 이상, 가동률 98% 유지
- 4.최소 실행시간 계약으로 비정상 호스트 자동 드레인이 가능해져 사람 개입 유지보수가 74% 감소
왜 중요한가?
GPU 수요가 공급의 2~3배인 상황에서 스쿼팅과 우선순위 인플레이션 문제를 예산제·페어셰어로 해결한 실제 운영 사례로, 대규모 AI 학습 인프라 운영에 바로 참고할 설계와 수치를 제공한다.
언급 프로젝트
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)