아마존이 세이지메이커 하이퍼팟(SageMaker HyperPod)에 레이(Ray)를 통합한 신규 기능을 발표해 Amazon EKS 기반 대규모 파운데이션 모델 학습·서빙 인프라에서 관리형 레이 클러스터를 지원한다. 기존에는 YAML 매니페스트 작성과 도커 이미지 재빌드, kubectl 포트포워딩, 프로메테우스·그라파나 수동 설정이 필요했지만 이제 세이지메이커 스튜디오에서 클러스터 생성부터 대시보드 열람, 주피터랩·코드에디터 연결, 원격 작업 제출까지 모두 처리할 수 있다. 노드 장애 시 자동 복구와 계층형 체크포인팅, 정체된 작업을 감지하는 '행 잡 디텍션' 등 3중 복원력 기능을 제공하며, 세이지메이커 점프스타트 모델을 레이 서브 엔드포인트에 직접 로드하고 장문 컨텍스트 요청을 위한 KV 캐시 오프로딩도 지원한다. 이 기능은 오픈소스 쿠버레이(KubeRay)와 표준 레이 API를 그대로 사용하므로 기존 스크립트를 수정 없이 실행할 수 있다.
- •세이지메이커 스튜디오에서 코드 작성 없이 레이 클러스터 생성·모니터링·대시보드 접근 가능
- •노드 자동 복구, 행 잡(정체 작업) 감지, 계층형 체크포인팅 등 3중 복원력 체계 제공
- •세이지메이커 점프스타트 모델을 레이 서브에 직접 배포, 계층형 KV 캐시로 장문 컨텍스트 지연시간 단축
- •오픈소스 쿠버레이·표준 레이 API와 완전 호환되어 기존 코드 수정 없이 사용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Introducing new Ray capabilities on SageMaker HyperPod

- 1.AWS가 SageMaker HyperPod에 관리형 Ray 클러스터 기능을 정식 출시, EKS 기반으로 완전 통합
- 2.YAML 작성·kubectl 포트포워딩 없이 Studio 콘솔에서 Ray 클러스터 생성·대시보드 접근 가능
- 3.노드 자동 복구, 행업(hung job) 감지 에이전트, 계층형 체크포인팅으로 3중 장애 복원력 제공
- 4.SageMaker JumpStart 모델을 Ray Serve에 바로 배포, 계층형 KV 캐시로 장문맥 추론 지연 단축
왜 중요한가?
쿠버네티스에서 Ray를 직접 운영할 때 필요했던 수동 YAML·Prometheus/Grafana 설정 작업을 관리형으로 대체해, 분산 학습·서빙 인프라 구축 비용과 운영 부담을 크게 낮춘다.
본문 미리보기
Amazon SageMaker HyperPod now offers managed Ray support on Amazon EKS. Create and monitor Ray clusters, connect JupyterLab and Code Editor notebooks to live clusters, get out-of-the-box observability, and run resilient distributed training and accelerated inference from SageMaker Studio, all with open-source KubeRay and standard Ray APIs.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
