아마존 세이지메이커 파이썬 SDK v3가 생성형 AI 추론 배포 권장사항 기능을 노트북에서 직접 호출할 수 있도록 지원한다. mb.generate_deployment_recommendations()로 여러 인스턴스·프레임워크 조합에 실제 트래픽 패턴의 부하 테스트를 돌려 비용 대비 성능 기준으로 순위를 매긴 배포안을 받고, mb.deploy()로 최상위 권장안을 바로 실시간 엔드포인트에 배포할 수 있다. 예시에서는 동일 인스턴스(ml.g6.2xlarge)의 서로 다른 LMI 버전 두 구성을 비교해 처리량 16% 높고 지연시간 10% 낮은 구성이 1위로 선정됐으며, start_benchmark()로 처리량·TTFT·토큰 간 지연 등을 세밀하게 검증할 수 있다. LMI와 vLLM 두 프레임워크를 병렬로 비교해 승자를 자동 배포하는 것도 가능해, 콘솔 UI나 개별 API 호출 없이 노트북 하나로 전체 최적화 워크플로를 완결할 수 있게 됐다.
- •generate_deployment_recommendations()가 인스턴스·프레임워크 조합을 벤치마크해 비용 대비 성능 순위를 매긴다.
- •예시에서 동일 인스턴스의 두 LMI 버전 비교 결과 처리량 16% 높고 지연 10% 낮은 구성이 선정됐다.
- •start_benchmark()로 처리량, TTFT, 토큰 간 지연 등 세부 지표를 실측 검증할 수 있다.
- •LMI와 vLLM 두 프레임워크를 병렬 실행해 처리량이 높은 쪽을 자동으로 배포할 수 있다.
- •이 워크플로가 콘솔 UI나 개별 API 호출 없이 단일 노트북에서 수행 가능하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LLM optimization integration for Amazon SageMaker Python SDK
본문 미리보기
The Amazon SageMaker Python SDK v3 now exposes generative AI inference recommendations in Amazon SageMaker AI directly in your notebook. Benchmark an endpoint, generate data-driven deployment recommendations, and deploy the recommended configuration without leaving your notebook workflow.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:52AI 초안

