Amazon SageMaker HyperPod, Ray 지원 강화

게시된 날짜: 2026년 8월 24일

Amazon SageMaker HyperPod가 이제 내장된 관찰성, 복원력 있는 훈련, 가속 추론, 관리형 개발 환경을 통해 Ray에 대한 지원을 강화합니다. Ray는 데이터 처리와 분산 훈련부터 강화 학습, 모델 제공에 이르기까지 통합 컴퓨팅 계층에서 AI 워크로드 규모를 조정하는 데 널리 사용되는 오픈 소스 프레임워크입니다. 프로덕션 규모로 Kubernetes에서 Ray를 실행하면 작업 지연, 고정 팀 할당으로 인한 낮은 GPU 사용률, 여러 단계에 걸친 관찰성 설정 등 운영상 부담이 발생할 수 있습니다. 또한 대화형 개발 환경이 부족하므로 모든 코드 변경 시 추가 작업 제출, kubectl 숙련도가 요구됩니다.

HyperPod는 이제 Ray에 더 쉬운 개발 환경, 복원력 있는 훈련, 가속화된 추론을 제공합니다. 데이터 과학자는 Amazon SageMaker Studio의 웹 기반 인터페이스를 통해 Ray 클러스터를 생성, 편집, 모니터링, 삭제한 다음, 실행 중인 Ray 클러스터에 JupyterLab, Code Editor 또는 로컬 IDE를 연결하고 클러스터 규모의 컴퓨팅 환경에서 대화식으로 반복할 수 있습니다. 다중 노드 Ray 클러스터는 로컬 개발 환경처럼 작동하므로 새 작업이 대기열에 추가되고 시작될 때까지 기다릴 필요 없이 각 변경 사항을 즉시 테스트할 수 있습니다. HyperPod는 관찰성을 위해 Amazon Managed Service for Prometheus의 지표를 사용하여 Grafana 대시보드를 프로비저닝하고, 안전한 브라우저 링크를 통해 원클릭으로 Ray 대시보드에 액세스가 가능하므로 최초 실행부터 워크로드에 대한 가시성이 보장됩니다. 대규모 훈련인 경우, HyperPod 노드의 자동 복구와 작업 중단 탐지 기능이 GPU 오류, 작업 중단, 손실 급증, 처리량 저하를 처리합니다. 계층별 체크포인팅이 클러스터 메모리에서 상태를 복원하여 처리량을 극대화하고, 태스크 거버넌스가 할당량, 우선순위, 선점을 통해 컴퓨팅 활용도를 개선합니다. 이 모든 기능 덕분에 장시간 훈련 실행 중 오류가 발생하더라도 계속 진행되며, GPU 시간당 유효한 작업량을 극대화할 수 있습니다. Ray Serve를 사용한 추론의 경우, 계층화된 KV 캐시가 캐시된 접두사를 재사용하여 첫 번째 토큰까지 시간을 단축하며, Amazon SageMaker JumpStart 모델을 직접 배포할 수 있습니다.

오픈 소스 Ray 코드는 변경 없이 실행되며, SageMaker Studio의 목적별 환경을 채택하거나 개별 기능을 활용하여 자체 ML 플랫폼에 통합할 수 있습니다.

SageMaker HyperPod가 지원되는 모든 AWS 리전에서, Amazon EKS가 오케스트레이션하는 HyperPod 클러스터에 대해 Ray 지원을 사용할 수 있습니다. 자세히 알아보려면 SageMaker HyperPod 설명서를 참조하고 대화형 데모를 살펴보세요.