注目★★★★★AWS
SageMaker HyperPod、モデルキャッシュでスケールアウト60%高速化
30秒で把握
- 1AWSがSageMaker HyperPodにモデルキャッシュを追加し推論Podを秒単位で起動
- 257〜145GBのモデルでスケールアウト約60%高速化、画像取得時間97%削減
- 3NVMe保存と自動フォールバックを採用し全提供リージョンで一般提供
要約
AWS は Amazon SageMaker HyperPod にモデルキャッシュを追加し、推論Podの起動を分単位から秒単位に短縮した。モデルウェightsをローカルNVMeに保存する機能と、コンテナイメージを事前取得する機能を備える。57〜145GBのモデルでスケールアウトを約60%高速化し、イメージ取得時間を97%削減した。キャッシュ未配置のノードではS3・FSx・ECRなど元の取得元へ自動フォールバックする。HyperPod Inference OperatorのmodelCacheConfigで設定でき、SageMaker HyperPod提供全リージョンで一般提供する。
あなたへの影響
SageMaker HyperPodでLLM推論を運用するチームは、次のスプリントでmodelCacheConfigを使ったスケールアウト時間とNVMe使用量を検証する。
推奨:キャッシュ未配置時は元の取得経路へ自動フォールバックするため、既存構成との比較試験から始められる。