注目★★★★★AWS
AWS、G7e GPU インスタンスをアジア・ヨーロッパ地域に拡大、推論性能 2.3 倍向上
30秒で把握
- 1AWS が G7e インスタンスをソウル・ロンドン・東京で提供、G6e 比推論性能 2.3 倍向上
- 2単一インスタンムで 70B パラメータモデルを FP8 実行可能、768GB GPU メモリ搭載
- 3アジア太平洋・欧州でのエンドポイント配置で生成 AI ワークロードの遅延削減が可能
要約
AWS は SageMaker AI 推論において、NVIDIA RTX PRO 6000 Blackwell GPU 最大 8 基搭載の EC2 G7e インスタンスをソウル・ロンドン・東京地域で提供開始した。G6e 比で推論性能が最大 2.3 倍向上し、単一インスタンスで 768GB の GPU メモリにより 70B パラメータの大規模言語モデルを FP8 精度で実行可能になった。これにより生成 AI ワークロード利用者は東アジアと欧州でのエンドポイント配置による遅延削減と、マルチノード構成を避けた運用が実現できる。
あなたへの影響
SageMaker で生成 AI サービスを運用するチームは、東京リージョン対応によりエンドユーザーへの応答時間短縮と単一インスタンスでの 70B モデル実行が同時に実現でき、マルチノード運用の複雑性と関連コストを削減できる。
推奨:既存 G6e 運用中のチームは推論ワークロード特性 (モデルサイズ・QPS・SLA) に応じて G7e への移行を検討する価値がある。