View a markdown version of this page

在 Amazon EKS 上管理 NVIDIA GPUs - Amazon EKS

協助改進此頁面

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

若要為本使用者指南貢獻內容,請點選每個頁面右側面板中的在 GitHub 上編輯此頁面連結。

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

在 Amazon EKS 上管理 NVIDIA GPUs

NVIDIA GPUs 廣泛用於機器學習訓練、推論和高效能運算工作負載。Amazon EKS 支援兩種在 EKS 叢集中管理 NVIDIA GPU 裝置的機制:GPUs 的 NVIDIA DRA 驅動程式NVIDIA Kubernetes 裝置外掛程式

在 Karpenter、EKS 受管節點群組或自我管理節點中使用靜態容量佈建時,我們建議將 DRA 驅動程式用於 Kubernetes 1.34 版及更新版本的新部署。EKS Auto 模式目前不支援 DRA。NVIDIA DRA 驅動程式可在容器之間啟用靈活的 GPU 配置和 GPU 共用。

如需 EKS 中 DRA 功能的可用性,請參閱 Kubernetes 版本的 EKS 版本備註。如需搭配 EKS 使用 NVIDIA DRA 驅動程式和裝置外掛程式的詳細資訊,請參閱 在 Amazon EKS 上使用 NVIDIA DRA 驅動程式或裝置外掛程式

GPU 共用 (MIG 和時間分割)

多執行個體 GPU (MIG)

多執行個體 GPU (MIG) 是 NVIDIA GPUs 上的硬體功能,可將單一實體 GPU 分割成多個隔離的執行個體。執行個體數量上限取決於 GPU。A100、H100、H200 和 B200 等資料中心 GPUs 最多支援七個執行個體,而以 Blackwell 為基礎的 GPU g7g7e GPUs 支援較少。每個執行個體都有專用記憶體、運算單位和記憶體頻寬,因此在一個執行個體上執行的工作負載不會影響另一個執行個體上的工作負載。與不隔離的情況下透過軟體時間多工共用 GPU 的時間分割不同,MIG 可在 Pod 之間提供硬體層級記憶體和故障隔離。

MIG 最適合多租戶推論、需要可預測服務品質的工作負載,以及具有硬體隔離租用合規要求的環境。可在 NVIDIA Ampere (A100)、Hopper (H100 和 H200) 和 Blackwell GPUs 上使用。在 上 AWS,這些是 P 系列執行個體類型,以及 Blackwell 型g7g7e執行個體類型。

如需搭配 NVIDIA GPUs 和 EKS 使用 MIG 的詳細資訊和步驟,請參閱 在 Amazon EKS 上使用多執行個體 GPUs (MIG) 搭配 NVIDIA GPUs

時間分割

時間分割可讓多個 Pod 透過設定 NVIDIA 裝置外掛程式或 DRA 驅動程式,為每個 GPU 公告多個可排程的插槽,來共用單一實體 NVIDIA GPU。Kubernetes 排程器會將多個 Pod 放置在同一個 GPU 上,GPU 的 CUDA 排程器時間乘以工作負載。

時間分割是最簡單的 GPU 共用策略。它只使用軟體,不需要特殊硬體,並且適用於每個 NVIDIA GPU 執行個體類型 AWS。時間分割不提供共用 GPU 的 Pod 之間的記憶體或運算隔離。它最適合 GPU 使用率低的工作負載,例如在多個使用者共用 GPU 的請求或開發環境之間閒置的推論服務。對於需要硬體層級記憶體和運算隔離的工作負載,請改用 MIG。

如需搭配 NVIDIA GPUs 和 EKS 使用時間分割的詳細資訊和步驟,請參閱 在 Amazon EKS 上使用時間分割搭配 NVIDIA GPUs

主題