View a markdown version of this page

Amazon EKS에서 NVIDIA GPU 관리 - Amazon EKS

이 페이지 개선에 도움 주기

이 사용자 가이드에 기여하려면 모든 페이지의 오른쪽 창에 있는 GitHub에서 이 페이지 편집 링크를 선택합니다.

Amazon EKS에서 NVIDIA GPU 관리

NVIDIA GPU는 기계 학습 훈련, 추론 및 고성능 컴퓨팅 워크로드에 널리 사용됩니다. Amazon EKS는 EKS 클러스터에서 NVIDIA GPU 디바이스를 관리하기 위한 두 가지 메커니즘(GPU용 NVIDIA DRA 드라이버NVIDIA Kubernetes 디바이스 플러그인)을 지원합니다.

Karpenter, EKS 관리형 노드 그룹 또는 자체 관리형 노드에서 정적 용량 프로비저닝을 사용할 때는 Kubernetes 버전 1.34 이상의 새 배포에 DRA 드라이버를 사용하는 것이 좋습니다. 현재 DRA는 EKS Auto Mode에서 지원되지 않습니다. NVIDIA DRA 드라이버를 사용하면 컨테이너 사이에서 유연한 GPU 할당 및 GPU 공유가 가능합니다.

EKS의 DRA 기능 가용성은 EKS용 Kubernetes 버전 릴리스 정보를 참조하세요. EKS에서 NVIDIA DRA 드라이버 및 디바이스 플러그인을 사용하는 방법에 대한 자세한 내용은 Amazon EKS에서 NVIDIA DRA 드라이버 또는 디바이스 플러그인 사용 섹션을 참조하세요.

GPU 공유(MIG 및 시간 분할)

다중 인스턴스 GPU(MIG)

다중 인스턴스 GPU(MIG)는 단일 물리적 GPU를 여러 격리된 인스턴스로 분할하는 NVIDIA GPU의 하드웨어 기능입니다. 최대 인스턴스 수는 GPU에 따라 다릅니다. A100, H100, H200, B200과 같은 데이터 센터 GPU는 최대 7개의 인스턴스를 지원하는 반면, Blackwell 기반 g7g7e GPU는 더 적은 수를 지원합니다. 각 인스턴스에는 전용 메모리, 컴퓨팅 유닛, 메모리 대역폭이 있으므로 한 인스턴스에서 실행되는 워크로드가 다른 인스턴스의 워크로드에 영향을 미칠 수 없습니다. 격리 없이 소프트웨어 시간 멀티플렉싱을 통해 GPU를 공유하는 시간 분할과 달리 MIG는 하드웨어 수준 메모리 및 포드 간 장애 격리를 제공합니다.

MIG는 다중 테넌트 추론, 예측 가능한 서비스 품질이 필요한 워크로드, 하드웨어 격리 테넌시 규정 준수 요구 사항이 있는 환경에 가장 적합합니다. NVIDIA Ampere(A100), Hopper(H100 및 H200) 및 Blackwell GPU에서 사용할 수 있습니다. AWS에서는 P 패밀리 인스턴스 유형과 Blackwell 기반 g7g7e 인스턴스 유형입니다.

NVIDIA GPU 및 EKS에서 MIG를 사용하는 방법에 대한 자세한 내용 및 단계는 Amazon EKS에서 NVIDIA GPU와 함께 다중 인스턴스 GPU(MIG) 사용 섹션을 참조하세요.

시간 분할

시간 분할을 사용하면 GPU당 예약 가능한 슬롯을 두 개 이상 광고하도록 NVIDIA 디바이스 플러그인 또는 DRA 드라이버를 구성하여 여러 포드가 단일 물리적 NVIDIA GPU를 공유할 수 있습니다. Kubernetes 스케줄러는 동일한 GPU에 여러 포드를 배치하고, GPU의 CUDA 스케줄러는 워크로드를 시간 멀티플렉싱합니다.

시간 분할은 가장 단순한 GPU 공유 전략입니다. 이 전략은 소프트웨어만 사용하고, 특별한 하드웨어가 필요하지 않으며, AWS의 모든 NVIDIA GPU 인스턴스 유형에서 작동합니다. 시간 분할은 GPU를 공유하는 포드 간에 메모리 또는 컴퓨팅 격리를 제공하지 않습니다. 요청 사이에 유휴 상태를 유지하는 추론 서비스나 여러 사용자가 GPU를 공유하는 개발 환경과 같이 GPU 사용률이 낮은 워크로드에 가장 적합합니다. 하드웨어 수준 메모리 및 컴퓨팅 격리가 필요한 워크로드의 경우 대신 MIG를 사용하세요.

NVIDIA GPU 및 EKS에서 시간 분할을 사용하는 방법에 대한 자세한 내용 및 단계는 Amazon EKS에서 NVIDIA GPU와 함께 시간 분할 사용 섹션을 참조하세요.

주제