View a markdown version of this page

Utilisation de partitions GPU dans Amazon SageMaker HyperPod - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Utilisation de partitions GPU dans Amazon SageMaker HyperPod

Les administrateurs de clusters peuvent choisir comment optimiser l'utilisation du GPU au sein de leur organisation. Vous pouvez activer le partitionnement des GPU à l'aide de la technologie NVIDIA Multi-Instance GPU (MIG) pour partitionner les ressources GPU en instances isolées plus petites pour une meilleure utilisation des ressources. Cette fonctionnalité permet d'exécuter simultanément plusieurs tâches de plus petite taille sur un seul GPU au lieu de consacrer l'ensemble du matériel à une seule tâche souvent sous-utilisée. Cela permet d'éliminer le gaspillage de puissance de calcul et de mémoire.

Le partitionnement GPU avec la technologie MIG prend en charge les GPU et vous permet de partitionner un seul GPU pris en charge en sept partitions GPU distinctes au maximum. Chaque partition GPU possède une mémoire, un cache et des ressources de calcul dédiés, ce qui permet une isolation prévisible.

Avantages

  • Utilisation améliorée du GPU  : optimisez l'efficacité de calcul en partitionnant les GPU en fonction des besoins en matière de calcul et de mémoire

  • Isolation des tâches  : chaque partition GPU fonctionne indépendamment avec une mémoire, un cache et des ressources de calcul dédiés

  • Flexibilité des tâches  : prenez en charge une combinaison de tâches sur un seul GPU physique, toutes exécutées en parallèle

  • Gestion flexible des configurations - Supportez à la fois les configurations Kubernetes Do-it-yourself (DIY) à l'aide du client kubectl de ligne de commande Kubernetes et une solution gérée avec des étiquettes personnalisées pour configurer et appliquer facilement vos étiquettes associées aux partitions GPU

Important

Le partitionnement GPU avec MIG n'est pas pris en charge avec les groupes d'instances flexibles (groupes d'instances qui utilisentInstanceRequirements). Pour utiliser MIG, créez un groupe d'instances avec un seulInstanceType.

Types d’instance pris en charge

Le partitionnement du GPU avec la technologie MIG est pris en charge sur les types d' HyperPod instances suivants :

Instances GPU A100 - https://aws.amazon.com/ec2/instance-types/p4/

  • ml.p4d.24xlarge - 8 GPU NVIDIA A100 (80 Go HBM2e par GPU)

  • ml.p4de.24xlarge - 8 GPU NVIDIA A100 (80 Go HBM2e par GPU)

Instances GPU H100 - https://aws.amazon.com/ec2/instance-types/p5/

  • ml.p5.48xlarge - 8 GPU NVIDIA H100 (80 Go HBM3 par GPU)

Instances GPU H200 - https://aws.amazon.com/ec2/instance-types/p5/

  • ml.p5e.48xlarge - 8 GPU NVIDIA H200 (141 Go HBM3e par GPU)

  • ml.p5en.48xlarge - 8 GPU NVIDIA H200 (141 Go HBM3e par GPU)

Instances GPU B200 - https://aws.amazon.com/ec2/instance-types/p6/

  • ml.p6b.48xlarge - 8 GPU NVIDIA B200

Partitions pour GPU

Les profils NVIDIA MIG définissent la façon dont les GPU sont partitionnés. Chaque profil spécifie l'allocation de calcul et de mémoire par instance MIG. Les profils MIG associés à chaque type de GPU sont les suivants :

Processeur graphique A100 (ml.p4d.24xlarge)

Profil Mémoire (Go) Instances par GPU Total par ml.p4d.24xlarge

1g.5gb

5

7

56

2g.10gb

10

3

24

3g.20gb

20

2

16

4g.20gb

20

1

8

7g.40gb

40

1

8

Processeur graphique H100 (ml.p5,48 x large)

Profil Mémoire (Go) Instances par GPU Total par ml.p5,48 x large

1g.10gb

10

7

56

1g.20gb

20

4

32

2g.20gb

20

3

24

3g.40gb

40

2

16

4g.40gb

40

1

8

7g.80gb

80

1

8

GPU H200 (ml.p5e.48xlarge et ml.p5en.48xlarge)

Profil Mémoire (Go) Instances par GPU Total par ml.p5en.48xlarge

1g.18gb

18

7

56

1g.35gb

35

4

32

2g.35gb

35

3

24

3g.71gb

71

2

16

4g.71gb

71

1

8

7g.141gb

141

1

8