View a markdown version of this page

Section de planification - AWS ParallelCluster

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Section de planification

(Obligatoire) Définit le planificateur de tâches utilisé dans le cluster et les instances de calcul qu'il gère. Vous pouvez utiliser le AWS Batch planificateur Slurm ou. Chacune prend en charge un ensemble différent de paramètres et de propriétés.

Scheduling: Scheduler: slurm ScalingStrategy: string SlurmSettings: MungeKeySecretArn: string ScaledownIdletime: integer QueueUpdateStrategy: string EnableMemoryBasedScheduling: boolean CustomSlurmSettings: [dict] CustomSlurmSettingsIncludeFile: string Database: Uri: string UserName: string PasswordSecretArn: string DatabaseName: string ExternalSlurmdbd: boolean Host: string Port: integer Dns: DisableManagedDns: boolean HostedZoneId: string UseEc2Hostnames: boolean SlurmQueues: - Name: string ComputeSettings: LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string CapacityType: string AllocationStrategy: string JobExclusiveAllocation: boolean CustomSlurmSettings: dict Tags: - Key: string Value: string HealthChecks: Gpu: Enabled: boolean Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string PlacementGroup: Enabled: boolean Id: string Name: string Proxy: HttpProxyAddress: string ComputeResources: - Name: string InstanceType: string Instances: - InstanceType: string MinCount: integer MaxCount: integer DynamicNodePriority: integer StaticNodePriority: integer SpotPrice: float DisableSimultaneousMultithreading: boolean SchedulableMemory: integer HealthChecks: Gpu: Enabled: boolean Efa: Enabled: boolean GdrSupport: boolean CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string Networking: PlacementGroup: Enabled: boolean Name: string CustomSlurmSettings: dict Tags: - Key: string Value: string LaunchTemplateOverrides: LaunchTemplateId: string Version: string CustomActions: OnNodeStart: Sequence: - Script: string Args: - string Script: string Args: - string OnNodeConfigured: Sequence: - Script: string Args: - string Script: string Args: - string Iam: InstanceProfile: string InstanceRole: string S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string AdditionalIamPolicies: - Policy: string Image: CustomAmi: string
Scheduling: Scheduler: awsbatch AwsBatchQueues: - Name: string CapacityType: string Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name: string InstanceTypes: - string MinvCpus: integer DesiredvCpus: integer MaxvCpus: integer SpotBidPercentage: float

Propriétés de planification

Scheduler(Obligatoire,String)

Spécifie le type de planificateur utilisé. Les valeurs prises en charge sont slurm et awsbatch.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

Note

awsbatchne prend en charge que le système alinux2 d'exploitation et x86_64 la plate-forme.

ScalingStrategy(Facultatif,String)

Vous permet de choisir le mode d'Slurmévolution des nœuds dynamiques. Les valeurs prises en charge sontall-or-nothing, greedy-all-or-nothing et best-effort la valeur par défaut estall-or-nothing.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

La stratégie de dimensionnement s'applique uniquement aux nœuds devant être repris par Slurm, et non aux nœuds qui sont déjà en cours d'exécution.

  • all-or-nothingCette stratégie suit strictement une approche du tout ou rien, visant à éviter les instances inactives à la fin du processus de mise à l'échelle. Il fonctionne sur la base du tout ou rien, ce qui signifie qu'il évolue complètement ou pas du tout. Sachez que le lancement temporaire d'instances peut entraîner des coûts supplémentaires, lorsque les tâches nécessitent plus de 500 nœuds ou couvrent plusieurs ressources de calcul. Cette stratégie présente le débit le plus faible parmi les trois stratégies de mise à l'échelle possibles. Le temps de mise à l'échelle dépend du nombre de tâches soumises pour chaque exécution du programme de Slurm reprise. De plus, vous ne pouvez pas étendre l'échelle au-delà de la limite de compte de RunInstances ressources par défaut par exécution, qui est de 1 000 instances par défaut. Vous trouverez plus de détails dans la documentation relative à la limitation de l'API Amazon EC2

  • greedy-all-or-nothing Semblable à la stratégie du tout ou rien, elle vise à éviter les instances inactives après la mise à l'échelle. Cette stratégie permet un surdimensionnement temporaire pendant le processus de dimensionnement afin d'atteindre un débit plus élevé que l'approche tout ou rien, mais elle est également assortie de la même limite de mise à l'échelle de 1 000 instances conformément à la limite du compte de RunInstances ressources.

  • best-effort Cette stratégie donne la priorité au haut débit, même si cela signifie que certaines instances peuvent être inactives à la fin du processus de dimensionnement. Il tente d'allouer autant de nœuds que le demandent les jobs, mais il est possible qu'il ne réponde pas à l'intégralité de la demande. Contrairement aux autres stratégies, l'approche du meilleur effort permet d'accumuler plus d'instances que la RunInstances limite standard, au prix de ressources inutilisées lors des multiples exécutions de processus de dimensionnement.

Chaque stratégie est conçue pour répondre à différents besoins de dimensionnement, ce qui vous permet de sélectionner celle qui répond à vos exigences et contraintes spécifiques.

AwsBatchQueues

(Facultatif) Les paramètres de AWS Batch file d'attente. Une seule file d'attente est prise en charge. Si elle Scheduler est définie surawsbatch, cette section est obligatoire. Pour plus d'informations sur le awsbatch planificateur, consultez les sections Configuration réseau etUtilisation du AWS Batch awsbatch planificateur () avec AWS ParallelCluster.

AwsBatchQueues: - Name: string CapacityType: string Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name: string InstanceTypes: - string MinvCpus: integer DesiredvCpus: integer MaxvCpus: integer SpotBidPercentage: float

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Propriétés de AwsBatchQueues

Name(Obligatoire,String)

Le nom de la AWS Batch file d'attente.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

CapacityType(Facultatif,String)

Type de ressources de calcul utilisées par la AWS Batch file d'attente. Les valeurs prises en charge sontONDEMAND, SPOT ouCAPACITY_BLOCK. La valeur par défaut est ONDEMAND.

Note

Si vous le définissez CapacityType surSPOT, votre compte doit contenir un rôle AWSServiceRoleForEC2Spot lié à un service. Vous pouvez créer ce rôle à l'aide de la AWS CLI commande suivante.

$ aws iam create-service-linked-role --aws-service-name spot.amazonaws.com

Pour plus d'informations, consultez Service-linked le rôle des demandes d'instance Spot dans le Guide de l'utilisateur Amazon Amazon EC2 pour les instances Linux.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

Mise en réseau

(Obligatoire) Définit la configuration réseau de la AWS Batch file d'attente.

Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string
Propriétés de mise en réseau
SubnetIds(Obligatoire,[String])

Spécifie l'ID d'un sous-réseau existant dans lequel approvisionner la AWS Batch file d'attente. Actuellement, un seul sous-réseau est pris en charge.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

AssignPublicIp(Facultatif,String)

Crée ou attribue une adresse IP publique aux nœuds de la AWS Batch file d'attente. Les valeurs prises en charge sont true et false. La valeur par défaut dépend du sous-réseau que vous avez spécifié.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

SecurityGroups(Facultatif,[String])

Liste des groupes de sécurité utilisés par la AWS Batch file d'attente. Si vous ne spécifiez aucun groupe de sécurité, AWS ParallelCluster créez de nouveaux groupes de sécurité.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

AdditionalSecurityGroups(Facultatif,[String])

Liste des groupes de sécurité utilisés par la AWS Batch file d'attente.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

ComputeResources

(Obligatoire) Définit la ComputeResources configuration de la AWS Batch file d'attente.

ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name: string InstanceTypes: - string MinvCpus: integer DesiredvCpus: integer MaxvCpus: integer SpotBidPercentage: float
Propriétés de ComputeResources
Name(Obligatoire,String)

Nom de l'environnement de calcul de la AWS Batch file d'attente.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

InstanceTypes(Obligatoire,[String])

Tableau des types d'instances de l'environnement de AWS Batch calcul. Tous les types d'instances doivent utiliser cette x86_64 architecture.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

MinvCpus(Facultatif,Integer)

Nombre minimal de vCPU qu'un environnement AWS Batch informatique peut utiliser.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

DesiredVcpus(Facultatif,Integer)

Le nombre souhaité de processeurs virtuels dans l'environnement AWS Batch informatique. AWS Batch ajuste cette valeur entre MinvCpus et en MaxvCpus fonction de la demande dans la file d'attente des tâches.

Politique de mise à jour : ce paramètre n'est pas analysé lors d'une mise à jour.

MaxvCpus(Facultatif,Integer)

Le nombre maximum de vCPU pour l'environnement AWS Batch informatique. Vous ne pouvez pas définir cette valeur sur une valeur inférieure àDesiredVcpus.

Politique de mise à jour : ce paramètre ne peut pas être réduit lors d'une mise à jour.

SpotBidPercentage(Facultatif,Float)

Pourcentage maximum du On-Demand prix du type d'instance que le prix d'une instance spot Amazon EC2 peut atteindre avant le lancement des instances. La valeur par défaut est 100 (100 %). La plage prise en charge est 1 -100.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

SlurmQueues

(Facultatif) Paramètres de la Slurm file d'attente. Si elle Scheduler est définie surslurm, cette section est obligatoire.

SlurmQueues: - Name: string ComputeSettings: LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string CapacityType: string AllocationStrategy: string JobExclusiveAllocation: boolean CustomSlurmSettings: dict Tags: - Key: string Value: string HealthChecks: Gpu: Enabled: boolean Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string PlacementGroup: Enabled: boolean Id: string Name: string Proxy: HttpProxyAddress: string ComputeResources: - Name: string InstanceType: string Instances: - InstanceType: string MinCount: integer MaxCount: integer DynamicNodePriority: integer StaticNodePriority: integer SpotPrice: float DisableSimultaneousMultithreading: boolean SchedulableMemory: integer HealthChecks: Gpu: Enabled: boolean Efa: Enabled: boolean GdrSupport: boolean CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string Networking: PlacementGroup: Enabled: boolean Name: string CustomSlurmSettings: dict Tags: - Key: string Value: string LaunchTemplateOverrides: LaunchTemplateId: string Version: string CustomActions: OnNodeStart: Sequence: - Script: string Args: - string Script: string Args: - string OnNodeConfigured: Sequence: - Script: string Args: - string Script: string Args: - string Iam: InstanceProfile: string InstanceRole: string S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string AdditionalIamPolicies: - Policy: string Image: CustomAmi: string

Politique de mise à jour : pour ce paramètre de valeurs de liste, une nouvelle valeur peut être ajoutée lors d'une mise à jour ou le parc informatique doit être arrêté lors de la suppression d'une valeur existante.

Propriétés de SlurmQueues

Name(Obligatoire,String)

Le nom de la Slurm file d'attente.

Note

La taille du cluster peut changer lors d'une mise à jour. Pour plus d'informations, voir Taille et mise à jour de la capacité du cluster

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

CapacityReservationTarget
Note

CapacityReservationTargetest ajouté avec AWS ParallelCluster la version 3.3.0.

CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string

Spécifie la réservation On-Demand de capacité pour les ressources de calcul de la file d'attente.

CapacityReservationId(Facultatif,String)

L'ID de la réservation de capacité existante à cibler pour les ressources de calcul de la file d'attente. L'identifiant peut faire référence à un ODCR ou à un bloc de capacité pour le ML.

La réservation doit utiliser la même plateforme que celle utilisée par l'instance. Par exemple, si vos instances s'exécutent surrhel8, votre réservation de capacité doit s'exécuter sur la plateforme Red Hat Enterprise Linux. Pour de plus amples informations, veuillez consulter Plateformes prises en charge dans le Guide de l'utilisateur Amazon EC2 pour les instances Linux.

Note

Si vous incluez Instances dans la configuration du cluster, vous devez exclure ce CapacityReservationId paramètre de niveau de file d'attente de la configuration.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

CapacityReservationResourceGroupArn(Facultatif,String)

Le nom de ressource Amazon (ARN) du groupe de ressources qui sert de groupe de réservations de capacité lié à un service pour les ressources de calcul de la file d'attente. AWS ParallelCluster identifie et utilise la réservation de capacité la plus appropriée auprès du groupe de ressources en fonction des conditions suivantes :

Le groupe de ressources doit disposer d'au moins un ODCR pour chaque type d'instance réservé dans une zone de disponibilité sur l'ensemble des ressources de calcul et des zones de disponibilité de la file d'attente. Pour de plus amples informations, veuillez consulter Lancez des instances avec des réservations de capacité à la demande (ODCR).

Pour plus d'informations sur les exigences de configuration de plusieurs sous-réseaux, consultez Networking/SubnetIds.

Note

Plusieurs zones de disponibilité ont été ajoutées dans AWS ParallelCluster la version 3.4.0.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

CapacityType(Facultatif,String)

Type de ressources de calcul utilisées par la Slurm file d'attente. Les valeurs prises en charge sontONDEMAND, SPOT ouCAPACITY_BLOCK. La valeur par défaut est ONDEMAND.

Note

Si vous définissez ce paramètre sur CapacityTypeSPOT, votre compte doit avoir un rôle AWSServiceRoleForEC2Spot lié à un service. Vous pouvez utiliser la AWS CLI commande suivante pour créer ce rôle.

$ aws iam create-service-linked-role --aws-service-name spot.amazonaws.com

Pour plus d'informations, consultez Service-linked le rôle des demandes d'instance Spot dans le Guide de l'utilisateur Amazon Amazon EC2 pour les instances Linux.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

AllocationStrategy(Facultatif,String)

Spécifiez la stratégie d'allocation pour toutes les ressources de calcul définies dans Instances.

Valeurs valides : lowest-price | capacity-optimized | price-capacity-optimized | prioritized | capacity-optimized-prioritized

CapacityType Stratégies autorisées
À LA DEMANDE prix le plus bas, priorisé
SPOT prix le plus bas, optimisé en termes de capacité, optimisé en termes de capacité, optimisé en termes de capacité et priorisé
BLOC_CAPACITÉ Non pris en charge — AllocationStrategy ne peut pas être configuré

Valeur par défaut : lowest-price

lowest-price
  • Si vous l'utilisezCapacityType = ONDEMAND, Amazon EC2 Fleet utilise le prix pour déterminer la commande et lance d'abord les instances au prix le plus bas.

  • Si vous l'utilisezCapacityType = SPOT, Amazon EC2 Fleet lance des instances à partir du pool d'instances ponctuelles le moins cher disposant de la capacité disponible. Si un pool est à court de capacité avant d'atteindre la capacité requise, Amazon EC2 Fleet répond à votre demande en lançant des instances pour vous. Amazon EC2 Fleet lance notamment des instances à partir du pool d'instances ponctuelles le plus économique disposant de la capacité disponible. Amazon EC2 Fleet peut lancer des instances Spot à partir de plusieurs pools différents.

  • Si vous définissezCapacityType = CAPACITY_BLOCK, il n'existe aucune stratégie d'allocation, le AllocationStrategy paramètre ne peut donc pas être configuré.

capacity-optimized
  • Si vous le définissezCapacityType = ONDEMAND, capacity-optimized n'est pas disponible.

  • Si vous le définissezCapacityType = SPOT, Amazon EC2 Fleet lance des instances à partir de pools d'instances Spot avec une capacité optimale pour le nombre d'instances à lancer.

price-capacity-optimized
  • Si vous le définissezCapacityType = ONDEMAND, capacity-optimized n'est pas disponible.

  • Si vous le définissezCapacityType = SPOT, Amazon EC2 Fleet identifie les pools dont la capacité de disponibilité est la plus élevée pour le nombre d'instances en cours de lancement. Cela signifie que nous demanderons des instances Spot auprès des groupes qui, selon nous, présentent le moins de risques d’interruption à court terme. Amazon EC2 Fleet demande ensuite des instances Spot auprès des pools les moins chers.

prioritized
  • Si vous le définissezCapacityType = ONDEMAND, Amazon EC2 Fleet respecte l'ordre de priorité qui AWS ParallelCluster s'applique aux LaunchTemplate remplacements lorsque plusieurs sous-réseaux sont spécifiés. AWS ParallelCluster dérive le remplacement priority à partir de la position du sous-réseau cible, le premier sous-réseau SlurmQueues/Networking/SubnetIds ayant la priorité la plus élevée. Les priorités sont déterminées par ordre décroissant AWS ParallelCluster à partir deSlurmQueues/Networking/SubnetIds, la première SubnetId ayant la priorité la plus élevée et le dernier SubnetID ayant la priorité la plus faible.

  • Si vous le définissezCapacityType = SPOT, prioritized n'est pas disponible.

capacity-optimized-prioritized
  • Si vous le définissezCapacityType = ONDEMAND, capacity-optimized-prioritized n'est pas disponible.

  • Si vous le définissezCapacityType = SPOT, Amazon EC2 Fleet optimise d'abord la capacité, puis applique, dans la mesure du possible, l'ordre de priorité attribué aux remplacements AWS ParallelCluster . LaunchTemplate Les priorités sont déterminées par ordre décroissant AWS ParallelCluster à partir deSlurmQueues/Networking/SubnetIds, la première SubnetId ayant la priorité la plus élevée et le dernier SubnetID ayant la priorité la plus faible. Tous les remplacements qui ciblent le même sous-réseau reçoivent la même valeur de priorité.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Note

AllocationStrategyest pris en charge à partir de AWS ParallelCluster la version 3.3.0.

Nouveau dans la version 3.14.0  : prioritized (pour On-Demand) et capacity-optimized-prioritized (pour Spot).

JobExclusiveAllocation(Facultatif,String)

S'il est défini surtrue, l'OverSubscribeindicateur de Slurm partition est défini surEXCLUSIVE. Lorsque OverSubscribe =EXCLUSIVE, les tâches de la partition ont un accès exclusif à tous les nœuds alloués. Pour plus d'informations, consultez EXCLUSIVE dans la Slurm documentation.

Valeurs valides : true | false

Par défaut: false

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

JobExclusiveAllocationest pris en charge à partir de AWS ParallelCluster la version 3.7.0.

CustomSlurmSettings(Facultatif,Dict)

Définit les paramètres de configuration personnalisés des Slurm partitions (files d'attente).

Spécifie un dictionnaire de paires clé-valeur de paramètres de Slurm configuration personnalisés qui s'appliquent aux files d'attente (partitions).

Chaque paire clé-valeur distincte, telle queParam1: Value1, est ajoutée séparément à la fin de la ligne de configuration de Slurm partition dans le format. Param1=Value1

Vous ne pouvez spécifier que des paramètres Slurm de configuration qui ne sont pas refusés dans. CustomSlurmSettings Pour plus d'informations sur les paramètres de Slurm configuration refusés, consultez. Inscrit sur la liste Deny Slurm paramètres de configuration pour CustomSlurmSettings

AWS ParallelCluster vérifie uniquement si un paramètre se trouve dans une liste de refus. AWS ParallelCluster ne valide pas la syntaxe ou la sémantique de vos paramètres de Slurm configuration personnalisés. Il est de votre responsabilité de valider vos paramètres Slurm de configuration personnalisés. Les paramètres Slurm de configuration personnalisés non valides peuvent provoquer des défaillances du Slurm démon, ce qui peut entraîner des échecs de création et de mise à jour du cluster.

Pour plus d'informations sur la façon de spécifier des paramètres Slurm de configuration personnalisés avec AWS ParallelCluster, consultezSlurm personnalisation de la configuration.

Pour plus d'informations sur les paramètres Slurm de configuration, consultez slurm.conf dans la documentation. Slurm

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

CustomSlurmSettingsest pris en charge à partir de AWS ParallelCluster la version 3.6.0.

Tags(Facultatif, [Chaîne])

Liste de paires clé-valeur de balises. ComputeResourceles balises remplacent les balises dupliquées spécifiées dans le Section Balises ou dansSlurmQueues/Tags.

Key(Facultatif,String)

Identification de balise.

Value(Facultatif,String)

Valeur de balise.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

HealthChecks(Facultatif)

Spécifiez les contrôles de santé des nœuds de calcul pour toutes les ressources de calcul de la file d'attente.

Gpu(Facultatif)

Spécifiez les contrôles de santé du GPU pour toutes les ressources de calcul d'une file d'attente.

Note

AWS ParallelCluster ne prend pas en chargeHealthChecks/Gpudans les nœuds qui utilisent les systèmes d'exploitation alinux2 ARM. Ces plateformes ne prennent pas en charge le NVIDIA Data Center GPU Manager (DCGM).

Important

Le contrôle de santé du GPU intégré exécute un diagnostic NVIDIA DCGM de niveau 2 dans le Slurm prologue. Activez-le uniquement avec une allocation exclusive à la tâche (une tâche par nœud ; définieJobExclusiveAllocation: true). Ne l'activez pas sur les instances P-family GPU P6, P6e ou versions ultérieures. Pour en savoir plus, consultez Meilleures pratiques : bilans de santé du GPU.

Enabled(Facultatif,Boolean)

S'il AWS ParallelCluster effectue des contrôles de santé du GPU sur les nœuds de calcul. La valeur par défaut est false.

Comportement du test de santé du GPU
  • SiGpu/Enabledest défini surtrue, AWS ParallelCluster effectue des vérifications de l'état du GPU sur les ressources de calcul de la file d'attente.

  • Le contrôle Gpu de santé effectue des contrôles de l'état du GPU sur les ressources de calcul afin d'empêcher la soumission de tâches sur des nœuds dotés d'un GPU dégradé.

  • Si un nœud de calcul échoue à un contrôle de Gpu santé, l'état du nœud de calcul passe àDRAIN. Les nouvelles tâches ne démarrent pas sur ce nœud. Les tâches existantes sont exécutées jusqu'à leur terme. Une fois toutes les tâches en cours terminées, le nœud de calcul s'arrête s'il s'agit d'un nœud dynamique et il est remplacé s'il s'agit d'un nœud statique.

  • La durée du bilan de Gpu santé dépend du type d'instance sélectionné, du nombre de GPU dans l'instance, de la mémoire GPU totale et du nombre de cibles de contrôle de Gpu santé (équivalent au nombre de cibles GPU des tâches). Par exemple, sur un p4d.24xlarge, la durée typique est de 3 minutes.

  • Si le bilan Gpu de santé s'exécute sur une instance qui n'est pas prise en charge, il se ferme et la tâche s'exécute sur le nœud de calcul. Par exemple, si une instance ne possède pas de GPU, ou si une instance en possède un mais qu'il ne s'agit pas d'un GPU NVIDIA, le bilan de santé se termine et la tâche s'exécute sur le nœud de calcul. Seuls les GPU NVIDIA sont pris en charge.

  • Le Gpu bilan de santé utilise l'dcgmioutil pour effectuer des contrôles de santé sur un nœud et suit les étapes suivantes :

    Lorsque le Gpu bilan de santé commence dans un nœud :

    1. Il détecte si les nvidia-fabricmanager services nvidia-dcgm et sont en cours d'exécution.

    2. Si ces services ne fonctionnent pas, le bilan Gpu de santé les lance.

    3. Il détecte si le mode de persistance est activé.

    4. Si le mode de persistance n'est pas activé, le Gpu bilan de santé l'active.

    À la fin du bilan de santé, le bilan de Gpu santé rétablit ces services et ressources dans leur état initial.

  • Si la tâche est attribuée à un ensemble spécifique de GPU de nœuds, le contrôle de Gpu santé s'exécute uniquement sur cet ensemble spécifique. Dans le cas contraire, le bilan de Gpu santé s'exécute sur tous les GPU du nœud.

  • Si un nœud de calcul reçoit deux demandes de contrôle de Gpu santé ou plus en même temps, seul le premier contrôle de santé est exécuté et les autres sont ignorées. C'est également le cas pour les contrôles de santé qui ciblent les GPU des nœuds. Vous pouvez consulter les fichiers journaux pour obtenir des informations supplémentaires concernant cette situation.

  • Le journal de contrôle de santé d'un nœud de calcul spécifique est disponible dans le /var/log/parallelcluster/slurm_health_check.log fichier. Le fichier est disponible sur Amazon CloudWatch, dans le groupe de CloudWatch journaux du cluster, où vous pouvez trouver :

    • Informations détaillées sur l'action exécutée par le bilan de Gpu santé, notamment l'activation et la désactivation des services et le mode de persistance.

    • L'identifiant du GPU, l'ID de série et l'UUID.

    • La sortie du bilan de santé.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

HealthChecksest pris en charge à partir de AWS ParallelCluster la version 3.6.0.

Mise en réseau

(Obligatoire) Définit la configuration réseau de la Slurm file d'attente.

Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string PlacementGroup: Enabled: boolean Id: string Name: string Proxy: HttpProxyAddress: string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Propriétés de mise en réseau
SubnetIds(Obligatoire,[String])

Les ID des sous-réseaux existants dans lesquels vous approvisionnez la Slurm file d'attente.

Si vous configurez les types d'instance dans SlurmQueues/ComputeResources/InstanceType, vous ne pouvez définir qu'un seul sous-réseau.

Si vous configurez les types d'instance dans SlurmQueues ComputeResources//Instances, vous pouvez définir un ou plusieurs sous-réseaux.

Si vous utilisez plusieurs sous-réseaux, tous les sous-réseaux définis pour une file d'attente doivent se trouver dans le même VPC, chaque sous-réseau se trouvant dans une zone de disponibilité (AZ) distincte.

Supposons, par exemple, que vous définissiez le sous-réseau 1 et le sous-réseau 2 pour votre file d'attente.

subnet-1et ne subnet-2 peuvent pas entrer tous les deux AZ-1.

subnet-1peut être dedans AZ-1 et subnet-2 peut être dedans AZ-2.

Si vous ne configurez qu'un seul type d'instance et que vous souhaitez utiliser plusieurs sous-réseaux, définissez votre type d'instance dans Instances plutôt que InstanceType dans.

Par exemple, définissezComputeResources/Instances/InstanceType= instance.type au lieu deComputeResources/InstanceType=instance.type.

Note

L'adaptateur Elastic Fabric (EFA) n'est pas pris en charge dans les différentes zones de disponibilité.

L'utilisation de plusieurs zones de disponibilité peut entraîner une augmentation de la latence du réseau de stockage et des coûts de transfert de données inter-AZ supplémentaires. Par exemple, cela peut se produire lorsqu'une instance accède à un stockage de fichiers situé dans une autre zone de disponibilité. Pour plus d'informations, consultez la section Transfert de données au sein du même site Région AWS.

Mises à jour du cluster pour passer de l'utilisation d'un seul sous-réseau à l'utilisation de plusieurs sous-réseaux :
  • Supposons que la définition de sous-réseau d'un cluster soit définie avec un seul sous-réseau et un FSx AWS ParallelCluster géré pour le système de fichiers Lustre. Dans ce cas, vous ne pouvez pas mettre à jour ce cluster directement avec une définition d'ID de sous-réseau mise à jour. Pour effectuer la mise à jour du cluster, vous devez d'abord remplacer le système de fichiers géré par un système de fichiers externe. Pour de plus amples informations, veuillez consulter Convertir AWS ParallelCluster stockage géré vers un stockage externe.

  • Supposons que la définition de sous-réseau d'un cluster soit définie avec un seul sous-réseau et un système de fichiers Amazon EFS externe si les cibles de montage EFS n'existent pas pour tous les AZ des multiples sous-réseaux définis pour être ajoutés. Dans ce cas, vous ne pouvez pas mettre à jour ce cluster directement avec une définition d'ID de sous-réseau mise à jour. Pour mettre à jour le cluster ou créer un cluster, vous devez d'abord créer toutes les cibles de montage pour tous les AZ des multiples sous-réseaux définis.

Zones de disponibilité et réservations de capacité de cluster définies dans CapacityReservationResourceGroupArn:
  • Vous ne pouvez pas créer de cluster s'il n'y a pas de chevauchement entre l'ensemble de types d'instances et de zones de disponibilité couverts par le groupe de ressources de réservation de capacité défini et l'ensemble de types d'instances et de zones de disponibilité définis pour la file d'attente.

  • Vous pouvez créer un cluster s'il existe un chevauchement partiel entre l'ensemble de types d'instances et de zones de disponibilité couverts par le groupe de ressources de réservation de capacité défini et l'ensemble de types d'instances et de zones de disponibilité définis pour la file d'attente. AWS ParallelCluster envoie un message d'avertissement concernant le chevauchement partiel dans ce cas.

  • Pour de plus amples informations, veuillez consulter Lancez des instances avec des réservations de capacité à la demande (ODCR).

Note

Plusieurs zones de disponibilité ont été ajoutées dans AWS ParallelCluster la version 3.4.0.

Avertissement

Cet avertissement s'applique à toutes les AWS ParallelCluster versions 3.x.y antérieures à la version 3.3.1. AWS ParallelCluster la version 3.3.1 n'est pas affectée si ce paramètre est modifié.

Pour AWS ParallelCluster 3 versions antérieures à la version 3.3.1 :

Si vous modifiez ce paramètre et mettez à jour un cluster, cela crée un nouveau système de fichiers FSx pour Lustre géré et supprime le système de fichiers FSx pour Lustre géré existant sans préserver les données existantes. Cela entraîne une perte de données. Avant de continuer, assurez-vous de sauvegarder les données du système de fichiers FSx for Lustre existant si vous souhaitez conserver les données. Pour plus d'informations, consultez la section Utilisation des sauvegardes dans le guide de l'utilisateur de FSx for Lustre.

Si une nouvelle valeur de sous-réseau est ajoutée, Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Si une valeur de sous-réseau est supprimée, Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

AssignPublicIp(Facultatif,String)

Crée ou attribue une adresse IP publique aux nœuds de la Slurm file d'attente. Les valeurs prises en charge sont true et false. Le sous-réseau que vous spécifiez détermine la valeur par défaut. Un sous-réseau avec des adresses IP publiques attribue par défaut des adresses IP publiques.

Si vous définissez un type d'hpc6idinstance p4d ou, ou un autre type d'instance doté de plusieurs interfaces réseau ou d'une carte d'interface réseau, vous devez définir HeadNode Networking//ElasticIptruepour fournir un accès public. AWS Les adresses IP publiques ne peuvent être attribuées qu'aux instances lancées avec une seule interface réseau. Dans ce cas, nous vous recommandons d'utiliser une passerelle NAT pour fournir un accès public aux nœuds de calcul du cluster. Dans ce cas, réglez AssignPublicIp surfalse. Pour plus d'informations sur les adresses IP, consultez la section Attribuer une adresse IPv4 publique lors du lancement de l'instance dans le Guide de l'utilisateur Amazon EC2 pour les instances Linux.

Note

À partir de AWS ParallelCluster la version 3.15.0, cette exigence s'applique également lorsque vous activez Efa sur un type d'instance de carte réseau unique qui prend en charge plusieurs interfaces réseau. AWS ParallelCluster lance ces nœuds de calcul avec deux interfaces réseau (une interface principale et une efa-only interface dédiée), de sorte qu'Amazon EC2 ne leur attribue pas automatiquement d'adresse IP publique. Pour ces files d'attente, définissez AssignPublicIp false et utilisez une passerelle NAT (ou placez les nœuds de calcul dans un sous-réseau privé) pour fournir un accès public. Pour plus d’informations, consultez Elastic Fabric Adapter (EFA).

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

SecurityGroups(Facultatif,[String])

Liste des groupes de sécurité à utiliser pour la Slurm file d'attente. Si aucun groupe de sécurité n'est spécifié, AWS ParallelCluster crée des groupes de sécurité pour vous.

Vérifiez que les groupes de sécurité sont correctement configurés pour vos SharedStorage systèmes.

Avertissement

Cet avertissement s'applique aux 3. x. y AWS ParallelCluster versions antérieures à la version 3.3.0. AWS ParallelCluster la version 3.3.0 n'est pas affectée si ce paramètre est modifié.

Pour AWS ParallelCluster 3 versions antérieures à la version 3.3.0 :

Si vous modifiez ce paramètre et mettez à jour un cluster, cela crée un nouveau système de fichiers FSx pour Lustre géré et supprime le système de fichiers FSx pour Lustre géré existant sans préserver les données existantes. Cela entraîne une perte de données. Veillez à sauvegarder les données du système de fichiers FSx for Lustre existant si vous souhaitez conserver les données. Pour plus d'informations, consultez la section Utilisation des sauvegardes dans le guide de l'utilisateur de FSx for Lustre.

Avertissement

Si vous activez Efa pour vos instances de calcul, assurez-vous que celles-ci EFA-enabled sont membres d'un groupe de sécurité qui autorise l'ensemble du trafic entrant et sortant vers lui-même.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

AdditionalSecurityGroups(Facultatif,[String])

Liste des groupes de sécurité supplémentaires à utiliser pour la Slurm file d'attente.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

PlacementGroup(Facultatif)

Spécifie les paramètres du groupe de placement pour la Slurm file d'attente.

PlacementGroup: Enabled: boolean Id: string Name: string

Politique de mise à jour : tous les nœuds de calcul doivent être arrêtés pour la suppression d'un groupe de placement géré. Le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Enabled(Facultatif,Boolean)

Indique si un groupe de placement est utilisé pour la Slurm file d'attente. La valeur par défaut est false.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Id(Facultatif,String)

L'ID de groupe de placement d'un groupe de placement de cluster existant utilisé par la Slurm file d'attente. Assurez-vous de fournir l'identifiant du groupe de placement et non son nom.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Name(Facultatif,String)

Le nom du groupe de placement d'un groupe de placement de cluster existant utilisé par la Slurm file d'attente. Assurez-vous de fournir le nom du groupe de placement et non son identifiant.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Note
  • SiPlacementGroup/Enabledest défini surtrue, sans Name ou Id défini, chaque ressource de calcul se voit attribuer son propre groupe de placement géré, sauf si ComputeResources Networking//PlacementGroupest défini pour remplacer ce paramètre.

  • À partir de AWS ParallelCluster la version 3.3.0, SlurmQueues Networking/PlacementGroup//Namea été ajouté comme alternative préférée à SlurmQueues//NetworkingPlacementGroup/Id.

    PlacementGroup/Idet PlacementGroup/Namesont équivalents. Vous pouvez utiliser l'un ou l'autre.

    Si vous incluez à la fois PlacementGroup/Idet PlacementGroup/Name, cela AWS ParallelCluster échoue. Vous ne pouvez choisir que l'un ou l'autre.

    Vous n'avez pas besoin de mettre à jour votre cluster pour utiliser PlacementGroup/Name.

  • Lorsque vous utilisez une réservation de bloc de capacité, aucune contrainte de groupe de placement ne doit être définie car des erreurs de capacité insuffisantes peuvent survenir en raison de contraintes de placement en dehors de la réservation, même si la réservation de capacité dispose d'une capacité restante.

Proxy(Facultatif)

Spécifie les paramètres de proxy pour la Slurm file d'attente.

Proxy: HttpProxyAddress: string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

HttpProxyAddress(Facultatif,String)

Définit un serveur proxy HTTP ou HTTPS pour la Slurm file d'attente. Typiquement, ça l'esthttps://x.x.x.x:8080.

Il n'y a pas de valeur par défaut.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Image

(Facultatif) Spécifie l'image à utiliser pour la Slurm file d'attente. Pour utiliser la même AMI pour tous les nœuds, utilisez le CustomAmi paramètre de la Image section.

Image: CustomAmi: string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Propriétés de l'image
CustomAmi(Facultatif,String)

L'AMI à utiliser pour la Slurm file d'attente au lieu des AMI par défaut. Vous pouvez utiliser la commande pcluster CLI pour afficher la liste des AMI par défaut.

Note

L'AMI doit être basée sur le même système d'exploitation que celui utilisé par le nœud principal.

pcluster list-official-images

Si l'AMI personnalisée nécessite des autorisations supplémentaires pour son lancement, vous devez ajouter ces autorisations à la politique du nœud principal.

Par exemple, si un instantané chiffré est associé à une AMI personnalisée, les politiques supplémentaires suivantes sont requises dans les politiques du nœud de tête.

JSON
{ "Version":"2012-10-17", "Statement": [ { "Effect": "Allow", "Action": [ "kms:DescribeKey", "kms:ReEncrypt*", "kms:CreateGrant", "kms:Decrypt" ], "Resource": [ "arn:aws:kms:us-east-1:111122223333:key/<AWS_KMS_KEY_ID>" ] } ] }

Pour résoudre les problèmes liés aux avertissements de validation d'AMI personnalisés, consultezRésolution des problèmes liés aux AMI personnalisées.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

ComputeResources

(Obligatoire) Définit la ComputeResources configuration de la Slurm file d'attente.

Note
  • La taille du cluster peut changer lors d'une mise à jour. Pour plus d'informations, consultez la section Taille et mise à jour de la capacité du cluster.

  • De nouvelles ressources de calcul peuvent être ajoutées au cluster uniquement si elles sont déployées dans des sous-réseaux appartenant à des blocs CIDR existants lors de la création du cluster.

ComputeResources: - Name: string InstanceType: string Instances: - InstanceType: string MinCount: integer MaxCount: integer DynamicNodePriority: integer StaticNodePriority: integer SpotPrice: float DisableSimultaneousMultithreading: boolean SchedulableMemory: integer HealthChecks: Gpu: Enabled: boolean Efa: Enabled: boolean GdrSupport: boolean CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string Networking: PlacementGroup: Enabled: boolean Name: string CustomSlurmSettings: dict Tags: - Key: string Value: string LaunchTemplateOverrides: LaunchTemplateId: string Version: string

Politique de mise à jour : pour ce paramètre de valeurs de liste, une nouvelle valeur peut être ajoutée lors d'une mise à jour ou le parc informatique doit être arrêté lors de la suppression d'une valeur existante.

Propriétés de ComputeResources
Name(Obligatoire,String)

Nom de l'environnement de calcul de la Slurm file d'attente. Le nom peut comporter jusqu'à 25 caractères.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

InstanceType(Obligatoire,String)

Type d'instance utilisé dans cette ressource Slurm de calcul. Tous les types d'instances d'un cluster doivent utiliser la même architecture de processeur. Les instances peuvent utiliser l'arm64architecture x86_64 ou.

La configuration du cluster doit définir InstanceType soit des instances. Si les deux sont définis, AWS ParallelCluster échoue.

Lorsque vous définissezInstanceType, vous ne pouvez pas définir plusieurs sous-réseaux. Si vous ne configurez qu'un seul type d'instance et que vous souhaitez utiliser plusieurs sous-réseaux, définissez votre type d'instance dans Instances plutôt que dansInstanceType. Pour plus d'informations, voir Networking/SubnetIds.

Si vous définissez un type d'hpc6idinstance p4d ou, ou un autre type d'instance doté de plusieurs interfaces réseau ou d'une carte d'interface réseau, vous devez lancer les instances de calcul dans un sous-réseau privé comme décrit dansAWS ParallelCluster en utilisant deux sous-réseaux. AWS Les adresses IP publiques ne peuvent être attribuées qu'aux instances lancées avec une seule interface réseau. Pour plus d'informations, consultez la section Attribuer une adresse IPv4 publique lors du lancement de l'instance dans le Guide de l'utilisateur Amazon EC2 pour les instances Linux.

Note

À partir de AWS ParallelCluster la version 3.15.0, cette exigence s'applique également lorsque vous activez Efa sur un type d'instance de carte réseau unique qui prend en charge plusieurs interfaces réseau. Pour plus d’informations, consultez Elastic Fabric Adapter (EFA).

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

Instances(Obligatoire)

Spécifie la liste des types d'instances pour une ressource de calcul. Pour spécifier la stratégie d'allocation pour la liste des types d'instances, consultez AllocationStrategy.

La configuration du cluster doit définir InstanceType soit Instances. Si les deux sont définis, AWS ParallelCluster échoue.

Pour de plus amples informations, veuillez consulter Allocation de plusieurs types d'instances avec Slurm.

Instances: - InstanceType: string
Note

À partir de AWS ParallelCluster la version 3.7.0, elle EnableMemoryBasedScheduling peut être activée si vous configurez plusieurs types d'instances dans Instances.

Pour AWS ParallelCluster les versions 3.2.0 à 3.6. x, ne EnableMemoryBasedScheduling peut pas être activé si vous configurez plusieurs types d'instances dans Instances.

Politique de mise à jour : pour ce paramètre de valeurs de liste, une nouvelle valeur peut être ajoutée lors d'une mise à jour ou le parc informatique doit être arrêté lors de la suppression d'une valeur existante.

InstanceType(Obligatoire,String)

Type d'instance à utiliser dans cette ressource Slurm de calcul. Tous les types d'instances d'un cluster doivent utiliser la même architecture de processeur, x86_64 soitarm64.

Les types d'instances répertoriés dans Instances doivent avoir :

  • Le même nombre de processeurs virtuels ou, s'il DisableSimultaneousMultithreading est défini surtrue, le même nombre de cœurs.

  • Le même nombre d'accélérateurs des mêmes fabricants.

  • EFA est pris en charge, si Efa/Enabledréglé surtrue.

Les types d'instances répertoriés dans Instances peuvent être les suivants :

  • Quantité de mémoire différente.

    Dans ce cas, la mémoire minimale doit être définie comme Slurm ressource consommable.

    Note

    À partir de AWS ParallelCluster la version 3.7.0, elle EnableMemoryBasedScheduling peut être activée si vous configurez plusieurs types d'instances dans Instances.

    Pour AWS ParallelCluster les versions 3.2.0 à 3.6. x, ne EnableMemoryBasedScheduling peut pas être activé si vous configurez plusieurs types d'instances dans Instances.

  • Différentes cartes réseau.

    Dans ce cas, le nombre d'interfaces réseau configurées pour la ressource de calcul est défini par le type d'instance comportant le plus petit nombre de cartes réseau.

  • Bande passante réseau différente.

  • Taille de stockage d'instance différente.

Si vous définissez un type d'hpc6idinstance p4d ou, ou un autre type d'instance doté de plusieurs interfaces réseau ou d'une carte d'interface réseau, vous devez lancer les instances de calcul dans un sous-réseau privé comme décrit dansAWS ParallelCluster en utilisant deux sous-réseaux. AWS Les adresses IP publiques ne peuvent être attribuées qu'aux instances lancées avec une seule interface réseau. Pour plus d'informations, consultez la section Attribuer une adresse IPv4 publique lors du lancement de l'instance dans le Guide de l'utilisateur Amazon EC2 pour les instances Linux.

Note

À partir de AWS ParallelCluster la version 3.15.0, cette exigence s'applique également lorsque vous activez Efa sur un type d'instance de carte réseau unique qui prend en charge plusieurs interfaces réseau. Pour plus d’informations, consultez Elastic Fabric Adapter (EFA).

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

Note

Instancesest pris en charge à partir de AWS ParallelCluster la version 3.3.0.

MinCount(Facultatif,Integer)

Le nombre minimal d'instances utilisées par la ressource de Slurm calcul. La valeur par défaut est 0.

Note

La taille du cluster peut changer lors d'une mise à jour. Pour plus d'informations, voir Taille et mise à jour de la capacité du cluster

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

MaxCount(Facultatif,Integer)

Le nombre maximum d'instances utilisées par la ressource de Slurm calcul. La valeur par défaut est 10.

Lorsque vous utilisezCapacityType = CAPACITY_BLOCK, MaxCount doit être égal ou supérieur à MinCount 0, car toutes les instances faisant partie de la réservation de blocs de capacité sont gérées en tant que nœuds statiques.

Au moment de la création du cluster, le nœud principal attend que tous les nœuds statiques soient prêts avant de signaler le succès de la création du cluster. Toutefois, lorsque vous les utilisezCapacityType = CAPACITY_BLOCK, les nœuds faisant partie des ressources de calcul associées aux blocs de capacité ne seront pas pris en compte pour cette vérification. Le cluster sera créé même si tous les blocs de capacité configurés ne sont pas actifs.

Note

La taille du cluster peut changer lors d'une mise à jour. Pour plus d'informations, voir Taille et mise à jour de la capacité du cluster

DynamicNodePriority(Facultatif,Integer)

Priorité des nœuds dynamiques dans une ressource de calcul de file d'attente. La priorité correspond au paramètre de Weight configuration des Slurm nœuds pour les nœuds dynamiques des ressources de calcul. La valeur par défaut est 1000.

Slurmdonne la priorité aux nœuds dont les Weight valeurs sont les plus faibles en premier.

Avertissement

L'utilisation de nombreuses Weight valeurs différentes dans une Slurm partition (file d'attente) peut ralentir le rythme de planification des tâches dans la file d'attente.

Dans AWS ParallelCluster les versions antérieures à la version 3.7.0, la même pondération par défaut était attribuée aux nœuds statiques et dynamiques. 1 Dans ce cas, Slurm vous pouvez donner la priorité aux nœuds dynamiques inactifs par rapport aux nœuds statiques inactifs en raison du schéma de dénomination des nœuds statiques et dynamiques. Lorsque toutes choses sont égales par ailleurs, Slurm planifie les nœuds par ordre alphabétique de nom.

Note

DynamicNodePriorityest ajouté dans la AWS ParallelCluster version 3.7.0.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

StaticNodePriority(Facultatif,Integer)

Priorité des nœuds statiques dans une ressource de calcul de file d'attente. La priorité correspond au paramètre de Weight configuration des Slurm nœuds pour les nœuds statiques des ressources de calcul. La valeur par défaut est 1.

Slurmdonne la priorité aux nœuds dont les Weight valeurs sont les plus faibles en premier.

Avertissement

L'utilisation de nombreuses Weight valeurs différentes dans une Slurm partition (file d'attente) peut ralentir le rythme de planification des tâches dans la file d'attente.

Note

StaticNodePriorityest ajouté dans la AWS ParallelCluster version 3.7.0.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

SpotPrice(Facultatif,Float)

Le prix maximum payé pour une instance Amazon EC2 Spot avant le lancement de toute instance. La valeur par défaut est le On-Demand prix.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

DisableSimultaneousMultithreading(Facultatif,Boolean)

Sitrue, le multithreading sur les nœuds de la Slurm file d'attente est désactivé. La valeur par défaut est false.

Tous les types d'instances ne peuvent pas désactiver le multithreading. Pour obtenir la liste des types d'instances qui prennent en charge la désactivation du multithreading, consultez la section Cœurs de processeur et threads pour chaque cœur de processeur par type d'instance dans le guide de l'utilisateur Amazon EC2.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

SchedulableMemory(Facultatif,Integer)

La quantité de mémoire en MiB configurée dans le Slurm paramètre RealMemory pour les nœuds de calcul d'une ressource de calcul. Cette valeur est la limite supérieure de la mémoire de nœud disponible pour les tâches lorsque SlurmSettings/EnableMemoryBasedSchedulingest activé. La valeur par défaut est 95 % de la mémoire répertoriée dans les types d'instance Amazon EC2 et renvoyée par l'API Amazon EC2. DescribeInstanceTypes Assurez-vous de convertir les valeurs données en GiB en MiB.

Valeurs prises en charge : 1-EC2Memory

EC2Memoryest la mémoire (en MiB) répertoriée dans les types d'instance Amazon EC2 et renvoyée par l'API Amazon EC2. DescribeInstanceTypes Assurez-vous de convertir les valeurs données en GiB en MiB.

Cette option est particulièrement pertinente lorsque SlurmSettings/EnableMemoryBasedSchedulingest activé. Pour de plus amples informations, veuillez consulter Slurm planification basée sur la mémoire.

Note

SchedulableMemoryest pris en charge à partir de AWS ParallelCluster la version 3.2.0.

À partir de la version 3.2.0, par défaut, AWS ParallelCluster configure RealMemory pour les nœuds de Slurm calcul 95 % de la mémoire renvoyée par l'API Amazon EC2. DescribeInstanceTypes Cette configuration est indépendante de la valeur deEnableMemoryBasedScheduling.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

HealthChecks(Facultatif)

Spécifiez les contrôles de santé d'une ressource de calcul.

Gpu(Facultatif)

Spécifiez les contrôles de santé du GPU sur une ressource de calcul.

Enabled(Facultatif,Boolean)

S'il AWS ParallelCluster effectue des contrôles de santé du GPU lors du calcul d'une ressource dans une file d'attente. La valeur par défaut est false.

Note

AWS ParallelCluster ne prend pas en chargeHealthChecks/Gpudans les nœuds qui utilisent les systèmes d'exploitation alinux2 ARM. Ces plateformes ne prennent pas en charge le NVIDIA Data Center GPU Manager (DCGM).

Comportement du test de santé du GPU
  • SiGpu/Enabledest défini surtrue, AWS ParallelCluster effectue des contrôles de santé du GPU sur une ressource de calcul.

  • Le bilan Gpu de santé effectue des contrôles de santé sur une ressource de calcul afin d'empêcher la soumission de tâches sur des nœuds dotés d'une carte graphique dégradée.

  • Si un nœud de calcul échoue à un contrôle de Gpu santé, l'état du nœud de calcul passe àDRAIN. Les nouvelles tâches ne démarrent pas sur ce nœud. Les tâches existantes sont exécutées jusqu'à leur terme. Une fois toutes les tâches en cours terminées, le nœud de calcul s'arrête s'il s'agit d'un nœud dynamique et il est remplacé s'il s'agit d'un nœud statique.

  • La durée du bilan de Gpu santé dépend du type d'instance sélectionné, du nombre de GPU composant l'instance et du nombre de cibles du bilan de Gpu santé (équivalent au nombre de cibles GPU des tâches). Pour une instance dotée de 8 GPU, la durée typique est inférieure à 3 minutes.

  • Si le bilan Gpu de santé s'exécute sur une instance qui n'est pas prise en charge, il se ferme et la tâche s'exécute sur le nœud de calcul. Par exemple, si une instance ne possède pas de GPU, ou si une instance en possède un mais qu'il ne s'agit pas d'un GPU NVIDIA, le bilan de santé se termine et la tâche s'exécute sur le nœud de calcul. Seuls les GPU NVIDIA sont pris en charge.

  • Le Gpu bilan de santé utilise l'dcgmioutil pour effectuer des contrôles de santé sur un nœud et suit les étapes suivantes :

    Lorsque le Gpu bilan de santé commence dans un nœud :

    1. Il détecte si les nvidia-fabricmanager services nvidia-dcgm et sont en cours d'exécution.

    2. Si ces services ne fonctionnent pas, le bilan Gpu de santé les lance.

    3. Il détecte si le mode de persistance est activé.

    4. Si le mode de persistance n'est pas activé, le Gpu bilan de santé l'active.

    À la fin du bilan de santé, le bilan de Gpu santé rétablit ces services et ressources dans leur état initial.

  • Si la tâche est attribuée à un ensemble spécifique de GPU de nœuds, le contrôle de Gpu santé s'exécute uniquement sur cet ensemble spécifique. Dans le cas contraire, le bilan de Gpu santé s'exécute sur tous les GPU du nœud.

  • Si un nœud de calcul reçoit deux demandes de contrôle de Gpu santé ou plus en même temps, seul le premier contrôle de santé est exécuté et les autres sont ignorées. C'est également le cas pour les bilans de santé ciblant les GPU des nœuds. Vous pouvez consulter les fichiers journaux pour obtenir des informations supplémentaires concernant cette situation.

  • Le journal de contrôle de santé d'un nœud de calcul spécifique est disponible dans le /var/log/parallelcluster/slurm_health_check.log fichier. Ce fichier est disponible sur Amazon CloudWatch, dans le groupe de CloudWatch journaux du cluster, où vous pouvez trouver :

    • Informations détaillées sur l'action exécutée par le bilan de Gpu santé, notamment l'activation et la désactivation des services et le mode de persistance.

    • L'identifiant du GPU, l'ID de série et l'UUID.

    • La sortie du bilan de santé.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

HealthChecksest pris en charge à partir de AWS ParallelCluster la version 3.6.0.

Efa(Facultatif)

Spécifie les paramètres de l'adaptateur Elastic Fabric (EFA) pour les nœuds de la Slurm file d'attente.

Efa: Enabled: boolean GdrSupport: boolean

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Enabled(Facultatif,Boolean)

Spécifie que l'adaptateur Elastic Fabric (EFA) est activé. Pour consulter la liste des instances Amazon EC2 qui prennent en charge EFA, consultez la section Types d'instances pris en charge dans le Guide de l'utilisateur Amazon EC2 pour les instances Linux. Pour de plus amples informations, veuillez consulter Elastic Fabric Adapter. Nous vous recommandons d'utiliser un cluster SlurmQueues/Networking/PlacementGrouppour minimiser les latences entre les instances.

La valeur par défaut est false.

Note

L'adaptateur Elastic Fabric (EFA) n'est pas pris en charge dans les différentes zones de disponibilité. Pour de plus amples informations, veuillez consulter SubnetIds.

Avertissement

Si vous définissez un groupe de sécurité personnalisé dans SecurityGroups, assurez-vous que vos EFA-enabled instances sont membres d'un groupe de sécurité qui autorise l'ensemble du trafic entrant et sortant vers lui-même.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

GdrSupport(Facultatif,Boolean)

(Facultatif) À partir de AWS ParallelCluster la version 3.0.2, ce paramètre n'a aucun effet. La prise en charge par Elastic Fabric Adapter (EFA) pour GPUdirect RDMA (accès direct à la mémoire à distance) est toujours activée si elle est prise en charge par le type d'instance de la ressource de Slurm calcul et le système d'exploitation.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

CapacityReservationTarget
CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string

Spécifie la réservation de capacité à la demande à utiliser pour la ressource de calcul.

CapacityReservationId(Facultatif,String)

L'ID de la réservation de capacité existante à cibler pour les ressources de calcul de la file d'attente. L'identifiant peut faire référence à un ODCR ou à un bloc de capacité pour le ML.

Lorsque ce paramètre est spécifié au niveau des ressources de calcul, s'il InstanceType est facultatif, il sera automatiquement extrait de la réservation.

CapacityReservationResourceGroupArn(Facultatif,String)

Indique le nom de ressource Amazon (ARN) du groupe de ressources qui sert de groupe de réservations de capacité lié à un service pour la ressource de calcul. AWS ParallelCluster identifie et utilise la réservation de capacité la plus appropriée auprès du groupe. Le groupe de ressources doit disposer d'au moins un ODCR pour chaque type d'instance répertorié pour la ressource de calcul. Pour de plus amples informations, veuillez consulter Lancez des instances avec des réservations de capacité à la demande (ODCR).

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Note

CapacityReservationTargetest ajouté avec AWS ParallelCluster la version 3.3.0.

Networking
Networking: PlacementGroup: Enabled: boolean Name: string

Politique de mise à jour : tous les nœuds de calcul doivent être arrêtés pour la suppression d'un groupe de placement géré. Le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

PlacementGroup(Facultatif)

Spécifie les paramètres du groupe de placement pour la ressource de calcul.

Enabled(Facultatif,Boolean)

Indique si un groupe de placement est utilisé pour la ressource de calcul.

  • Si elle est Name définie surtrue, sans définition, cette ressource de calcul se voit attribuer son propre groupe de placement géré, quel que soit le PlacementGroup paramètre SlurmQueues Networking//.

  • Si elle est définie surtrue, avec une valeur Name définie, cette ressource de calcul se voit attribuer le groupe de placement nommé, quels que soient PlacementGroup les paramètres SlurmQueuesNetworking//.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Name(Facultatif,String)

Le nom du groupe de placement d'un groupe de placement de cluster existant utilisé pour la ressource de calcul.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Note
  • SiPlacementGroup/Enabledet Name ne sont pas définis, leurs valeurs respectives sont définies par défaut sur les PlacementGroup paramètres SlurmQueues Networking//.

  • Lorsque vous utilisez une réservation de bloc de capacité, aucune contrainte de groupe de placement ne doit être définie car des erreurs de capacité insuffisantes peuvent survenir en raison de contraintes de placement en dehors de la réservation, même si la réservation de capacité dispose d'une capacité restante.

  • ComputeResources/Networking/PlacementGroupest ajouté avec AWS ParallelCluster la version 3.3.0.

CustomSlurmSettings(Facultatif,Dict)

(Facultatif) Définit les paramètres de configuration personnalisés des Slurm nœuds (ressources de calcul).

Spécifie un dictionnaire de paires clé-valeur de paramètres de Slurm configuration personnalisés qui s'appliquent aux Slurm nœuds (ressources de calcul).

Chaque paire clé-valeur distincte, telle queParam1: Value1, est ajoutée séparément à la fin de la ligne de configuration du Slurm nœud dans le format. Param1=Value1

Vous ne pouvez spécifier que des paramètres Slurm de configuration qui ne sont pas refusés dans. CustomSlurmSettings Pour plus d'informations sur les paramètres de Slurm configuration refusés, consultez. Inscrit sur la liste Deny Slurm paramètres de configuration pour CustomSlurmSettings

AWS ParallelCluster vérifie uniquement si un paramètre se trouve dans une liste de refus. AWS ParallelCluster ne valide pas la syntaxe ou la sémantique de vos paramètres de Slurm configuration personnalisés. Il est de votre responsabilité de valider vos paramètres Slurm de configuration personnalisés. Les paramètres Slurm de configuration personnalisés non valides peuvent provoquer des défaillances du Slurm démon, ce qui peut entraîner des échecs de création et de mise à jour du cluster.

Pour plus d'informations sur la façon de spécifier des paramètres Slurm de configuration personnalisés avec AWS ParallelCluster, consultezSlurm personnalisation de la configuration.

Pour plus d'informations sur les paramètres Slurm de configuration, consultez slurm.conf dans la documentation. Slurm

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

CustomSlurmSettingsest pris en charge à partir de AWS ParallelCluster la version 3.6.0.

Tags(Facultatif, [Chaîne])

Liste de paires clé-valeur de balises. ComputeResourceles balises remplacent les balises dupliquées spécifiées dans le Section Balises ou SlurmQueues/Tags.

Key(Facultatif,String)

Identification de balise.

Value(Facultatif,String)

Valeur de balise.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

LaunchTemplateOverrides(Facultatif)
Note

LaunchTemplateOverridesest ajouté avec AWS ParallelCluster la version 3.15.0.

Spécifie un modèle de lancement pour remplacer le modèle de lancement par défaut AWS ParallelCluster créé pour la ressource de calcul. Le modèle de lancement ne doit contenir que des remplacements d'interfaces réseau. AWS ParallelCluster valide le modèle de lancement et empêche de modifier d'autres paramètres. Pour plus d'informations sur l'utilisation de cette dérogation, consultezPersonnalisez les interfaces réseau des nœuds de calcul avec des remplacements de modèles de lancement.

LaunchTemplateOverrides: LaunchTemplateId: string Version: string

ComputeSettings

(Obligatoire) Définit la ComputeSettings configuration de la Slurm file d'attente.

Propriétés de ComputeSettings

Spécifie les propriétés ComputeSettings des nœuds de la Slurm file d'attente.

ComputeSettings: LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

LocalStorage(Facultatif)

Spécifie les propriétés LocalStorage des nœuds de la Slurm file d'attente.

LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

RootVolume(Facultatif)

Spécifie les détails du volume racine des nœuds de la Slurm file d'attente.

RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Size(Facultatif,Integer)

Spécifie la taille du volume racine en gibioctets (GiB) pour les nœuds de la file d'attente. Slurm La taille par défaut provient de l'AMI. L'utilisation d'une taille différente nécessite la prise en charge par l'AMIgrowroot.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Encrypted(Facultatif,Boolean)

Sitrue, le volume racine des nœuds de la Slurm file d'attente est chiffré. La valeur par défaut est true.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

VolumeType(Facultatif,String)

Spécifie le type de volume Amazon EBS des nœuds de la Slurm file d'attente. Les valeurs prises en charge sont gp2 gp3 io1io2,sc1,st1, etstandard. La valeur par défaut est gp3.

Pour plus d’informations, consultez Types de volumes Amazon EBS dans le Guide de l’utilisateur Amazon EC2.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Iops(Facultatif,Boolean)

Définit le nombre d'IOPS pour les io1 volumes et io2 les gp3 types de volumes.

La valeur par défaut, les valeurs prises en charge et volume_iops volume_size le ratio varient de VolumeType etSize.

VolumeType = io1

Par défaut Iops = 100

Valeurs prises en charge Iops = 100 à 64 000 †

Maximum par volume_size rapport volume_iops au ratio = 50 IOPS par GiB. 5000 IOPS nécessitent un débit volume_size d'au moins 100 GiB.

VolumeType = io2

Par défaut Iops = 100

Valeurs prises en charge Iops = 100 à 64 000 (256 000 pour les volumes io2 Block Express) †

SizeRapport maximal Iops = 500 IOPS par GiB. 5000 IOPS nécessitent un débit Size d'au moins 10 GiB.

VolumeType = gp3

Par défaut Iops = 3000

Valeurs prises en charge Iops = 3 000 à 16 000 †

Maximum par Size rapport Iops au ratio = 500 IOPS par GiB pour les volumes dont les IOPS sont supérieurs à 3 000.

† Le maximum d'IOPS est garanti uniquement sur les instances basées sur le système Nitro qui sont également provisionnées avec plus de 32 000 IOPS. Les autres instances peuvent avoir jusqu'à 32 000 IOPS. io1Les volumes précédents peuvent ne pas atteindre leurs performances optimales à moins que vous ne modifiiez le volume. io2 Les volumes Block Express prennent en charge volume_iops des valeurs allant jusqu'à 256 000 pour les types d'R5binstances. Pour plus d'informations, consultez la section io2 Block Express volumes dans le guide de l'utilisateur Amazon EC2.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Throughput(Facultatif,Integer)

Définit le débit pour les types de gp3 volumes, en MiB/s. Ce paramètre n'est valide que s'il VolumeType est définigp3. La valeur par défaut est 125. Valeurs prises en charge : 125 à 1000 MiB/s

Le ratio de Throughput à ne Iops peut pas dépasser 0,25. Le débit maximal de 1 000 MiB/s nécessite que le Iops réglage soit d'au moins 4 000.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

EphemeralVolume(Facultatif,Boolean)

Spécifie les paramètres du volume éphémère. Le volume éphémère est créé en combinant tous les volumes de stockage d'instance en un seul volume logique formaté avec le ext4 système de fichiers. La valeur par défaut est /scratch. Si le type d'instance ne possède aucun volume de stockage d'instance, aucun volume éphémère n'est créé. Pour plus d’informations, consultez Volumes de stockage d’instances dans le Guide de l’utilisateur Amazon EC2.

EphemeralVolume: MountDir: string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

MountDir(Facultatif,String)

Le répertoire de montage du volume éphémère pour chaque nœud de la Slurm file d'attente.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

CustomActions

(Facultatif) Spécifie les scripts personnalisés à exécuter sur les nœuds de la Slurm file d'attente.

CustomActions: OnNodeStart: Sequence: - Script: string Args: - string Script: string Args: - string OnNodeConfigured: Sequence: - Script: string Args: - string Script: string Args: - string

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

CustomActionsPropriétés
OnNodeStart(Facultatif,String)

Spécifie une séquence de scripts ou un script unique à exécuter sur les nœuds de la Slurm file d'attente avant le démarrage de toute action d'initialisation du déploiement de nœuds. AWS ParallelCluster ne permet pas d'inclure à la fois un seul script et Sequence pour la même action personnalisée. Pour de plus amples informations, veuillez consulter Actions de bootstrap personnalisées.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

OnNodeConfigured(Facultatif,String)

Spécifie une séquence de scripts ou un script unique à exécuter sur les nœuds de la Slurm file d'attente une fois que toutes les actions d'amorçage des nœuds sont terminées. AWS ParallelCluster ne permet pas d'inclure à la fois un seul script et Sequence pour la même action personnalisée. Pour de plus amples informations, veuillez consulter Actions de bootstrap personnalisées.

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategydéfini pour que ce paramètre soit modifié en vue d'une mise à jour.

Note

Sequenceest ajouté à partir de AWS ParallelCluster la version 3.6.0. Lorsque vous le spécifiezSequence, vous pouvez répertorier plusieurs scripts pour une action personnalisée. AWS ParallelCluster continue de prendre en charge la configuration d'une action personnalisée avec un seul script, sans inclureSequence.

AWS ParallelCluster ne permet pas d'inclure à la fois un seul script et Sequence pour la même action personnalisée.

Iam

(Facultatif) Définit les paramètres IAM facultatifs pour la Slurm file d'attente.

Iam: S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string AdditionalIamPolicies: - Policy: string InstanceProfile: string InstanceRole: string

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Propriétés de l'Iam
InstanceProfile(Facultatif,String)

Spécifie un profil d'instance pour remplacer le rôle d'instance par défaut ou le profil d'instance de la Slurm file d'attente. Vous ne pouvez pas spécifier à la fois InstanceProfile etInstanceRole. Le format est arn:${Partition}:iam::${Account}:instance-profile/${InstanceProfileName}.

Si cela est spécifié, les AdditionalIamPolicies paramètres S3Access et ne peuvent pas être spécifiés.

Nous vous recommandons de spécifier l'un des AdditionalIamPolicies paramètres S3Access et ou les deux, car les fonctionnalités ajoutées nécessitent AWS ParallelCluster souvent de nouvelles autorisations.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

InstanceRole(Facultatif,String)

Spécifie un rôle d'instance pour remplacer le rôle d'instance ou le profil d'instance par défaut pour la Slurm file d'attente. Vous ne pouvez pas spécifier à la fois InstanceProfile etInstanceRole. Le format est arn:${Partition}:iam::${Account}:role/${RoleName}.

Si cela est spécifié, les AdditionalIamPolicies paramètres S3Access et ne peuvent pas être spécifiés.

Nous vous recommandons de spécifier l'un des AdditionalIamPolicies paramètres S3Access et ou les deux, car les fonctionnalités ajoutées nécessitent AWS ParallelCluster souvent de nouvelles autorisations.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

S3Access(Facultatif)

Spécifie un compartiment pour la Slurm file d'attente. Ceci est utilisé pour générer des politiques visant à accorder l'accès spécifié au compartiment de la Slurm file d'attente.

Si cela est spécifié, les InstanceRole paramètres InstanceProfile et ne peuvent pas être spécifiés.

Nous vous recommandons de spécifier l'un des AdditionalIamPolicies paramètres S3Access et ou les deux, car les fonctionnalités ajoutées nécessitent AWS ParallelCluster souvent de nouvelles autorisations.

S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

BucketName(Obligatoire,String)

Le nom du compartiment .

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

KeyName(Facultatif,String)

La clé du seau. La valeur par défaut est *.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

EnableWriteAccess(Facultatif,Boolean)

Indique si l'accès en écriture est activé pour le bucket.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

AdditionalIamPolicies(Facultatif)

Spécifie une liste des Amazon Resource Names (ARN) des politiques IAM pour Amazon EC2. Cette liste est associée au rôle racine utilisé pour la Slurm file d'attente en plus des autorisations requises par AWS ParallelCluster.

Le nom d'une politique IAM et son ARN sont différents. Les noms ne peuvent pas être utilisés.

Si cela est spécifié, les InstanceRole paramètres InstanceProfile et ne peuvent pas être spécifiés.

Nous vous recommandons de les utiliser AdditionalIamPolicies car s'AdditionalIamPoliciesajoutent aux autorisations AWS ParallelCluster requises et InstanceRole doivent inclure toutes les autorisations requises. Les autorisations requises changent souvent d'une version à l'autre au fur et à mesure que des fonctions sont ajoutées.

Il n'y a pas de valeur par défaut.

AdditionalIamPolicies: - Policy: string

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

SlurmSettings

(Facultatif) Définit les paramètres Slurm qui s'appliquent à l'ensemble du cluster.

SlurmSettings: ScaledownIdletime: integer QueueUpdateStrategy: string EnableMemoryBasedScheduling: boolean CustomSlurmSettings: [dict] CustomSlurmSettingsIncludeFile: string Database: Uri: string UserName: string PasswordSecretArn: string ExternalSlurmdbd: Host: string Port: integer Dns: DisableManagedDns: boolean HostedZoneId: string UseEc2Hostnames: boolean

SlurmSettingsPropriétés

ScaledownIdletime(Facultatif,Integer)

Définit la durée (en minutes) pendant laquelle il n'y a pas de tâche et le Slurm nœud se termine.

La valeur par défaut est 10.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

MungeKeySecretArn(Facultatif,String)

Le nom de ressource Amazon (ARN) du secret AWS Secrets Manager en texte clair qui contient la clé munge codée en base64 à utiliser dans le cluster. Slurm Cette clé munge sera utilisée pour authentifier les appels RPC entre les commandes Slurm client et les Slurm démons agissant comme des serveurs distants. Si MungeKeySecretArn ce n'est pas le cas, une clé munge aléatoire AWS ParallelCluster sera générée pour le cluster.

Note

MungeKeySecretArnest pris en charge à partir de AWS ParallelCluster la version 3.8.0.

Avertissement

Si le MungeKeySecretArn est récemment ajouté à un cluster existant, la clé munge précédente ne ParallelCluster sera pas restaurée en cas de restauration ou lors de la suppression ultérieure de la. MungeKeySecretArn Au lieu de cela, une nouvelle clé munge aléatoire sera générée.

Si l' AWS ParallelCluster utilisateur est autorisé à accéder DescribeSecret à cette ressource secrète spécifique, elle MungeKeySecretArn est validée. MungeKeySecretArn est valide si :

  • Le secret spécifié existe, et

  • Le secret est en texte brut et contient une chaîne codée en base64 valide, et

  • La clé munge binaire décodée a une taille comprise entre 256 et 8192 bits.

Si la politique IAM de l'utilisateur de pcluster n'inclut pas DescribeSecret, elle n' MungeKeySecretArnest pas validée et un message d'avertissement s'affiche. Pour de plus amples informations, veuillez consulter Base AWS ParallelCluster politique utilisateur de pcluster.

Lors de la mise à jour MungeKeySecretArn, le parc informatique et tous les nœuds de connexion doivent être arrêtés.

Si la valeur secrète de l'ARN secret est modifiée alors que l'ARN reste le même, le cluster ne sera pas automatiquement mis à jour avec la nouvelle clé Munge. Pour utiliser la nouvelle clé munge de l'ARN secret, vous devez arrêter le parc de calcul et les nœuds de connexion, puis exécuter la commande suivante depuis le nœud principal.

sudo /opt/parallelcluster/scripts/slurm/update_munge_key.sh

Après avoir exécuté la commande, vous pouvez reprendre à la fois le parc de calcul et les nœuds de connexion : les nœuds de calcul et de connexion nouvellement configurés démarreront automatiquement à l'aide de la nouvelle clé Munge.

Pour générer une clé munge personnalisée codée en base64, vous pouvez utiliser l'utilitaire mungekey distribué avec le logiciel Munge, puis l'encoder à l'aide de l'utilitaire base64 généralement disponible sur votre système d'exploitation. Vous pouvez également utiliser bash (veuillez définir le paramètre bs entre 32 et 1024)

dd if=/dev/random bs=128 count=1 2>/dev/null | base64 -w 0

ou Python comme suit :

import random import os import base64 # key length in bytes key_length=128 base64.b64encode(os.urandom(key_length)).decode("utf-8")

Politique de mise à jour : le parc informatique et les nœuds de connexion doivent être arrêtés pour que ce paramètre soit modifié en vue d'une mise à jour.

QueueUpdateStrategy(Facultatif,String)

Spécifie la stratégie de remplacement pour les paramètres de SlurmQueues section qui ont la politique de mise à jour suivante :

Politique de mise à jour : le parc informatique doit être arrêté ou QueueUpdateStrategy doit être défini pour que ce paramètre soit modifié en cas de mise à jour.

La QueueUpdateStrategy valeur est utilisée uniquement lorsqu'un processus de mise à jour du cluster démarre.

Valeurs valides : COMPUTE_FLEET_STOP | DRAIN | TERMINATE

Valeur par défaut : COMPUTE_FLEET_STOP

DRAIN

Les nœuds des files d'attente dont les valeurs de paramètres ont été modifiées sont définis surDRAINING. Les nœuds dans cet état n'acceptent pas de nouvelles tâches et les tâches en cours d'exécution se poursuivent jusqu'à leur achèvement.

Une fois qu'un nœud est devenu idle (DRAINED), un nœud est remplacé s'il est statique et le nœud est terminé s'il est dynamique. Les autres nœuds des autres files d'attente dont les valeurs de paramètres n'ont pas été modifiées ne sont pas affectés.

Le temps nécessaire à cette stratégie pour remplacer tous les nœuds de file d'attente dont les valeurs de paramètres ont été modifiées dépend de la charge de travail en cours.

COMPUTE_FLEET_STOP

La valeur par défaut du QueueUpdateStrategy paramètre. Avec ce paramètre, la mise à jour des paramètres de la SlurmQueues section nécessite que vous arrêtiez le parc de calcul avant d'effectuer une mise à jour du cluster :

$ pcluster update-compute-fleet --status STOP_REQUESTED
TERMINATE

Dans les files d'attente dont les valeurs de paramètres ont été modifiées, les tâches en cours sont interrompues et les nœuds sont immédiatement mis hors tension.

Les nœuds statiques sont remplacés et les nœuds dynamiques sont supprimés.

Les autres nœuds des autres files d'attente dont les valeurs de paramètres n'ont pas été modifiées ne sont pas affectés.

Politique de mise à jour : ce paramètre n'est pas analysé lors d'une mise à jour.

Note

QueueUpdateStrategyest pris en charge à partir de AWS ParallelCluster la version 3.2.0.

EnableMemoryBasedScheduling(Facultatif,Boolean)

Si true la planification basée sur la mémoire est activée dans. Slurm Pour plus d'informations, voir SlurmQueues/ComputeResources/SchedulableMemory.

La valeur par défaut est false.

Avertissement

L'activation de la planification basée sur la mémoire a un impact sur la façon dont le Slurm planificateur gère les tâches et l'allocation des nœuds.

Pour de plus amples informations, veuillez consulter Slurm planification basée sur la mémoire.

Note

EnableMemoryBasedSchedulingest pris en charge à partir de AWS ParallelCluster la version 3.2.0.

Note

À partir de AWS ParallelCluster la version 3.7.0, elle EnableMemoryBasedScheduling peut être activée si vous configurez plusieurs types d'instances dans Instances.

Pour AWS ParallelCluster les versions 3.2.0 à 3.6. x, ne EnableMemoryBasedScheduling peut pas être activé si vous configurez plusieurs types d'instances dans Instances.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

CustomSlurmSettings(Facultatif,[Dict])

Définit les Slurm paramètres personnalisés qui s'appliquent à l'ensemble du cluster.

Spécifie une liste de dictionnaires de Slurm configuration de paires clé-valeur à ajouter à la fin du slurm.conf fichier généré. AWS ParallelCluster

Chaque dictionnaire de la liste apparaît sur une ligne distincte ajoutée au fichier Slurm de configuration. Vous pouvez spécifier des paramètres simples ou complexes.

Les paramètres simples se composent d'une seule paire de clés, comme illustré dans les exemples suivants :

- Param1: 100 - Param2: "SubParam1,SubParam2=SubValue2"

Exemple rendu dans la Slurm configuration :

Param1=100 Param2=SubParam1,SubParam2=SubValue2

Les paramètres Slurm de configuration complexes se composent de plusieurs paires clé-valeur séparées par des espaces, comme indiqué dans les exemples suivants :

- NodeName: test-nodes[1-10] CPUs: 4 RealMemory: 4196 ... # other node settings - NodeSet: test-nodeset Nodes: test-nodes[1-10] ... # other nodeset settings - PartitionName: test-partition Nodes: test-nodeset ... # other partition settings

Exemple, rendu dans la Slurm configuration :

NodeName=test-nodes[1-10] CPUs=4 RealMemory=4196 ... # other node settings NodeSet=test-nodeset Nodes=test-nodes[1-10] ... # other nodeset settings PartitionName=test-partition Nodes=test-nodeset ... # other partition settings
Note

SlurmLes nœuds personnalisés ne doivent pas contenir de -dy- motifs -st- ou dans leur nom. Ces modèles sont réservés aux nœuds gérés par AWS ParallelCluster.

Si vous spécifiez des paramètres Slurm de configuration personnalisés dansCustomSlurmSettings, vous ne devez pas spécifier de paramètres Slurm de configuration personnalisés pourCustomSlurmSettingsIncludeFile.

Vous ne pouvez spécifier que des paramètres Slurm de configuration qui ne sont pas refusés dans. CustomSlurmSettings Pour plus d'informations sur les paramètres de Slurm configuration refusés, consultez. Inscrit sur la liste Deny Slurm paramètres de configuration pour CustomSlurmSettings

AWS ParallelCluster vérifie uniquement si un paramètre se trouve dans une liste de refus. AWS ParallelCluster ne valide pas la syntaxe ou la sémantique de vos paramètres de Slurm configuration personnalisés. Il est de votre responsabilité de valider vos paramètres Slurm de configuration personnalisés. Les paramètres Slurm de configuration personnalisés non valides peuvent provoquer des défaillances du Slurm démon, ce qui peut entraîner des échecs de création et de mise à jour du cluster.

Pour plus d'informations sur la façon de spécifier des paramètres Slurm de configuration personnalisés avec AWS ParallelCluster, consultezSlurm personnalisation de la configuration.

Pour plus d'informations sur les paramètres Slurm de configuration, consultez slurm.conf dans la documentation. Slurm

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

CustomSlurmSettingsest pris en charge à partir de AWS ParallelCluster la version 3.6.0.

CustomSlurmSettingsIncludeFile(Facultatif,String)

Définit les Slurm paramètres personnalisés qui s'appliquent à l'ensemble du cluster.

Spécifie le Slurm fichier personnalisé composé de paramètres de Slurm configuration personnalisés à ajouter à la fin du slurm.conf fichier AWS ParallelCluster généré.

Vous devez inclure le chemin d'accès au fichier. Le chemin peut commencer par https:// ous3://.

Si vous spécifiez des paramètres Slurm de configuration personnalisés pourCustomSlurmSettingsIncludeFile, vous ne devez pas spécifier de paramètres Slurm de configuration personnalisés pourCustomSlurmSettings.

Note

SlurmLes nœuds personnalisés ne doivent pas contenir de -dy- motifs -st- ou dans leur nom. Ces modèles sont réservés aux nœuds gérés par AWS ParallelCluster.

Vous ne pouvez spécifier que des paramètres Slurm de configuration qui ne sont pas refusés dans. CustomSlurmSettingsIncludeFile Pour plus d'informations sur les paramètres de Slurm configuration refusés, consultez. Inscrit sur la liste Deny Slurm paramètres de configuration pour CustomSlurmSettings

AWS ParallelCluster vérifie uniquement si un paramètre se trouve dans une liste de refus. AWS ParallelCluster ne valide pas la syntaxe ou la sémantique de vos paramètres de Slurm configuration personnalisés. Il est de votre responsabilité de valider vos paramètres Slurm de configuration personnalisés. Les paramètres Slurm de configuration personnalisés non valides peuvent provoquer des défaillances du Slurm démon, ce qui peut entraîner des échecs de création et de mise à jour du cluster.

Pour plus d'informations sur la façon de spécifier des paramètres Slurm de configuration personnalisés avec AWS ParallelCluster, consultezSlurm personnalisation de la configuration.

Pour plus d'informations sur les paramètres Slurm de configuration, consultez slurm.conf dans la documentation. Slurm

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Note

CustomSlurmSettingsest pris en charge à partir de AWS ParallelCluster la version 3.6.0.

Base de données

(Facultatif) Définit les paramètres permettant d'activer la Slurm comptabilité sur le cluster. Pour de plus amples informations, veuillez consulter Slurmcomptabilité avec AWS ParallelCluster.

Database: Uri: string UserName: string PasswordSecretArn: string

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

Propriétés de base de données

Uri(Obligatoire,String)

Adresse du serveur de base de données utilisé comme serveur principal pour la Slurm comptabilité. Cet URI doit être mis en forme host:port et ne doit pas contenir un schéma tel quemysql://. L'hôte peut être une adresse IP ou un nom DNS pouvant être résolu par le nœud principal. Si aucun port n'est fourni, AWS ParallelCluster utilise le port MySQL par défaut 3306.

AWS ParallelCluster initialise la base de données de Slurm comptabilité au cluster et doit accéder à la base de données.

La base de données doit être accessible avant que les événements suivants ne se produisent :

  • Un cluster est créé.

  • Slurmla comptabilité est activée grâce à une mise à jour du cluster.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

UserName(Obligatoire,String)

Identité Slurm utilisée pour se connecter à la base de données, écrire des journaux de comptabilité et effectuer des requêtes. L'utilisateur doit disposer d'autorisations de lecture et d'écriture sur la base de données.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

PasswordSecretArn(Obligatoire,String)

Le nom de ressource Amazon (ARN) du AWS Secrets Manager secret qui contient le mot de passe en UserName texte brut. Ce mot de passe est utilisé conjointement UserName et de manière Slurm comptable pour s'authentifier sur le serveur de base de données.

Note
  • Lorsque vous créez un secret à l'aide de la AWS Secrets Manager console, veillez à sélectionner « Autre type de secret », à sélectionner le texte en clair et à n'inclure que le texte du mot de passe dans le secret.

  • Vous ne pouvez pas utiliser le caractère « # » dans le mot de passe de la base de données car Slurm ne le prend pas en charge dans slurmdbd.conf.

  • Pour plus d'informations sur la façon de AWS Secrets Manager créer un secret, reportez-vous à la section Créer un AWS Secrets Manager secret.

Si l'utilisateur est autorisé à le faire DescribeSecret, PasswordSecretArn est validé. PasswordSecretArnest valide si le secret spécifié existe. Si la politique IAM de l'utilisateur n'inclut pasDescribeSecret, PasswordSecretArn n'est pas validée et un message d'avertissement s'affiche. Pour de plus amples informations, veuillez consulter Base AWS ParallelCluster politique utilisateur de pcluster.

Lorsque vous effectuez une mise à jourPasswordSecretArn, le parc informatique doit être arrêté. Si la valeur secrète change et que l'ARN secret ne change pas, le cluster n'est pas automatiquement mis à jour avec le nouveau mot de passe de base de données. Pour mettre à jour le cluster en fonction de la nouvelle valeur secrète, vous devez exécuter la commande suivante depuis le nœud principal après l'arrêt du parc de calcul.

$ sudo /opt/parallelcluster/scripts/slurm/update_slurm_database_password.sh
Avertissement

Nous vous recommandons de ne modifier le mot de passe de la base de données que lorsque le parc informatique est arrêté afin d'éviter toute perte de données comptables.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

DatabaseName(Facultatif,String)

Nom de la base de données sur le serveur de base de données (défini par le paramètre Uri) à utiliser pour la Slurm comptabilité.

Le nom de la base de données peut contenir des lettres minuscules, des chiffres et des traits de soulignement. Le nom ne doit pas comporter plus de 64 caractères.

Ce paramètre correspond au StorageLoc paramètre de https://slurm.schedmd.com/slurmdbd.conf.html#OPT_StorageLoc slurmdbd.conf.

S'DatabaseNameil n'est pas fourni, ParallelCluster utilisera le nom du cluster pour définir une valeur pourStorageLoc.

La mise à jour de DatabaseName est autorisée, avec les considérations suivantes :

  • Si aucune base de données portant un nom DatabaseName n'existe encore sur le serveur de base de données, slurmdbd la créera. Il vous incombera de reconfigurer la nouvelle base de données si nécessaire (par exemple en ajoutant les entités comptables — clusters, comptes, utilisateurs, associations, QoS, etc.).

  • Si une base de données portant un nom existe DatabaseName déjà sur le serveur de base de données, slurmdbd l'utilisera pour la Slurm fonctionnalité de comptabilité.

Politique de mise à jour : le parc informatique doit être arrêté pour que ce paramètre soit modifié pour une mise à jour.

Note

Databaseest ajouté à partir de la version 3.3.0.

ExternalSlurmdbd

(Facultatif) Définit les paramètres pour activer la Slurm comptabilité avec un serveur slurmdbd externe. Pour plus d'informations, consultez la section Slurm Comptabilité avec AWS ParallelCluster.

ExternalSlurmdbd: Host: string Port: integer

Propriétés de ExternalSlurmdbd

Host(Obligatoire,String)

Adresse du serveur externe slurmdbd pour la comptabilité. Slurm L'hôte peut être une adresse IP ou un nom DNS pouvant être résolu par le nœud principal.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

Port(Facultatif,Integer)

Le port écouté par le service slurmdbd. La valeur par défaut est 6819.

Politique de mise à jour : ce paramètre peut être modifié lors d'une mise à jour.

DNS

(Facultatif) Définit les paramètres Slurm qui s'appliquent à l'ensemble du cluster.

Dns: DisableManagedDns: boolean HostedZoneId: string UseEc2Hostnames: boolean

Propriétés DNS

DisableManagedDns(Facultatif,Boolean)

Sitrue, les entrées DNS du cluster ne sont pas créées et les noms de Slurm nœuds ne peuvent pas être résolus.

Par défaut, AWS ParallelCluster crée une zone hébergée Route 53 dans laquelle les nœuds sont enregistrés lors du lancement. La valeur par défaut est false. Si DisableManagedDns cette valeur est définie surtrue, la zone hébergée n'est pas créée par AWS ParallelCluster.

Pour savoir comment utiliser ce paramètre pour déployer des clusters dans des sous-réseaux sans accès à Internet, consultezAWS ParallelCluster dans un seul sous-réseau sans accès à Internet.

Avertissement

Un système de résolution de noms est requis pour que le cluster fonctionne correctement. S'il DisableManagedDns est défini surtrue, vous devez fournir un système de résolution de noms. Pour utiliser le DNS par défaut d'Amazon EC2, définissez surUseEc2Hostnames. true Vous pouvez également configurer votre propre résolveur DNS et vous assurer que les noms des nœuds sont enregistrés lors du lancement des instances. Par exemple, vous pouvez le faire en configurant CustomActions/OnNodeStart.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

HostedZoneId(Facultatif,String)

Définit un ID de zone hébergée Route 53 personnalisé à utiliser pour la résolution des noms DNS du cluster. Lorsque cette option est fournie, AWS ParallelCluster enregistre les nœuds de cluster dans la zone hébergée spécifiée et ne crée pas de zone hébergée gérée.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.

UseEc2Hostnames(Facultatif,Boolean)

Sitrue, les nœuds de calcul du cluster sont configurés avec le nom d'hôte EC2 par défaut. Le Slurm NodeHostName est également mis à jour avec ces informations. La valeur par défaut est false.

Pour savoir comment utiliser ce paramètre pour déployer des clusters dans des sous-réseaux sans accès à Internet, consultezAWS ParallelCluster dans un seul sous-réseau sans accès à Internet.

Note

Cette remarque n'est plus pertinente à partir de AWS ParallelCluster la version 3.3.0.

Pour les versions AWS ParallelCluster prises en charge antérieures à 3.3.0 :

Lorsque cette UseEc2Hostnames valeur est définie surtrue, le fichier de configuration de Slurm est défini à l'aide des scripts AWS ParallelCluster prolog et epilog :

  • prologs'exécute pour ajouter des informations /etc/hosts sur les nœuds de calcul lorsque chaque tâche est allouée.

  • epilogs'exécute pour nettoyer le contenu écrit parprolog.

Pour ajouter des epilog scripts prolog ou des scripts personnalisés, ajoutez-les respectivement aux /opt/slurm/etc/pcluster/epilog.d/ dossiers /opt/slurm/etc/pcluster/prolog.d/ ou.

Politique de mise à jour : si ce paramètre est modifié, la mise à jour n'est pas autorisée.