View a markdown version of this page

在中配置自定义 Slurm 设置 AWS 个 - AWS 个

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

在中配置自定义 Slurm 设置 AWS 个

使用自定义 Slurm 设置在集群、队列和计算节点组资源上配置其他 Slurm 参数。此版本增加了对队列资源上的 Slurm 设置的支持,提供了对分区特定行为的精细控制。

自定义 Slurm 设置的好处

自定义 Slurm 设置可对您的 AWS PCS-based HPC 环境进行复杂的控制。您可以通过服务质量配置和抢占策略实施详细记账、强制实施访问控制并优化工作负载执行。这些功能可确保关键任务获得必要的资源,同时保持高效的集群利用率。无论您是管理 GPU-accelerated 工作负载、实施公平共享计划还是控制作业生命周期,自定义设置都有助于使您的 HPC 基础架构与运营要求和研究目标保持一致。

配置自定义设置

自定义 Slurm 设置可以在资源创建期间通过 AWS 控制台、CLI 或 SDK 进行配置,也可以在以后通过更新操作进行修改。

AWS 管理控制台

在任何资源类型(集群、队列或计算节点组)的创建或编辑页面中导航到其他调度器设置。

添加新设置
  1. 选择 “添加新设置”

  2. 从下拉列表中选择一个参数名称(包括简短的参数描述)。

  3. 提供相应的值。

取消自定义设置
  1. 选择相关 parameter/value 对旁边的 “移除”。

  2. 创建或更新资源。

AWS CLI

要对自定义设置进行编程管理,请在创建或更新操作中使用该SlurmCustomSettings字段。

例— 更新集群上的 Prolog 参数
aws pcs update-cluster --cluster-identifier my-cluster \ --slurm-configuration \ 'SlurmCustomSettings=[{parameterName=Prolog,parameterValue="/path/to/prolog.sh"}]'
例— 将队列设置为集群上的默认队列
aws pcs update-queue \ --cluster-identifier my-cluster \ --queue-identifier my-queue \ --slurm-configuration 'SlurmCustomSettings=[{parameterName=Default,parameterValue=YES}]'
例— 在计算节点组上设置自定义功能
aws pcs update-compute-node-group \ --cluster-identifier my-cluster \ --compute-node-group-identifier my-cng-1 \ --slurm-configuration \ 'SlurmCustomSettings=[{parameterName=Features,parameterValue="gpu,nvme"}]'

验证和错误处理

AWS PCS 对自定义 Slurm 设置实施了多层验证流程。在创建和更新操作期间,我们会执行同步验证,包括:

  • Field-level 检查:我们会验证个人设置是否正确的数据类型、允许的值和格式要求。例如,我们确保时间值采用正确的 Slurm 格式,布尔值使用公认的 Slurm 布尔表示形式。

  • Context-aware 验证:某些设置是根据更广泛的配置上下文检查的。例如,某些参数仅在启用 Slurm 记账时有效。

  • Inter-setting 一致性:我们验证互斥的选项没有一起设置,并且相互依赖的设置配置是否正确。

如果验证失败,您将收到ValidationException包含特定错误代码(例如, InvalidInput)、描述问题的明确错误消息,以及无效字段及其相应错误详细信息的列表。

虽然在初始验证过程中发现了许多问题,但设置之间的一些复杂交互可能只有在应用配置时才会显现出来。在这种情况下,操作将失败并显示一条提示性错误消息,并且所有部分更改都将回滚。

限制

AWS PCS 采用允许清单方法来保护服务安全和运营稳定性。可能危及服务帐号安全或干扰托管服务功能的设置受到限制。但是,我们会不断评估客户需求,并可以根据客户反馈增加对其他设置的支持。