View a markdown version of this page

관리형 수집기를 사용하여 Slurm 지표 Prometheus 수집 - AWS PCS

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

관리형 수집기를 사용하여 Slurm 지표 Prometheus 수집

AWS PCS 클러스터에서 Slurm 지표를 활성화한 후( 참조Slurm AWS PCS의 지표) 관리형 Prometheus 수집기를 사용하여 지표 엔드포인트를 자동으로 스크레이프하고 PromQL 쿼리를 위해 데이터를 전송할 수 있습니다. 관리형 수집기는 VPC 서브넷에 탄력적 네트워크 인터페이스를 생성하여 포트 6817에서 클러스터 컨트롤러의 지표 엔드포인트에 도달합니다.

수집기는 다음 대상 중 하나에 지표를 전달할 수 있습니다.

  • Amazon Managed Service for Prometheus 워크스페이스 Prometheus- 구성 가능한 보존 기간이 있는 전용 호환 지표 스토어입니다(기본적으로 150일). Prometheus호환 APIsGrafana.

  • CloudWatch 데이터 세트 - 15개월의 보존 기간이 포함된 계정의 기본 CloudWatch 데이터 세트입니다. CloudWatch Query Studio 또는 Prometheus호환 HTTP API를 통해 쿼리할 수 있습니다.

클러스터 측 구성(Slurm 설정, 컨트롤러 대상, 보안 그룹 및 스크레이프 구성)은 선택한 대상에 관계없이 동일합니다. create-scraper 요청의 destination 블록과 쿼리 엔드포인트만 다릅니다.

aws amp create-scraper 명령을 사용하여 수집기를 생성합니다. 이 명령은 amp CLI 네임스페이스에 속하지만 두 대상을 모두 지원합니다.

VPC 연결 관리형 수집기에 대한 자세한 내용은 Amazon CloudWatch 사용 설명서의 VPC 연결 관리형 수집기 설정을 참조하세요.

사전 조건

관리형 수집기를 구성하기 전에 다음을 확인합니다.

  • Slurm 지표 활성화됨 - 지표 엔드포인트가 클러스터에서 활성 상태여야 합니다. MetricsType 및 CommunicationParameters 사용자 지정 Slurm 설정을 설정하여 활성화합니다. Slurm 지표 활성화에 대한 지침은 섹션을 참조하세요Slurm AWS PCS의 지표. 사용자 지정 Slurm 설정에 대한 자세한 내용은 섹션을 참조하세요AWS PCS에서 사용자 지정 Slurm 설정 구성.

  • Slurm 버전 25.11 이상 - 지표 엔드포인트를 노출하려면 클러스터가 Slurm 25.11 이상을 실행해야 합니다.

  • 대상 리소스 - 지표의 대상을 생성합니다.

    • Amazon Managed Service for Prometheus 워크스페이스 - 워크스페이스를 생성하고 ACTIVE 상태가 될 때까지 기다립니다. 워크스페이스 생성에 대한 지침은 Amazon Managed Service for Prometheus 사용 설명서의 워크스페이스 생성을 참조하세요.

    • CloudWatch 데이터 세트 - 모든 계정에는 각 리전에 default 데이터 세트가 있습니다. 생성할 필요가 없습니다.

  • VPC 서브넷 및 네트워킹 - 클러스터 컨트롤러와 동일한 VPC 내의 서로 다른 가용 영역에 두 개 이상의 서브넷이 필요합니다. 컨트롤러의 네트워크 인터페이스가 있는 가용 영역을 포함합니다. VPC에는 DNS 지원 및 DNS 호스트 이름이 활성화되어 있어야 합니다. 자세한 네트워킹 요구 사항은 Amazon CloudWatch 사용 설명서의 VPC 연결 관리형 수집기 설정을 참조하세요.

  • 보안 그룹 - 수집기에 대한 전용 보안 그룹이 필요합니다. 보안 그룹 구성에 대한 지침은 섹션을 참조하세요수집기에 대한 보안 그룹 구성.

  • IAM 권한 - 스크레이퍼를 생성하는 IAM 보안 주체에 aps:CreateScraper 및 iam:CreateServiceLinkedRole 권한이 필요합니다. 서비스는 서비스 연결 역할()을 자동으로 생성합니다AWSServiceRoleForAmazonPrometheusScraper. 이 역할은 수집기에 VPC 리소스에 액세스하고 선택한 대상에 쓸 수 있는 권한을 부여합니다. 수동 역할 설정은 필요하지 않습니다. 자세한 내용은 Amazon Managed Service for Prometheus 사용 설명서의 서비스 연결 역할 사용을 참조하세요.

  • 인터넷 또는 VPC 엔드포인트 - 수집기 서브넷이 대상 서비스에 도달할 수 있어야 합니다. 서브넷에 인터넷 액세스 권한이 없는 경우 동일한 VPC 및 서브넷에 인터페이스 VPC 엔드포인트를 생성합니다. com.amazonaws.region.aps-workspaces Amazon Managed Service for Prometheus 워크스페이스 대상 또는 CloudWatch 데이터 세트 대상com.amazonaws.region.monitoring에를 사용합니다.

수집기에 대한 보안 그룹 구성

기존 보안 그룹을 재사용하는 대신 관리형 수집기에 대한 전용 보안 그룹을 생성하는 것이 좋습니다. 전용 그룹은 최소 권한 원칙을 따르는 명시적이고 감사 가능한 규칙을 제공합니다.

중요

이 enable_http 설정은 포트 6817에서 인증되지 않은 HTTP 엔드포인트를 노출합니다. 이 포트의 인바운드 액세스를 수집기의 보안 그룹으로만 제한합니다. 이 포트에 대한 광범위한 네트워크 액세스(예: CIDR 범위)를 허용하지 마십시오.

다음 절차에서는 보안 그룹 IDs 셸 변수를 사용합니다. 명령을 실행하기 전에 다음 변수를 설정합니다.

  • VPC_ID - AWS PCS 클러스터가 있는 VPC의 ID입니다.

  • CLUSTER_SG_ID - 클러스터에 연결된 보안 그룹의 ID입니다(클러스터를 생성할 때 지정한 ID).

  • VPCE_SG_ID - 인터페이스 VPC 엔드포인트에 연결된 보안 그룹의 ID입니다. 이 변수는 수집기 서브넷이 인터넷 또는 NAT 송신이 아닌 인터페이스 VPC 엔드포인트를 통해 대상 서비스에 도달하는 경우에만 필요합니다. 엔드포인트는 com.amazonaws.region.aps-workspaces Amazon Managed Service for Prometheus 워크스페이스 대상 또는 CloudWatch 데이터 세트 대상com.amazonaws.region.monitoring용입니다.

관리형 Prometheus 수집기에 대한 보안 그룹을 구성하려면
  1. 수집기에 대한 전용 보안 그룹을 생성하고 그룹 ID를 캡처합니다.

    COLLECTOR_SG_ID=$(aws ec2 create-security-group \ --group-name "pcs-prometheus-collector" \ --description "Security group for managed Prometheus collector" \ --vpc-id "$VPC_ID" \ --query 'GroupId' \ --output text)
  2. 수집기의 보안 그룹에서 포트 6817의 TCP 트래픽을 허용하는 인바운드 규칙을 클러스터의 보안 그룹에 추가합니다. 이 규칙을 통해 수집기는 컨트롤러에서 Slurm 지표 엔드포인트를 스크레이프할 수 있습니다.

    --ip-permissions 양식을 사용하여 감사 가능성에 대한 규칙 설명을 포함합니다.

    aws ec2 authorize-security-group-ingress \ --group-id "$CLUSTER_SG_ID" \ --ip-permissions \ 'IpProtocol=tcp,FromPort=6817,ToPort=6817,UserIdGroupPairs=[{GroupId='"$COLLECTOR_SG_ID"',Description="Prometheus collector scrapes Slurm metrics"}]'

    또는 규칙 설명 없이 더 짧은 양식을 사용할 수 있습니다.

    aws ec2 authorize-security-group-ingress \ --group-id "$CLUSTER_SG_ID" \ --protocol tcp \ --port 6817 \ --source-group "$COLLECTOR_SG_ID"
  3. (선택 사항) 수집기의 보안 그룹에서 아웃바운드 트래픽을 잠급니다. 기본적으로 새로 생성된 보안 그룹은 모든 아웃바운드 트래픽을 허용합니다. 더 높은 보안 태세를 위해 명시적 전용 송신을 적용하려면 기본 모든 허용 규칙을 취소하고 수집기에 필요한 송신 규칙만 추가합니다.

    기본 allow-all 송신 규칙을 취소합니다.

    aws ec2 revoke-security-group-egress \ --group-id "$COLLECTOR_SG_ID" \ --ip-permissions '[{"IpProtocol":"-1","IpRanges":[{"CidrIp":"0.0.0.0/0"}]}]'

    수집기가 TCP 6817에서 컨트롤러에 도달할 수 있도록 명시적 송신 규칙을 추가합니다.

    aws ec2 authorize-security-group-egress \ --group-id "$COLLECTOR_SG_ID" \ --ip-permissions \ 'IpProtocol=tcp,FromPort=6817,ToPort=6817,UserIdGroupPairs=[{GroupId='"$CLUSTER_SG_ID"',Description="Egress to Slurm controller for metrics scraping"}]'

    지표 전송 대상(Amazon Managed Service for Prometheus 또는 CloudWatch)에 도달하기 위해 HTTPS(TCP 443)에 대한 명시적 송신 규칙을 추가합니다.

    aws ec2 authorize-security-group-egress \ --group-id "$COLLECTOR_SG_ID" \ --ip-permissions \ 'IpProtocol=tcp,FromPort=443,ToPort=443,IpRanges=[{CidrIp=0.0.0.0/0,Description="HTTPS egress for metrics delivery"}]'

    전송을 위해 VPC 엔드포인트를 사용하는 서브넷을 더 엄격하게 제어하려면 CIDR 범위를 VPC 엔드포인트의 보안 그룹으로 바꿉니다.

    aws ec2 authorize-security-group-egress \ --group-id "$COLLECTOR_SG_ID" \ --ip-permissions \ 'IpProtocol=tcp,FromPort=443,ToPort=443,UserIdGroupPairs=[{GroupId='"$VPCE_SG_ID"',Description="HTTPS egress to VPC endpoint for metrics delivery"}]'
    참고

    기본 송신 규칙을 취소하지 않은 경우이 단계를 건너뛸 수 있습니다. 기본 규칙은 포트 6817 및 포트 443에 대한 트래픽을 포함하여 모든 아웃바운드 트래픽을 이미 허용합니다.

  4. (분리된 클러스터) 수집기 서브넷에 인터넷 액세스 권한이 없고 인터페이스 VPC 엔드포인트를 사용하여 대상 서비스에 도달하는 경우 VPC 엔드포인트의 보안 그룹에 인바운드 규칙을 추가합니다. 이 규칙을 사용하면 수집기의 HTTPS 트래픽이 엔드포인트 네트워크 인터페이스에 도달할 수 있습니다. 이는 일반적으로 놓치는 단계입니다.

    aws ec2 authorize-security-group-ingress \ --group-id "$VPCE_SG_ID" \ --ip-permissions \ 'IpProtocol=tcp,FromPort=443,ToPort=443,UserIdGroupPairs=[{GroupId='"$COLLECTOR_SG_ID"',Description="Managed collector reaches service endpoint"}]'
참고

더 간단하지만 덜 제한적인 대안으로, 해당 보안 그룹에 자체 트래픽을 허용하는 자체 참조 규칙이 포함된 경우 컨트롤러의 기존 보안 그룹을 수집기에 연결할 수 있습니다. 이렇게 하면 전용 그룹을 생성하지 않고도 연결 요구 사항이 충족됩니다.

예를 들어 클러스터의 보안 그룹(sg-0abc1234def56789a)이 이미 자체의 모든 TCP 트래픽을 허용하는 경우 스크레이퍼를 생성할 때 --security-group-ids 파라미터에 해당 보안 그룹 ID를 전달합니다.

aws amp create-scraper \ --source '{"vpcConfiguration":{"subnetIds":["subnet-id-1","subnet-id-2"],"securityGroupIds":["sg-0abc1234def56789a"]}}' \ ...

그러나 이전 절차에서 설명한 전용 보안 그룹 접근 방식은 명시적이고 감사 가능한 규칙을 통해 더 높은 보안 기준을 제공합니다.

보안 그룹 규칙에 대한 자세한 내용은 Amazon VPC 사용 설명서의 보안 그룹 규칙을 참조하세요.

관리형 수집기 생성

AWS CLI 를 사용하여 클러스터 컨트롤러를 스크레이프하고 선택한 대상으로 지표를 전송하는 VPC 연결 관리형 수집기를 생성합니다.

Slurm 지표에 대한 관리형 수집기를 생성하려면
  1. 스크레이프 구성을 라는 로컬 YAML 파일에 저장합니다scrape-config.yaml. 제안된 구성은 섹션을 참조하세요제안된 스크레이프 구성.

  2. create-scraper-input.json 다음 구조를 사용하여 라는 JSON 입력 파일을 생성합니다. 대상과 일치하는 destination 블록을 선택합니다.

    { "source": { "vpcConfiguration": { "subnetIds": ["subnet-1", "subnet-2"], "securityGroupIds": ["sg-collector"] } }, "destination": { ... }, "scrapeConfiguration": { "configurationBlob": "raw-yaml-contents" } }

    다음과 같이 바꿉니다.

    • subnet-1 및 subnet-2 - 클러스터 컨트롤러와 동일한 VPC 내의 서로 다른 가용 영역에 있는 두 개 이상의 서브넷 IDs입니다.

    • sg-collector - 관리형 수집기의 보안 그룹 ID입니다.

    • raw-yaml-contents - scrape-config.yaml 파일의 전체 텍스트로, 단일 JSON 문자열 값으로 붙여넣습니다. base64는 AWS CLI 와이어의 값을 자동으로 인코딩합니다.

    destination 필드에는 다음 중 하나를 사용합니다.

    대상: Amazon Managed Service for Prometheus 워크스페이스

    "destination": { "ampConfiguration": { "workspaceArn": "arn:aws:aps:region:account-id:workspace/workspace-id" } }

    대상: CloudWatch 데이터 세트

    "destination": { "cloudWatchConfiguration": { "datasetArn": "arn:aws:cloudwatch:region:account-id:dataset/default" } }

    전체 파라미터 세트는 AWS CLI 명령 참조의 create-scraper를 참조하세요.

  3. 스크레이퍼를 생성합니다.

    aws amp create-scraper --cli-input-json file://create-scraper-input.json

    명령은 scraperId 및 상태를 반환합니다CREATING.

  4. 스크레이퍼 상태가 로 변경될 때까지 기다립니다ACTIVE(일반적으로 5~15분).

    aws amp describe-scraper --scraper-id scraper-id

    scraper-id를 이전 단계에서 반환된 ID로 바꿉니다. 스크레이퍼는 ACTIVE 상태에 도달할 때까지 삭제할 수 없습니다.

클러스터 컨트롤러 엔드포인트 찾기

스크레이프 구성에는 AWS PCS 클러스터 컨트롤러의 프라이빗 IP 주소가 필요합니다. 다음 방법 중 하나를 사용하여 찾습니다.

AWS Management Console
  1. https://console.aws.amazon.com/pcs/ AWS PCS 콘솔을 엽니다.

  2. 목록에서 클러스터를 선택합니다.

  3. 클러스터 구성 세부 정보에서 엔드포인트 섹션을 찾습니다.

  4. Slurm 컨트롤러(slurmctld)의 프라이빗 IP 주소와 포트를 기록해 둡니다. 포트는 6817입니다.

AWS CLI
  1. 다음 명령을 실행합니다. cluster-identifier를 클러스터 이름 또는 ID로 바꿉니다.

    aws pcs get-cluster --cluster-identifier cluster-identifier

    응답에서 endpoints 배열의 SLURMCTLD 항목을 찾습니다. privateIpAddress 값은 스크레이프 구성에 필요한 컨트롤러 엔드포인트입니다. 다음 예를 참고하세요

    "endpoints": [ { "type": "SLURMCTLD", "privateIpAddress": "192.0.2.1", "port": "6817" }, { "type": "SLURMRESTD", "privateIpAddress": "192.0.2.1", "port": "6820" } ]

    SLURMCTLD 항목(포트 6817)privateIpAddress의를 스크레이프 구성의 컨트롤러 엔드포인트 값으로 사용합니다.

  2. 또는 컨트롤러 IP 주소만 직접 추출합니다.

    aws pcs get-cluster --cluster-identifier cluster-identifier \ --query 'cluster.endpoints[?type==`SLURMCTLD`].privateIpAddress' \ --output text

제안된 스크레이프 구성

다음 YAML 구성은 클러스터 컨트롤러에서 4개의 Slurm 지표 엔드포인트(작업, 노드, 스케줄러 및 파티션)를 스크레이프합니다. 각 엔드포인트는 별도의 작업으로 정의되므로 쿼리에서 소스별로 지표를 식별할 수 있습니다.

global: scrape_interval: 60s scrape_timeout: 30s scrape_configs: - job_name: 'slurm-jobs' metrics_path: /metrics/jobs static_configs: - targets: - 'controller-endpoint:6817' relabel_configs: - target_label: cluster replacement: 'my-cluster-name' - job_name: 'slurm-nodes' metrics_path: /metrics/nodes static_configs: - targets: - 'controller-endpoint:6817' relabel_configs: - target_label: cluster replacement: 'my-cluster-name' - job_name: 'slurm-scheduler' metrics_path: /metrics/scheduler static_configs: - targets: - 'controller-endpoint:6817' relabel_configs: - target_label: cluster replacement: 'my-cluster-name' - job_name: 'slurm-partitions' metrics_path: /metrics/partitions static_configs: - targets: - 'controller-endpoint:6817' relabel_configs: - target_label: cluster replacement: 'my-cluster-name'

다음과 같이 바꿉니다.

  • 컨트롤러 엔드포인트 - AWS PCS 클러스터 컨트롤러의 프라이빗 IP 주소입니다. 이 값을 찾는 방법에 대한 지침은 섹션을 참조하세요클러스터 컨트롤러 엔드포인트 찾기.

  • my-cluster-name - 클러스터를 식별하는 레이블입니다. relabel_configs 블록은이 스크레이퍼의 모든 지표에 cluster 레이블을 찍습니다. 항상 cluster 레이블에서 쿼리를 필터링합니다. 레이블에 스탬프를 찍지 않은 스크레이퍼의 시리즈는 만료될 때까지 레이블이 지정되지 않은 중복 시리즈로 표시됩니다.

관리scrape_interval형 수집기의 최소값은 30초입니다. 이 구성은 스크레이핑이 Slurm 컨트롤러(slurmctld)에 부하를 가하기 때문에 60초를 사용합니다. 지표 쿼리는 내부 잠금을 획득하고 메모리 내 데이터 구조를 읽습니다. 이 활동은 사용 중인 클러스터의 스케줄러 성능에 영향을 미칠 수 있습니다. 지표 가이드에서는 성능 영향을 최소화하기 위해 Slurm 스크레이프 간격을 60~120초로 권장합니다.

참고

이 구성에는 /metrics/jobs-users-accts 엔드포인트가 포함되지 않습니다. Slurm 설명서에서는이 엔드포인트가 무한한 수의 시리즈를 생성하고 저장된 모니터링에 적합하지 않다고 경고합니다. 모든 하위 엔드포인트 데이터를 단일 응답으로 결합하므로 베어 /metrics 인덱스도 스크레이프하지 마세요.

지원되는 스크레이프 구성 옵션에 대한 자세한 내용은 Amazon CloudWatch 사용 설명서의 스크레이퍼 구성을 참조하세요.

지표 전송 확인

스크레이퍼가 ACTIVE 상태에 도달하면 첫 번째 데이터 포인트가 약 한 번의 스크레이프 간격에 전송 시간을 더한 후 나타납니다. 대상과 일치하는 확인 방법을 사용합니다.

Amazon Managed Service for Prometheus 워크스페이스로 전송 확인

SigV4-signed 요청을 전송하여 워크스페이스에서 사용 가능한 지표 이름을 나열합니다.

awscurl --service aps --region region \ "https://aps-workspaces.region.amazonaws.com/workspaces/workspace-id/api/v1/label/__name__/values"

호출 보안 주체는 aps:QueryMetrics 및 aps:GetLabels 권한(또는 AmazonPrometheusQueryAccess 관리형 정책)이 필요합니다.

CloudWatch 데이터 세트로 전송 확인

SigV4-signed 요청을 보내 CloudWatch 데이터 세트에서 사용 가능한 지표 이름을 나열합니다.

awscurl --service monitoring --region region \ "https://monitoring.region.amazonaws.com/api/v1/label/__name__/values"

호출 보안 주체에는 cloudwatch:GetMetricData 및 cloudwatch:ListMetrics 권한이 필요합니다.

중요

CloudWatch 데이터 세트에 전달된 지표는 OpenTelemetry(OTel) 지표로 저장됩니다. 클래식 CloudWatch Metrics 네임스페이스 브라우저 또는의 출력에는 표시되지 않습니다aws cloudwatch list-metrics. 를 사용하여 쿼리해야 합니다PromQL.

어느 대상이든 , slurm_nodes slurm_jobs_running또는 slurm_와 같이 로 시작하는 지표 이름을 찾습니다slurm_node_cpus. Slurm 지표가 표시되지 않으면 다음을 확인합니다.

  • 스크레이퍼 상태는 입니다ACTIVE.

  • 보안 그룹 규칙을 사용하면 수집기가 컨트롤러의 포트 6817에 도달할 수 있습니다.

  • Slurm 지표 엔드포인트는 클러스터에서 활성화됩니다.

를 사용하여 Slurm 지표 쿼리 PromQL

를 사용하여 수집된 Slurm 지표를 쿼리합니다PromQL. 두 대상에 대해 동일한 쿼리가 작동합니다. 쿼리 방법은 지표를 전달한 위치에 따라 달라집니다.

Amazon Managed Service for Prometheus 워크스페이스 쿼리

  • HTTP API SigV4-signed 요청(서비스 이름 aps)을 https://aps-workspaces.region.amazonaws.com/workspaces/workspace-id/api/v1/query 또는 로 전송합니다/api/v1/query_range.

  • Grafana - SigV4 인증 및 서비스 이름이 인 Prometheus 데이터 소스를 추가합니다aps. 를 사용한 쿼리에 대한 지침은 Amazon Managed Service for Prometheus 사용 설명서의 Grafana를 사용한 쿼리를 Grafana참조하세요.

다음 예제에서는 awscurl를 사용하여 Amazon Managed Service for Prometheus 워크스페이스에서 실행 중인 작업을 쿼리합니다.

awscurl --service aps --region region \ -X POST "https://aps-workspaces.region.amazonaws.com/workspaces/workspace-id/api/v1/query" \ -H "Content-Type: application/x-www-form-urlencoded" \ -d "query=slurm_jobs_running"

호출 보안 주체에는 aps:QueryMetrics, aps:GetMetricMetadataaps:GetSeries, 및 aps:GetLabels 권한(또는 AmazonPrometheusQueryAccess 관리형 정책)이 필요합니다.

CloudWatch 데이터 세트 쿼리

  • CloudWatch 콘솔 - CloudWatch를 열고 Query Studio를 선택한 다음 쿼리 언어 메뉴에서 PromQL을 선택합니다.

  • HTTP API SigV4-signed 요청(서비스 이름 monitoring)을 https://monitoring.region.amazonaws.com/api/v1/query 또는 로 전송합니다/api/v1/query_range.

  • Grafana - URL https://monitoring.region.amazonaws.com, SigV4 인증 및 서비스 이름를 사용하여 Prometheus 데이터 소스를 추가합니다monitoring. PromQL에서를 사용하여 CloudWatch 지표를 쿼리하는 방법에 대한 지침은 Amazon Managed Grafana 사용 설명서의 Grafana에서 PromQL을 사용하여 CloudWatch 지표 쿼리를 Grafana참조하세요.

다음 예제에서는 awscurl를 사용하여 CloudWatch 데이터 세트에서 실행 중인 작업을 쿼리합니다.

awscurl --service monitoring --region region \ -X POST "https://monitoring.region.amazonaws.com/api/v1/query" \ -H "Content-Type: application/x-www-form-urlencoded" \ -d "query=slurm_jobs_running"

호출 보안 주체에는 cloudwatch:GetMetricData 및 cloudwatch:ListMetrics 권한이 필요합니다.

PromQL 쿼리 예제

다음 쿼리는 두 대상에 대해 작동합니다. my-cluster-name을 스크레이프 구성의 cluster 재레이블에 설정한 값으로 바꿉니다.

CPU 사용률(%)
100 * slurm_node_cpus_alloc{cluster="my-cluster-name"} / slurm_node_cpus{cluster="my-cluster-name"}
대기 중인 작업(대기열 백로그)
slurm_jobs_pending{cluster="my-cluster-name"}
작업 실행
slurm_jobs_running{cluster="my-cluster-name"}
작업 처리량
slurm_jobs_completed{cluster="my-cluster-name"}

사용 가능한 지표 및 스크레이핑 구성에 대한 자세한 내용은 Slurm 웹 사이트의 지표 가이드를 참조하세요.