

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 问题排查
<a name="troubleshooting"></a>

以下步骤和提示可以帮助您解决与 Deadl AWS ine Cloud 农场和资源有关的问题。

**Topics**
+ [为什么用户看不到我的农场、舰队或队列？](#troubleshooting_user_not_seeing_farm)
+ [为什么工人不接我的工作？](#troubleshooting_workers_not_picking_jobs)
+ [为什么我的工作人员一直无法运行？](#troubleshooting_worker_stuck_running)
+ [对截止日期云任务疑难解](#jobs-troubleshooting)
+ [截止日期云监控器桌面应用程序日志](#troubleshooting-desktop-logs)
+ [其他资源](#troubleshooting_additional_resources)

## 为什么用户看不到我的农场、舰队或队列？
<a name="troubleshooting_user_not_seeing_farm"></a>

### 用户访问权限
<a name="troubleshooting_user_access"></a>

当您的用户在 Deadline Cloud 监视器中看不到您的农场、舰队或队列时，他们对您的农场和资源的访问权限可能会出现问题。

无法访问任何农场的用户会在 Deadline Cloud 监视器中收到 “没有可用的农场” 消息。

**确认您为农场、车队或队列分配了正确的用户或群组**

1. 在 De AWS adline Cloud 控制台中，找到您的农场、舰队或队列，然后选择**访问管理**。

1. 默认情况下，群组选项卡处于选中状态。如果您按群组分配权限（建议这样做），则您的群组应显示在列表中并具有已分配的访问级别。

   如果该群组不在列表中，请选择**添加群组**为该群组分配权限。

1. 如果您要按用户分配权限，请选择 “**用户**” 选项卡。您的用户应显示在列表中并分配访问级别。

   如果您的用户不在列表中，请选择**添加用户**为该用户分配权限。

**确认您已将用户分配到您的群组**

1. 在 De AWS adline Cloud 控制台中，找到您的农场、舰队或队列，然后选择**访问管理**。

1. 默认情况下，群组选项卡处于选中状态。选择群组名称以查看其成员。

1. 如果用户未在群组中列出，则必须添加他们。

   如果您使用默认身份设置，则可以直接在 Identity Center 控制台中将用户添加到群组。如果您连接到外部身份提供商，例如Okta或Google Workspace，则可以将用户添加到身份提供商的群组中。
**注意**  
一些外部身份提供商将用户同步到身份中心，但不同步群组。在这种情况下，可以考虑直接向用户分配权限，而不是按组分配权限。

有关管理用户对 Deadline Cloud 访问权限的更多信息，请参阅[在 Deadline 云中管理用户](managing-users.md)。

## 为什么工人不接我的工作？
<a name="troubleshooting_workers_not_picking_jobs"></a>

### 舰队角色配置
<a name="troubleshooting_workers_fleet_role_config"></a>

有时，当创建了工作人员但没有完成初始化并且没有开始处理任务时，这是因为队列角色配置不正确。

要验证此原因，请检查您的 CloudTrail 日志中是否存在任何访问被拒绝的错误。确认访问被拒绝问题后，前往您的队列并将角色配置更新为正确的权限。有关更多信息，请参阅 Deadline Cloud 开发者指南[中的](https://docs.aws.amazon.com/deadline-cloud/latest/developerguide/logging-using-cloudtrail.html)CloudTrail日志。

## 为什么我的工作人员一直无法运行？
<a name="troubleshooting_worker_stuck_running"></a>

### 工作人员无法退出 OpenJD 环境
<a name="troubleshooting_worker_fleet_role_config"></a>

工作人员可能会陷入长时间运行的`envExit`会话操作中。如果您使用的作业模板覆盖 OpenJD 模板并将环境退出操作超时设置为超过 5 分钟，则可能会出现此问题。Deadline Cloud 监视器为陷入这种情况的工作人员提供了一些可见性，但它需要将`RUNNING`工作人员与关联队列中的可用工作进行交叉引用。

要找到卡住的员工，请在 Deadline Cloud 监视器中查看所有队列并完成以下步骤：

1. 在工作人员状态列中，查找`RUNNING`工作人员。

1. 在舰队详细信息部分，导航到每个关联队列。

1. 在每个关联队列中，搜索`RUNNING``READY`、或的作业`PENDING`。如果所有关联队列都没有任何处于这些状态的任务，则该工作人员正在运行环境退出。

要阻止处于此状态的工作人员，请使用以下 AWS CLI 命令：

```
aws deadline update-worker \
    --farm-id $FARM_ID     \
    --fleet-id $FLEET_ID   \
    --worker-id $WORKER_ID \
    --status STOPPED
```

运行命令后，工作器代理会在程序退出时重新启动。然后，工作人员返回联机状态，从关联队列中运行更多作业。如果队列包含更多环境退出操作超时时间超过 5 分钟的作业，则该工作人员将再次陷入困境。如果发生这种情况，你将需要重复这个过程，直到不再有工作人员被困在退出为止。

为避免此问题，请在使用作业模板时将超时选项设置为不超过 5 分钟。

## 对截止日期云任务疑难解
<a name="jobs-troubleshooting"></a>

有关 Deadl AWS ine Cloud 中作业的常见问题的信息，请参阅以下主题。

### 为什么创建我的任务失败了？
<a name="troubleshooting-create-failed"></a>

#### 配额验证
<a name="troubleshooting-quota-validation"></a>

作业可能无法通过验证检查的一些可能原因包括：
+ 作业模板不遵循 OpenJD 规范。
+ 该任务包含太多步骤。
+ 该任务总共包含太多任务。
+ 出现内部服务错误，导致无法创建作业。

要查看任务中最大步骤和任务数的配额，请使用服务配额控制台。有关更多信息，请参阅 [的配额 Deadline Cloud](deadline-cloud-quotas.md)。

#### CHUNK [INT] 任务参数错误
<a name="troubleshooting-task-chunking-extension"></a>

如果任务创建失败并显示以下错误消息，则需要将`TASK_CHUNKING`扩展程序添加到作业模板中。

```
The CHUNK[INT] task parameter requires the TASK_CHUNKING extension.
```

要解决此问题，请将以下内容添加到您的作业模板中：

```
extensions:
  - TASK_CHUNKING
```

有关更多信息，请参阅 [ Deadl *AWS ine Cloud 开发者指南*](https://docs.aws.amazon.com/deadline-cloud/latest/developerguide/build-job-bundle-chunking-add.html)中的向作业模板添加任务分块。

### 为什么我的工作不兼容？
<a name="troubleshooting-not-compatible"></a>

任务与队列不兼容的常见原因包括：
+ 没有队列与提交任务的队列相关联。打开 Deadline Cloud 监视器，检查队列中是否有相关的队列。有关如何查看队列的更多信息，请参阅[在 Deadline Cloud 中查看队列和舰队详细信息](view-queue-and-fleet.md)。
+ 与队列相关的任何舰队都不满足该任务的主机要求。要进行检查，请将作业模板中的`hostRequirements`条目与农场中舰队的配置进行比较。确保其中一支舰队满足宿主要求。有关舰队兼容性的更多信息，请参阅[确定舰队兼容性](https://docs.aws.amazon.com/deadline-cloud/latest/developerguide/build-jobs-scheduling.html#jobs-scheduling-compatibility)。要查看舰队配置，请参阅[在 Deadline Cloud 中查看队列和舰队详细信息](view-queue-and-fleet.md)。

Deadline Cloud 会在您提交任务时检查兼容性。如果您稍后将兼容队列与队列相关联，则现有`NOT_COMPATIBLE`任务不会自动重启。要运行这些作业，请重新对它们进行重新排序。有关更多信息，请参阅 [重新申请工作](view-a-job.md#view-jobs-steps-tasks-requeue)。

### 为什么我的工作准备就绪？
<a name="troubleshooting-stuck-ready"></a>

你的工作似乎停滞在该`READY`州的可能原因包括：
+ 与队列关联的队列的最大工作人员数设置为零。要检查，请参阅[在 Deadline Cloud 中查看队列和舰队详细信息](view-queue-and-fleet.md)。
+ 队列中有更高优先级的作业。要检查，请参阅[在 Deadline Cloud 中查看队列和舰队详细信息](view-queue-and-fleet.md)。
+ 对于客户管理的队列，请检查自动扩展配置。有关更多信息，请参阅《*截止日期云开发人员指南》[中的使用 Amazon EC2 Auto Scaling 组](https://docs.aws.amazon.com/deadline-cloud/latest/developerguide/create-auto-scaling.html)创建队列基础设施*。

### 为什么我的工作失败了？
<a name="troubleshooting-job-failed"></a>

一项工作失败的原因可能有很多。要搜索问题，请打开 Deadline Cloud 监视器并选择失败的作业。选择失败的任务，然后查看该任务的日志。有关说明，请参阅[在 Deadline Cloud 中查看会话和工作人员日志](view-logs.md)。
+ 如果您看到许可证错误，或者由于软件没有有效许可证而出现水印，请确保工作人员可以连接到所需的许可证服务器。有关更多信息，请参阅 Deadl * ine Cloud 开发人员指南[中的](https://docs.aws.amazon.com/deadline-cloud/latest/developerguide/cmf-ubl.html)将客户管理的队列连接到许可证端点。*
+ 最后的会话操作消息或进程退出代码可能会提供有关任务失败原因的信息。如果您正在使用Windows且退出代码为负数，请尝试搜索退出代码的未签名版本：

  ```
  2,147,483,647 - |{{your exit code}}|
  ```

### 为什么我的步骤处于待处理状态？
<a name="troubleshooting-pending-failed"></a>

当一个或多个依赖项未完成时，步骤可能会保持`PENDING`状态。你可以使用截止日期云监控器检查依赖关系的状态。有关说明，请参阅[在 Deadline Cloud 中查看步骤](view-a-step.md)。

## 截止日期云监控器桌面应用程序日志
<a name="troubleshooting-desktop-logs"></a>

Deadline Cloud 监控器桌面应用程序会写入诊断日志，您可以使用这些日志来调查崩溃或其他意外行为。报告桌面应用程序问题时，请包括相关的日志文件以帮助诊断。

日志文件的位置取决于您的操作系统：

Windows  

```
%APPDATA%\com.amazonaws.deadline.monitor\logs
```

macOS  

```
~/Library/Logs/com.amazonaws.deadline.monitor/
```

Linux  

```
~/.config/com.amazonaws.deadline.monitor/logs
```

## 其他资源
<a name="troubleshooting_additional_resources"></a>

您可以在上找到更多信息和资源[GitHub](https://github.com/aws-deadline)。