View a markdown version of this page

在 Deadline Cloud MuJoCo 上训练机器人操作策略 - 截止日期云

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

在 Deadline Cloud MuJoCo 上训练机器人操作策略

网站上的 mujoco_sim_to_policy任务包使用 GitHub 网站上对Strands Robots so100的模拟,在截止日期云上训练和呈现已学的机器人操纵策略。 MuJoCo MuJoCo 该任务在托管 GPU 工作器上运行三个依赖步骤:

  1. Datagen — 使用脚本在联合空间中选取立方体 MuJoCo,记录为数据集。 LeRobot 每集都经过立方体高度检查验证,如果失败则丢弃。

  2. 训练 — 在生成的数据集 (CUDA) 上微调一个 LeRobot ACT 策略。

  3. 渲染 — 利用微调政策推动 MuJoCo推广,并将结果记录为 MP4 视频和 PNG 帧。

该捆绑包需要一个 Linux x86_64 GPU 队列(步骤通过 EGL 呈现无头状态并在 CUDA 上训练)和一个消耗和作业参数的 conda 队列环境。CondaPackages CondaChannels默认 conda 软件包处于启用状态python=3.12 pip git ffmpeg。conda-forge

从job_bundles目录中提交作业:

OUT="$(pwd)/output"; mkdir -p "$OUT" deadline bundle submit mujoco_sim_to_policy -p "OutputDir=$OUT" --yes