View a markdown version of this page

Deadline Cloud で MuJoCo を使用してロボット操作ポリシーをトレーニングする - Deadline クラウド

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Deadline Cloud で MuJoCo を使用してロボット操作ポリシーをトレーニングする

mujoco_sim_to_policy ジョブバンドルは、Strands Robots so100 arm の MuJoCo シミュレーションを使用して、Deadline Cloud で学習したロボット操作ポリシーをトレーニングおよびレンダリングします。ジョブは、マネージド GPU ワーカーに対して 3 つの依存ステップを実行します。

  1. Datagen — MuJoCo のキューブのスクリプト化されたジョイントスペースの選択。LeRobot データセットとして記録されます。各エピソードは立方体の高さチェックによって検証され、失敗した場合は破棄されます。

  2. トレーニング — 生成されたデータセット (CUDA) の LeRobot ACT ポリシーを微調整します。

  3. レンダリング — 微調整されたポリシーで MuJoCo ロールアウトを駆動し、結果を MP4 ビデオフレームと PNG フレームとして記録します。

バンドルには、Linux x86_64 GPU フリート (EGL を介してヘッドレスにレンダリングし、CUDA でトレーニングするステップ) と、 CondaPackages および CondaChannelsジョブパラメータを使用する conda キュー環境が必要です。デフォルトの conda パッケージは python=3.12 pip git ffmpegにありますconda-forge

job_bundles ディレクトリから、ジョブを送信します。

OUT="$(pwd)/output"; mkdir -p "$OUT" deadline bundle submit mujoco_sim_to_policy -p "OutputDir=$OUT" --yes