RoboDojo π0.5 checkpoints

这是 cjgogo 在 RoboDojo 数据上训练的 π0.5 JAX/Orbax checkpoint 集合。仓库同时保留模型参数、优化器/训练状态、归一化统计和 Orbax 元数据,因此既可用于推理,也可用于兼容配置下的断点续训。

安全提示: 真机 checkpoint 目前只完成训练与离线验证。本仓库不代表已经完成真机闭环安全验证。未经独立限位、急停、低速和工作空间检查,不得直接向机械臂发送动作。

Checkpoint 一览

路径 类型 Step 大小(约) 说明
checkpoints/sim-10task/9000 π0.5 全量微调 9,000 42 GB 10 个仿真任务的中间 checkpoint,约 5.43 epochs
checkpoints/sim-10task/14077 π0.5 全量微调 14,077 42 GB 原计划终点,约 8.5 epochs
checkpoints/sim-10task/15000 π0.5 全量微调续训 15,000 42 GB 从 14,077 继续训练,约 9.06 epochs
checkpoints/real-piper6-lora/3000 π0.5 JAX LoRA 3,000 9 GB PiPER 六任务中间 checkpoint
checkpoints/real-piper6-lora/6000 π0.5 JAX LoRA 6,000 9 GB PiPER 六任务中间 checkpoint
checkpoints/real-piper6-lora/7594 π0.5 JAX LoRA 7,594 9 GB PiPER 六任务最终 checkpoint,约 8 epochs

没有发布以下目录:

  • RoboDojo-sim-arx_x5-joint-0/59999:训练基座,不是本轮训练产物。
  • 17077.orbax-checkpoint-tmp-4:未完成的 Orbax 临时目录。

详细机器可读参数见 metadata/checkpoints.json

仿真 10 任务训练

训练数据来自 RoboDojo_lerobot_v30_video,按官方 34 个带演示任务的类别比例选择 10 个任务:

  • Generalization:fold_clothesmake_toaststack_blocksstack_bowls
  • Memory:press_by_numberswap_blocks
  • Precision:deposit_coinplug_in_charger
  • Long-Horizon:classify_objectsorganize_table

关键参数:

  • 基座:RoboDojo-sim-arx_x5-joint-0/59999
  • OpenPI config:pi05_base_aloha_full_sim_arx-x5_seed_0
  • 数据:1,000 episodes,423,985 frames
  • 动作:ARX X5 双臂 14 维 joint action
  • 图像:头部、左腕、右腕三个相机
  • global batch size:256
  • 训练:8 张 H200,JAX FSDP
  • seed:0
  • 优化器:AdamW;gradient clip norm 1.0
  • 学习率:1e-5 peak,1e-6 final,1,408 warmup steps
  • 保存间隔:3,000 steps

目前的 stack_bowls 单 episode smoke 表明三个仿真 checkpoint 均能生成有效结果、视频和 telemetry;这不是完整 RoboDojo 排行榜成绩。正式多任务评测结果应在完成后另行发布,不能用 smoke 成功率代替正式成功率。

PiPER 六任务真机 LoRA

只使用 RoboDojo 官方 PiPER 数据:

fill_pen_holderput_objects_into_basketstack_and_cover_blocksstack_bowlsstand_up_bottlesinsert_charger

关键参数:

  • 基座:gs://openpi-assets/checkpoints/pi05_base/params
  • OpenPI config:pi05_base_piper6_lora_real
  • 模型:Pi0Config(pi05=True, paligemma_variant="gemma_2b_lora", action_expert_variant="gemma_300m_lora")
  • LoRA freeze filter:由同一个 Pi0Configget_freeze_filter() 生成
  • total parameters:3,403,421,440
  • trainable parameters:466,957,056
  • ema_decay=Noneadapt_to_pi=False
  • 600 episodes;每任务前 90 条训练、后 10 条验证
  • 训练 frames:486,037;global batch size:512;目标 7,595 steps
  • 训练数据保持审核后的 30 Hz,不静默重采样到 25 Hz
  • 状态/动作顺序:左臂 6 关节、左夹爪、右臂 6 关节、右夹爪
  • 只对关节使用 delta action;夹爪保持 absolute action
  • 相机映射:head→cam_high,left wrist→cam_left_wrist,right wrist→cam_right_wrist

最终 step 7,594 的离线 held-out 指标:validation loss 0.03263、physical flow MSE 0.00898、normalized action MAE 0.07485。它们只衡量离线验证集,不等价于真机任务成功率。

下载

安装最新版 Hugging Face CLI:

python -m pip install -U "huggingface_hub[hf_xet]"

只下载一个 checkpoint:

hf download cjgogo/RoboDojo-pi05-checkpoints \
  --include "checkpoints/sim-10task/14077/**" \
  --local-dir ./RoboDojo-pi05-checkpoints

下载全部内容:

hf download cjgogo/RoboDojo-pi05-checkpoints \
  --local-dir ./RoboDojo-pi05-checkpoints

使用 OpenPI 推理

使用与训练一致的 OpenPI/XPolicyLab 版本。checkpoint 必须保留整个目录结构,不能只复制某个 ocdbt 文件。

仿真 checkpoint 示例:

cd /path/to/openpi
uv run scripts/serve_policy.py policy:checkpoint \
  --policy.config=pi05_base_aloha_full_sim_arx-x5_seed_0 \
  --policy.dir=/absolute/path/RoboDojo-pi05-checkpoints/checkpoints/sim-10task/14077

PiPER LoRA 示例:

cd /path/to/openpi
# 将 metadata/openpi_config_piper6.py 中的 PiPER config 合并到相同版本的
# src/openpi/training/config.py,然后启动:
uv run scripts/serve_policy.py policy:checkpoint \
  --policy.config=pi05_base_piper6_lora_real \
  --policy.dir=/absolute/path/RoboDojo-pi05-checkpoints/checkpoints/real-piper6-lora/7594

若使用 XPolicyLab,可以把下载后的 step 目录作为 ckpt_name 的绝对路径传给 setup_eval_policy_server.sh。仿真端仍应使用 RoboDojo 官方任务定义、native episode 数和原生成功判定。

断点续训

每个目录都包含 train_state,可在训练代码与配置兼容时使用 --resume。续训前必须保持:

  • 相同的 OpenPI 模型结构与 Orbax/JAX 兼容版本;
  • 相同的数据字段、相机映射、action semantics 和 normalization asset id;
  • 与 checkpoint 对应的 config;
  • 完整的 _CHECKPOINT_METADATAparamstrain_stateassets

许可与归属

  • OpenPI 代码采用 Apache-2.0,见 licenses/LICENSE_OPENPI
  • 模型包含/派生自 Gemma,受 Gemma Terms of Use 和 Prohibited Use Policy 约束,见 licenses/LICENSE_GEMMANOTICE
  • RoboDojo 代码、任务和数据仅限非商业研究、教育与评测,见 licenses/LICENSE_ROBODOJO
  • 本仓库公开可见不等于允许商业使用,也不取消上述第三方限制。

引用

请同时引用 Physical Intelligence 的 π0/π0.5 工作以及 RoboDojo 项目。完整引用格式请以各自官方仓库的最新说明为准。

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Dataset used to train cjgogo/RoboDojo-pi05-checkpoints