RoboDojo π0.5 checkpoints
这是 cjgogo 在 RoboDojo 数据上训练的 π0.5 JAX/Orbax checkpoint 集合。仓库同时保留模型参数、优化器/训练状态、归一化统计和 Orbax 元数据,因此既可用于推理,也可用于兼容配置下的断点续训。
安全提示: 真机 checkpoint 目前只完成训练与离线验证。本仓库不代表已经完成真机闭环安全验证。未经独立限位、急停、低速和工作空间检查,不得直接向机械臂发送动作。
Checkpoint 一览
| 路径 | 类型 | Step | 大小(约) | 说明 |
|---|---|---|---|---|
checkpoints/sim-10task/9000 |
π0.5 全量微调 | 9,000 | 42 GB | 10 个仿真任务的中间 checkpoint,约 5.43 epochs |
checkpoints/sim-10task/14077 |
π0.5 全量微调 | 14,077 | 42 GB | 原计划终点,约 8.5 epochs |
checkpoints/sim-10task/15000 |
π0.5 全量微调续训 | 15,000 | 42 GB | 从 14,077 继续训练,约 9.06 epochs |
checkpoints/real-piper6-lora/3000 |
π0.5 JAX LoRA | 3,000 | 9 GB | PiPER 六任务中间 checkpoint |
checkpoints/real-piper6-lora/6000 |
π0.5 JAX LoRA | 6,000 | 9 GB | PiPER 六任务中间 checkpoint |
checkpoints/real-piper6-lora/7594 |
π0.5 JAX LoRA | 7,594 | 9 GB | PiPER 六任务最终 checkpoint,约 8 epochs |
没有发布以下目录:
RoboDojo-sim-arx_x5-joint-0/59999:训练基座,不是本轮训练产物。17077.orbax-checkpoint-tmp-4:未完成的 Orbax 临时目录。
详细机器可读参数见 metadata/checkpoints.json。
仿真 10 任务训练
训练数据来自 RoboDojo_lerobot_v30_video,按官方 34 个带演示任务的类别比例选择 10 个任务:
- Generalization:
fold_clothes、make_toast、stack_blocks、stack_bowls - Memory:
press_by_number、swap_blocks - Precision:
deposit_coin、plug_in_charger - Long-Horizon:
classify_objects、organize_table
关键参数:
- 基座:
RoboDojo-sim-arx_x5-joint-0/59999 - OpenPI config:
pi05_base_aloha_full_sim_arx-x5_seed_0 - 数据:1,000 episodes,423,985 frames
- 动作:ARX X5 双臂 14 维 joint action
- 图像:头部、左腕、右腕三个相机
- global batch size:256
- 训练:8 张 H200,JAX FSDP
- seed:0
- 优化器:AdamW;gradient clip norm 1.0
- 学习率:1e-5 peak,1e-6 final,1,408 warmup steps
- 保存间隔:3,000 steps
目前的 stack_bowls 单 episode smoke 表明三个仿真 checkpoint 均能生成有效结果、视频和 telemetry;这不是完整 RoboDojo 排行榜成绩。正式多任务评测结果应在完成后另行发布,不能用 smoke 成功率代替正式成功率。
PiPER 六任务真机 LoRA
只使用 RoboDojo 官方 PiPER 数据:
fill_pen_holder、put_objects_into_basket、stack_and_cover_blocks、stack_bowls、stand_up_bottles、insert_charger。
关键参数:
- 基座:
gs://openpi-assets/checkpoints/pi05_base/params - OpenPI config:
pi05_base_piper6_lora_real - 模型:
Pi0Config(pi05=True, paligemma_variant="gemma_2b_lora", action_expert_variant="gemma_300m_lora") - LoRA freeze filter:由同一个
Pi0Config的get_freeze_filter()生成 - total parameters:3,403,421,440
- trainable parameters:466,957,056
ema_decay=None,adapt_to_pi=False- 600 episodes;每任务前 90 条训练、后 10 条验证
- 训练 frames:486,037;global batch size:512;目标 7,595 steps
- 训练数据保持审核后的 30 Hz,不静默重采样到 25 Hz
- 状态/动作顺序:左臂 6 关节、左夹爪、右臂 6 关节、右夹爪
- 只对关节使用 delta action;夹爪保持 absolute action
- 相机映射:head→
cam_high,left wrist→cam_left_wrist,right wrist→cam_right_wrist
最终 step 7,594 的离线 held-out 指标:validation loss 0.03263、physical flow MSE 0.00898、normalized action MAE 0.07485。它们只衡量离线验证集,不等价于真机任务成功率。
下载
安装最新版 Hugging Face CLI:
python -m pip install -U "huggingface_hub[hf_xet]"
只下载一个 checkpoint:
hf download cjgogo/RoboDojo-pi05-checkpoints \
--include "checkpoints/sim-10task/14077/**" \
--local-dir ./RoboDojo-pi05-checkpoints
下载全部内容:
hf download cjgogo/RoboDojo-pi05-checkpoints \
--local-dir ./RoboDojo-pi05-checkpoints
使用 OpenPI 推理
使用与训练一致的 OpenPI/XPolicyLab 版本。checkpoint 必须保留整个目录结构,不能只复制某个 ocdbt 文件。
仿真 checkpoint 示例:
cd /path/to/openpi
uv run scripts/serve_policy.py policy:checkpoint \
--policy.config=pi05_base_aloha_full_sim_arx-x5_seed_0 \
--policy.dir=/absolute/path/RoboDojo-pi05-checkpoints/checkpoints/sim-10task/14077
PiPER LoRA 示例:
cd /path/to/openpi
# 将 metadata/openpi_config_piper6.py 中的 PiPER config 合并到相同版本的
# src/openpi/training/config.py,然后启动:
uv run scripts/serve_policy.py policy:checkpoint \
--policy.config=pi05_base_piper6_lora_real \
--policy.dir=/absolute/path/RoboDojo-pi05-checkpoints/checkpoints/real-piper6-lora/7594
若使用 XPolicyLab,可以把下载后的 step 目录作为 ckpt_name 的绝对路径传给 setup_eval_policy_server.sh。仿真端仍应使用 RoboDojo 官方任务定义、native episode 数和原生成功判定。
断点续训
每个目录都包含 train_state,可在训练代码与配置兼容时使用 --resume。续训前必须保持:
- 相同的 OpenPI 模型结构与 Orbax/JAX 兼容版本;
- 相同的数据字段、相机映射、action semantics 和 normalization asset id;
- 与 checkpoint 对应的 config;
- 完整的
_CHECKPOINT_METADATA、params、train_state和assets。
许可与归属
- OpenPI 代码采用 Apache-2.0,见
licenses/LICENSE_OPENPI。 - 模型包含/派生自 Gemma,受 Gemma Terms of Use 和 Prohibited Use Policy 约束,见
licenses/LICENSE_GEMMA与NOTICE。 - RoboDojo 代码、任务和数据仅限非商业研究、教育与评测,见
licenses/LICENSE_ROBODOJO。 - 本仓库公开可见不等于允许商业使用,也不取消上述第三方限制。
引用
请同时引用 Physical Intelligence 的 π0/π0.5 工作以及 RoboDojo 项目。完整引用格式请以各自官方仓库的最新说明为准。