metadata
license: apache-2.0
base_model: openpi/pi0.5
tags:
- robotics
- imitation-learning
- manipulation
- advantage-estimator
- stage-advantage
- kai0
pipeline_tag: reinforcement-learning
χ₀ (kai0) — Advantage Estimator(价值模型)
本仓库发布 Advantage Estimator(π₀.₅ 价值模型变体)权重,用于 Advantage-Weighted Behavior Cloning(AWBC) 与 阶段分割(Stage Segmentation)。
仅含模型权重(
model.safetensors+metadata.pt)。不含训练优化器状态optimizer.pt。
文件清单
| 路径 | 说明 |
|---|---|
adv-flatten-fold-run16/model.safetensors |
模型权重(~7.5 GB,PyTorch safetensors) |
adv-flatten-fold-run16/metadata.pt |
训练元信息(config / exp_name / 训练步数 / 超参数) |
训练时保存的
optimizer.pt(~13.5 GB)为优化器状态,未随本仓库发布,对推理无影响。
模型信息
| 项 | 值 |
|---|---|
| 模型类型 | Advantage Estimator(π₀.₅ 变体,仅保留价值/进度回归头) |
| 基于 | π₀.₅ 基础 checkpoint(见 metadata.pt / pytorch_weight_path) |
| 训练步数 | 20000 |
| 训练损失 | loss_value_weight=1.0,loss_action_weight=0.0(禁用动作损失) |
| 归一化 | skip_norm_stats=True(价值模型不依赖 norm_stats) |
| 输出 | 每帧 absolute_value(0~1 累计进度) |
| Config | ADVANTAGE_TORCH_KAI0_FLATTEN_FOLD_FULL_FINETUNE_MIX_02 |
| exp_name | full_finetune_460_run_16 |
用途
AWBC 训练
价值模型预测每帧优势,经 stage_advantage/annotation/gt_label.py 离散化为正/负标签
写入 task_index / tasks.jsonl,再用于 Advantage-Weighted Behavior Cloning
(prompt_from_task=True)。
阶段分割
absolute_value(0~1 累计进度)可把任务切成 K 个阶段,用于 subtask 级别成功判定与评估。
使用方式
推理侧将 ckpt_dir 指向本权重目录、ckpt_steps=20000(编辑
stage_advantage/annotation/eval.py 的 MODELS_CONFIG_MAP),然后:
uv run python stage_advantage/annotation/eval.py Task-A KAI0 /path/to/dataset
评估(阶段分割,Fold Box,K=16,100 episodes,seed=42)
| 指标 | 值 |
|---|---|
| Frame Accuracy | 51.0%(±12.2%) |
| Stage IoU | 48.1% |
| Boundary MAE | 60.1 帧(~2.0 s) |
| Boundary Acc @±30f | 66.8% |
| Boundary Acc @±50f | 77.7% |
版本说明
adv-flatten-fold-run16/(本仓库,推荐):full_finetune_460_run_16,报告所用。- 早期版本
run_15(full_finetune_460_run_15)权重不同,暂未随本仓库发布,请勿混用。
出处与许可
- 项目:χ₀ (kai0) —— 双臂衣物操作模仿学习框架(基于 openpi)
- 上游许可:Apache-2.0(本项目);PaliGemma 相关组件见
LICENSE_GEMMA.txt(Gemma Terms of Use) - 关联资源:代码见开源仓库;策略模型见
OpenDriveLab-org/Kai0