GR00T Bread Bag Baseline H16 โ€” 100K

๋นต ๋ด‰ํˆฌ ์ง‘๊ธฐ ํƒœ์Šคํฌ๋ฅผ ์œ„ํ•ด NVIDIA GR00T N1.6-3B๋ฅผ fine-tuningํ•œ baseline ์ฒดํฌํฌ์ธํŠธ์ž…๋‹ˆ๋‹ค.

์ด ๋ชจ๋ธ์€ ๋ณ„๋„๋กœ ์„ค๊ณ„ํ•œ ์•ˆ์ •ํ™” loss๋ฅผ ์ถ”๊ฐ€ํ•˜์ง€ ์•Š๊ณ  GR00T์˜ ๊ธฐ๋ณธ ํ•™์Šต objective๋กœ ํ•™์Šตํ–ˆ์Šต๋‹ˆ๋‹ค. ์ดํ›„์˜ loss ์„ค๊ณ„, masking, action horizon ๋ณ€๊ฒฝ ๋“ฑ ๊ฐœ์„  ์‹คํ—˜๊ณผ ๋น„๊ตํ•˜๊ธฐ ์œ„ํ•œ ๊ธฐ์ค€ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค.

Checkpoint: 100,000 steps
Action horizon: 16 steps
Status: Open-loop validation ์™„๋ฃŒ / ์‹ค๋ฌผ ๋กœ๋ด‡ ํ‰๊ฐ€๋Š” ์ง„ํ–‰ ์˜ˆ์ •

Task

ํ…Œ์ด๋ธ” ์œ„์˜ ๋นต ๋ด‰ํˆฌ๋ฅผ instruction์—์„œ ์ง€์ •ํ•œ ์œ„์น˜์™€ ์†์— ๋”ฐ๋ผ ์ง‘๋Š” ์ž‘์—…์ž…๋‹ˆ๋‹ค.

Example instruction:

Pick up the right bread bag with the right hand.

Baseline definition

์ด ์ฒดํฌํฌ์ธํŠธ์—์„œ ๋งํ•˜๋Š” baseline์€ ๋‹ค์Œ์„ ์˜๋ฏธํ•ฉ๋‹ˆ๋‹ค.

  • GR00T N1.6-3B์—์„œ fine-tuning
  • Action chunk/horizon: 16
  • ํ˜„์žฌ ์‹œ์ ์˜ ์˜์ƒ ์ž…๋ ฅ ์‚ฌ์šฉ (video.delta_indices: [0])
  • Arm action: state-relative
  • Gripper action: absolute
  • ๊ธฐ๋ณธ GR00T flow-matching objective ์‚ฌ์šฉ
  • ๋ณ„๋„์˜ reconstruction, inactive-hold, delta, acceleration loss ๋ฏธ์ ์šฉ
  • ์ถ”๋ก  ๋‹จ๊ณ„์˜ hard hand gating์€ ๋ชจ๋ธ ํ•™์Šต์ด ์•„๋‹Œ ROS2 adapter ์˜ต์…˜

Training configuration

Item Value
Starting checkpoint GR00T N1.6-3B
Selected checkpoint 100,000 steps
Full training run 200,000 steps
Action horizon 16
Global batch size 32
Learning rate 1e-4
LR scheduler cosine
Optimizer AdamW
Weight decay 1e-5
Warmup ratio 0.05
Precision bfloat16
Number of GPUs 1

Open-loop validation

Validation trajectories 20๊ฐœ(traj 0โ€“19)์—์„œ checkpoint๋ฅผ 20K ๊ฐ„๊ฒฉ์œผ๋กœ ๋น„๊ตํ–ˆ์Šต๋‹ˆ๋‹ค. ์ „์ฒด action์˜ ๋‹จ์ˆœ MSE/MAE๋ฟ ์•„๋‹ˆ๋ผ, ์„œ๋กœ ๋‹จ์œ„์™€ ๋ฒ”์œ„๊ฐ€ ๋‹ค๋ฅธ arm๊ณผ gripper๋ฅผ ๋ถ„๋ฆฌํ•ด ํ‰๊ฐ€ํ–ˆ์Šต๋‹ˆ๋‹ค.

Checkpoint-100K results

Metric Result
Active-arm MAE 0.022213
Active-arm delta error 0.005394
Active-arm 95th percentile error 0.092240
Inactive-arm MAE 0.003491
Inactive-arm motion error 0.002732
Gripper state accuracy 0.964232
Close timing error 6.95 steps
Excess gripper transitions 1.80
Overall MSE 22.344541
Overall MAE 0.415355

Selection rationale

100K checkpoint๋Š” ๋น„๊ต ๋Œ€์ƒ ๊ฐ€์šด๋ฐ ํŠน์ • ์ง€ํ‘œ ํ•˜๋‚˜๋งŒ ๊ฐ€์žฅ ์ข‹์€ ๋ชจ๋ธ์€ ์•„๋‹ˆ์ง€๋งŒ, ์ฃผ์š” task-level ์ง€ํ‘œ์—์„œ ์ˆœ์œ„๊ฐ€ ๊ณ ๋ฅด๊ฒŒ ๋†’์•„ ๊ฐ€์žฅ ๊ท ํ˜•์ ์ธ checkpoint๋กœ ์„ ์ •ํ–ˆ์Šต๋‹ˆ๋‹ค.

  • Composite average rank: 1.875 (1st)
  • Metric ranks: 2, 2, 1, 2, 2, 2, 2, 2
  • 40K checkpoint๋Š” gripper ๊ด€๋ จ ์ผ๋ถ€ ์ง€ํ‘œ๊ฐ€ ๋” ์ข‹์•˜์ง€๋งŒ, 100K๊ฐ€ arm tracking๊ณผ gripper ๋™์ž‘์„ ํฌํ•จํ•œ ์ข…ํ•ฉ ์•ˆ์ •์„ฑ์—์„œ ๋” ๊ท ํ˜•์ ์ด์—ˆ์Šต๋‹ˆ๋‹ค.

Important notes on the metrics

  • Arm joint action๊ณผ gripper action์€ ๊ฐ’์˜ ๋ฒ”์œ„๊ฐ€ ๋‹ค๋ฆ…๋‹ˆ๋‹ค. ํŠนํžˆ gripper ๊ฐ’์˜ ํฐ ์˜ค์ฐจ๊ฐ€ ์ „์ฒด MSE๋ฅผ ์ง€๋ฐฐํ•  ์ˆ˜ ์žˆ์œผ๋ฏ€๋กœ, overall MSE/MAE๋งŒ์œผ๋กœ checkpoint๋ฅผ ์„ ํƒํ•˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.
  • Open-loop validation์€ ๊ธฐ๋ก๋œ observation์— ๋Œ€ํ•œ action ์˜ˆ์ธก ์„ฑ๋Šฅ์„ ์ธก์ •ํ•ฉ๋‹ˆ๋‹ค. ์‹ค์ œ ๋กœ๋ด‡์˜ closed-loop ์„ฑ๊ณต๋ฅ , ์ถฉ๋Œ ์•ˆ์ „์„ฑ ๋˜๋Š” grasp ์„ฑ๊ณต์„ ์ง์ ‘ ๋ณด์žฅํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.
  • ๊ฒฐ๊ณผ๋Š” ํ˜„์žฌ validation split๊ณผ evaluator ์„ค์ •์— ์˜์กดํ•ฉ๋‹ˆ๋‹ค.

Intended use

  • Bread-bag manipulation ์—ฐ๊ตฌ์˜ baseline
  • Action horizon, loss, masking ๋ฐ ๋ฐ์ดํ„ฐ ์ˆ˜์ง‘ ๋ฐฉ์‹์— ๋Œ€ํ•œ ablation ๋น„๊ต
  • ROS2 policy server๋ฅผ ์ด์šฉํ•œ R1 Lite ์‹ค๋ฌผ ๋กœ๋ด‡ ํ‰๊ฐ€

Limitations

  • ํ˜„์žฌ checkpoint์˜ ์‹ค๋ฌผ ๋กœ๋ด‡ ์„ฑ๊ณต๋ฅ ์€ ์•„์ง ์ธก์ •๋˜์ง€ ์•Š์•˜์Šต๋‹ˆ๋‹ค.
  • ํ•™์Šต ๋ฐ์ดํ„ฐ๊ฐ€ ํŠน์ • ์นด๋ฉ”๋ผ ๋ฐฐ์น˜, ์ž‘์—… ๊ณต๊ฐ„, ๋นต ๋ด‰ํˆฌ ์™ธํ˜• ๋ฐ instruction ํ‘œํ˜„์— ์ œํ•œ๋˜์–ด ์žˆ์–ด ํ™˜๊ฒฝ ๋ณ€ํ™”์— ์ผ๋ฐ˜ํ™”๋˜์ง€ ์•Š์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ์ง€์ •ํ•˜์ง€ ์•Š์€ ํŒ”์—๋„ action์ด ์ถœ๋ ฅ๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ํ˜„์žฌ ์‹ค๋ฌผ ์ถ”๋ก ์—์„œ๋Š” ํ•„์š” ์‹œ ROS2 adapter์˜ hard gating์œผ๋กœ inactive arm/gripper topic publish๋ฅผ ์ฐจ๋‹จํ•ฉ๋‹ˆ๋‹ค.
  • Gripper close timing error์™€ ๋ถˆํ•„์š”ํ•œ open/close transition์ด ๋‚จ์•„ ์žˆ์Šต๋‹ˆ๋‹ค.
  • ์•ˆ์ „ ์ธ์ฆ ๋ชจ๋ธ์ด ์•„๋‹ˆ๋ฉฐ, ์‹ค๋ฌผ ์ ์šฉ ์‹œ dry-run๊ณผ ์ €์† ๊ฒ€์ฆ์ด ํ•„์š”ํ•ฉ๋‹ˆ๋‹ค.

Planned evaluation

  1. 100K checkpoint ์‹ค๋ฌผ ๋กœ๋ด‡ ์ถ”๋ก 
  2. ์œ„์น˜ ร— ์‚ฌ์šฉ ์† ์กฐํ•ฉ๋ณ„ ๋ฐ˜๋ณต ์‹คํ—˜ ๋ฐ ์„ฑ๊ณต๋ฅ  ์ธก์ •
  3. Gripper close timing๊ณผ action-chunk boundary ๋กœ๊ทธ ๋ถ„์„
  4. ๋™์ผ ์กฐ๊ฑด์—์„œ ํ›„์† stable/masking ๋ชจ๋ธ๊ณผ ๋น„๊ต

Citation and acknowledgment

This checkpoint is based on NVIDIA GR00T N1.6. Please follow the original GR00T repository and base-model terms when using or redistributing this model.

Downloads last month
26
Safetensors
Model size
3B params
Tensor type
F32
ยท
BF16
ยท
Video Preview
loading

Model tree for XYZPIT/gr00t_breadbag_baseline_100K

Finetuned
(83)
this model

Dataset used to train XYZPIT/gr00t_breadbag_baseline_100K