aliangdw's picture
FFT finetune of Robometer-4B on Armnet benchmark
dc59acc verified
|
Raw
History Blame Contribute Delete
606 Bytes
metadata
license: apache-2.0
base_model: Qwen/Qwen3-VL-4B-Instruct
tags:
  - robometer
  - reward-model
  - rbm
  - armnet
library_name: transformers

Robometer-4B FFT finetuned on Armnet benchmark

Full fine-tune (FFT, no LoRA) of Robometer-4B on the Armnet benchmark (so101 + bimanual_so101), using Qwen3-VL-4B backbone.

Trained for 1000 steps on 4x H200.

Armnet benchmark results (training-time custom eval)

  • so101: reward-alignment Pearson 0.766, policy-ranking Kendall 0.973
  • bimanual_so101: reward-alignment Pearson 0.873, policy-ranking Kendall 0.86