metadata
license: apache-2.0
tags:
- olmo
- dpo
- sycophancy
OLMo-3 DPO delta-learning checkpoints
Preference-trained OLMo-3 checkpoints from size-pair / swapped delta-learning DPO experiments (sycophancy-confidence).
Each top-level folder is one training run (HF transformers-loadable weights, plus step_500 DeepSpeed state).