| license: apache-2.0 | |
| tags: | |
| - olmo | |
| - dpo | |
| - sycophancy | |
| # OLMo-3 DPO delta-learning checkpoints | |
| Preference-trained OLMo-3 checkpoints from size-pair / swapped delta-learning DPO experiments (sycophancy-confidence). | |
| Each top-level folder is one training run (HF `transformers`-loadable weights, plus `step_500` DeepSpeed state). | |