File size: 341 Bytes
d3d4639
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
---
license: apache-2.0
tags:
  - olmo
  - dpo
  - sycophancy
---

# OLMo-3 DPO delta-learning checkpoints

Preference-trained OLMo-3 checkpoints from size-pair / swapped delta-learning DPO experiments (sycophancy-confidence).

Each top-level folder is one training run (HF `transformers`-loadable weights, plus `step_500` DeepSpeed state).