camilablank's picture
Upload README.md with huggingface_hub
d3d4639 verified
|
Raw
History Blame Contribute Delete
341 Bytes
metadata
license: apache-2.0
tags:
  - olmo
  - dpo
  - sycophancy

OLMo-3 DPO delta-learning checkpoints

Preference-trained OLMo-3 checkpoints from size-pair / swapped delta-learning DPO experiments (sycophancy-confidence).

Each top-level folder is one training run (HF transformers-loadable weights, plus step_500 DeepSpeed state).