queue_merged-u207 / README.md
eric-the-coder's picture unconst's picture
Duplicate from unconst/Affine-5czsc2fc98-r596-r252-odpo-hirank-midbeta-softctx-megaextra-merged
316de84
|
Raw History Blame Contribute Delete
2.05 kB
---
base_model: unconst/Affine-5czsc2fc98-r252-merged
base_model_revision: b42d6245d77fe30885ea8a90387771e1bc465e0f
library_name: transformers
pipeline_tag: text-generation
tags:
- affine
- sn120
- reason-v3
- offline-dpo
- r596
---
# R596 — SoftCtx × HiRank × MidBeta MegaExtra (offline DPO)
Affine SN120 challenger trained to beat the live king on **Reason v3**
(teacher-anchored score: `lpC(y_C|z_A) − lpC(y_C|∅)`).
## How this checkpoint was trained
- **Base / parent:** `unconst/Affine-5czsc2fc98-r252-merged@b42d6245d77fe30885ea8a90387771e1bc465e0f` (our crowned r252, reign 33)
- **Method:** offline DPO on Reason-ranked pairs (not SFT / not online GRPO)
- **What was optimized:** preference for higher teacher-side Reason on mined pairs
- **Data:** SoftCtx × HiRank pair set (soft context length band, high-rank filter);
MidBeta β=0.1. See experiment `plan.md` / `dpo_duel_reason.jsonl` under `mining/experiments/r596-r252-offline-dpo-hialpha-hirank-midbeta-softctx-megaextrasteps`.
- **Key hyperparameters:**
- LoRA r=64, α=128
- β=0.1 (MidBeta)
- lr=5e-6
- max_len=12288 (SoftCtx)
- max_steps target 3600 MegaExtra; **TRAIN_DONE@259** (adapter kept / merged)
- **Hardware:** Lium `mine-r226-marsplan-fullft-1` (brave) GPUs 6,7 for train;
merge + n80 on `mine-r252-vera-t4-nonking-grpo-1` GPUs 4,5 → `/tmp/r596_merged`
- **Local n80 vs live king reign34** (`cryptoDev23/Affine-5Dku3dYp9j-hk8161@55b7ffe0…`):
- margin **+0.006196**, SE 0.002357, z=2.63, n=75
- bar `max(2·SE, δ=0.002)` = **0.004713** (~**1.31×**)
- thought median **199** (≥80), B pass **0.368** (≥0.30)
- decision: Stage-5 licensed (`r596_decision_reign34.json`)
- **Prior n80 vs r252:** margin +0.008490 (~1.19× bar), thought/B clear
- **Experiment path:** `mining/experiments/r596-r252-offline-dpo-hialpha-hirank-midbeta-softctx-megaextrasteps`
## Intended use
SN120 Affine miner submission / evalsrv Reason duel. Not a general chat model.
## License
Follows base model + Affine mining artifacts policy.