| { | |
| "layer_share": 1, | |
| "n_sink": 8, | |
| "step": 2200, | |
| "training_config": { | |
| "model": "Qwen/Qwen3-4B", | |
| "corpus": "results/raw/corpus/train_A.json", | |
| "steps": 2200, | |
| "lr": 5e-05, | |
| "warmup": 50, | |
| "layer_share": 1, | |
| "n_sink": 8, | |
| "max_chunks": 4, | |
| "val_docs": 12, | |
| "val_every": 275, | |
| "val_examples": 16, | |
| "clip": 1.0, | |
| "seed": 0, | |
| "ckpt": "results/raw/stage2b_extractor.pt", | |
| "out": "results/raw/stage2b_train.json" | |
| }, | |
| "target_model": "Qwen/Qwen3-4B", | |
| "target_model_revision": "1cfa9a7208912126459214e8b04321603b3df60c", | |
| "n_trainable_params": 566233600, | |
| "original_pt_sha256": "b8384dd2eeaa87890a6b65e22f791183399764b93dd9a7f4e8a6e4ce13fca425" | |
| } | |