Instructions to use modrill/MT11-HIGH-L45 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use modrill/MT11-HIGH-L45 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B-Base") model = PeftModel.from_pretrained(base_model, "modrill/MT11-HIGH-L45") - Notebooks
- Google Colab
- Kaggle
File size: 3,222 Bytes
0a5b3cd | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 | # MT11 HIGH_HEAVY_L45 主候选最终冻结登记
**状态:FINAL_FROZEN · PRIMARY_SELECTED · STOP_ALL_NEW_MT11_TRAINING · 2026-08-16**
## 最终决定
- 当前 MT11 主候选:`HIGH_HEAVY_L45`。
- `MEDCONF_MED34_HIGH30_CENTERED_S2` 降级:fresh seeds 46–49 为 29/240,且相对 Fresh Base 的题目级聚合 CI `[-3, 22]` 不排除 0。
- 用户预先规定“两份 34 换全新 seed 仍高分即不再训练”;HIGH 在完整 fresh block 上精确复现 34/240,故停止所有新的 MT11 训练路线。
- 权威 fresh-seed 总报告中的旧机器判决 `DO_NOT_STOP_TRAINING_MIXED_OR_UNSTABLE` 是对 HIGH 与 MEDCONF 的联合判决;本登记不修改该历史卡,而是按用户已明确的最终停止规则作 owner override。
## HIGH 完整证据(不 cherry-pick)
统计覆盖 AIME24+25 全部 60 题、每题四 seed;两组 seed 不做 sample 伪配对。
| block | seeds | n | correct | cap | decoded complete box | natural stop |
|---|---|---:|---:|---:|---:|---:|
| original | 42–45 | 240 | 34(8/9/6/11) | 91(37.917%) | 150(62.500%) | 149(62.083%) |
| fresh | 46–49 | 240 | 34(8/9/9/8) | 84(35.000%) | 151(62.917%) | 156(65.000%) |
| combined | 42–49 | 480 | **68(14.167%)** | **175(36.458%)** | **301(62.708%)** | **305(63.542%)** |
Fresh HIGH 相对 Fresh Base 20/240:`+14`,题目级聚合 95% CI `[2, 27]`,显著高于 Base。Original 与 fresh 均完整纳入 combined block;未筛 seed、题目或样本。
## 冻结身份与合同
- adapter:`/workspace/DDC-v3.1/runs/mt11_r2_384k96_execution_20260814/arms_90r6pp/HIGH_HEAVY_L45/train/checkpoint-update-00000024-tokens-000000409131/adapter`
- adapter SHA256:`628a5b4c40584c524479b80773166f49b5c49d7223b34d4cf254064d6b65bd29`
- base/tokenizer:`/workspace/MATH-NOTHINK-AIME-P1-v1.0/model/mn8_eos_r1_2/Qwen3-4B-Base-906bfd4`
- serving:dynamic LoRA;base 与 adapter 分离;**不 merge、不 bake**。
- 标准合同:Think、EvalScope reviews、AIME24+25、60 题、四 eval seeds、temperature 0.6、top_p 0.95、top_k 20、32K prompt-aware 上限 `32768 - exact_prompt_tokens - 64`;统计以题目为 cluster。
## 路线冻结
- 停止所有新的 MT11 训练路线;不得自动续训、扩臂、warm-start、组合 LoRA 或追加 training seed。
- 短 CoT family gate 已 **FAIL**。
- MED34 score-uplift R1 family gate 已 **FAIL**。
- 不修改历史结果卡,不物化 merged/baked 模型,本次不启动训练或评测。
- 已批准的 MN9 跨协议任务仅为纯评测,不得停止或干扰;其结果不得自动触发训练、扩臂或 LoRA 组合,任何后续须另行审批。
## Supervisor 只读检查
检查时无 MT11 训练 Supervisor 处于 `RUNNING`。正在运行的是已批准的 `ddc-mt11-mn9-crossprotocol-*` controller / eval / disk-guard 纯评测服务,未作停止或干扰。
## 权威来源
- `/workspace/DDC-v3.1/runs/mt11_two34_freshseed_reval_20260815/MT11_TWO34_FRESHSEED_REVAL_FINAL.md`
- `/workspace/DDC-v3.1/runs/mt11_two34_freshseed_reval_20260815/MT11_TWO34_FRESHSEED_REVAL_FINAL.json`
- `/workspace/DDC-v3.1/runs/mt11_r2_384k96_execution_20260814/RESULT_CARD_HIGH_HEAVY_L45.json`
|