Instructions to use modrill/MT11-HIGH-L45 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use modrill/MT11-HIGH-L45 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B-Base") model = PeftModel.from_pretrained(base_model, "modrill/MT11-HIGH-L45") - Notebooks
- Google Colab
- Kaggle
MT11 HIGH_HEAVY_L45 主候选最终冻结登记
状态:FINAL_FROZEN · PRIMARY_SELECTED · STOP_ALL_NEW_MT11_TRAINING · 2026-08-16
最终决定
- 当前 MT11 主候选:
HIGH_HEAVY_L45。 MEDCONF_MED34_HIGH30_CENTERED_S2降级:fresh seeds 46–49 为 29/240,且相对 Fresh Base 的题目级聚合 CI[-3, 22]不排除 0。- 用户预先规定“两份 34 换全新 seed 仍高分即不再训练”;HIGH 在完整 fresh block 上精确复现 34/240,故停止所有新的 MT11 训练路线。
- 权威 fresh-seed 总报告中的旧机器判决
DO_NOT_STOP_TRAINING_MIXED_OR_UNSTABLE是对 HIGH 与 MEDCONF 的联合判决;本登记不修改该历史卡,而是按用户已明确的最终停止规则作 owner override。
HIGH 完整证据(不 cherry-pick)
统计覆盖 AIME24+25 全部 60 题、每题四 seed;两组 seed 不做 sample 伪配对。
| block | seeds | n | correct | cap | decoded complete box | natural stop |
|---|---|---|---|---|---|---|
| original | 42–45 | 240 | 34(8/9/6/11) | 91(37.917%) | 150(62.500%) | 149(62.083%) |
| fresh | 46–49 | 240 | 34(8/9/9/8) | 84(35.000%) | 151(62.917%) | 156(65.000%) |
| combined | 42–49 | 480 | 68(14.167%) | 175(36.458%) | 301(62.708%) | 305(63.542%) |
Fresh HIGH 相对 Fresh Base 20/240:+14,题目级聚合 95% CI [2, 27],显著高于 Base。Original 与 fresh 均完整纳入 combined block;未筛 seed、题目或样本。
冻结身份与合同
- adapter:
/workspace/DDC-v3.1/runs/mt11_r2_384k96_execution_20260814/arms_90r6pp/HIGH_HEAVY_L45/train/checkpoint-update-00000024-tokens-000000409131/adapter - adapter SHA256:
628a5b4c40584c524479b80773166f49b5c49d7223b34d4cf254064d6b65bd29 - base/tokenizer:
/workspace/MATH-NOTHINK-AIME-P1-v1.0/model/mn8_eos_r1_2/Qwen3-4B-Base-906bfd4 - serving:dynamic LoRA;base 与 adapter 分离;不 merge、不 bake。
- 标准合同:Think、EvalScope reviews、AIME24+25、60 题、四 eval seeds、temperature 0.6、top_p 0.95、top_k 20、32K prompt-aware 上限
32768 - exact_prompt_tokens - 64;统计以题目为 cluster。
路线冻结
- 停止所有新的 MT11 训练路线;不得自动续训、扩臂、warm-start、组合 LoRA 或追加 training seed。
- 短 CoT family gate 已 FAIL。
- MED34 score-uplift R1 family gate 已 FAIL。
- 不修改历史结果卡,不物化 merged/baked 模型,本次不启动训练或评测。
- 已批准的 MN9 跨协议任务仅为纯评测,不得停止或干扰;其结果不得自动触发训练、扩臂或 LoRA 组合,任何后续须另行审批。
Supervisor 只读检查
检查时无 MT11 训练 Supervisor 处于 RUNNING。正在运行的是已批准的 ddc-mt11-mn9-crossprotocol-* controller / eval / disk-guard 纯评测服务,未作停止或干扰。
权威来源
/workspace/DDC-v3.1/runs/mt11_two34_freshseed_reval_20260815/MT11_TWO34_FRESHSEED_REVAL_FINAL.md/workspace/DDC-v3.1/runs/mt11_two34_freshseed_reval_20260815/MT11_TWO34_FRESHSEED_REVAL_FINAL.json/workspace/DDC-v3.1/runs/mt11_r2_384k96_execution_20260814/RESULT_CARD_HIGH_HEAVY_L45.json