York Milestone Project — Phase 1 adapters

Hugging Face 仓库: geyuxu/york-milestone-project-self-traing-loop-model

本仓库保存一期 v3 的最终 PEFT LoRA-DPO adapter,用于复现实验和后续阶段复用。 它不包含基础模型权重、完整训练 checkpoint、合成数据、评测输出或原始 API 响应。

内容

路径 基础模型 用途 训练 / 验证偏好对
phase1/qwen-main-dpo-v3/ Qwen/Qwen2.5-1.5B-Instruct 一期主实验 99,986 / 11,110
phase1/llama-dpo-v3/ meta-llama/Llama-3.2-1B-Instruct 跨模型迁移实验 99,986 / 11,110
phase1/ablations/empty_context/ Qwen2.5-1.5B-Instruct 诊断消融 77,124 / 8,563
phase1/ablations/helps_only/ Qwen2.5-1.5B-Instruct 诊断消融 77,124 / 8,563
phase1/ablations/matched_clean/ Qwen2.5-1.5B-Instruct 诊断消融 77,124 / 8,563
phase1/ablations/no_context/ Qwen2.5-1.5B-Instruct 诊断消融 77,124 / 8,563
phase1/ablations/random_labels/ Qwen2.5-1.5B-Instruct 诊断消融 77,124 / 8,563
phase1/ablations/shuffled_documents/ Qwen2.5-1.5B-Instruct 诊断消融 77,124 / 8,563

每个目录包含:

  • adapter_model.safetensorsadapter_config.json
  • 与导出时一致的 tokenizer 和 chat template;
  • training_recipe.json:冻结的数据成员哈希及核心训练参数;
  • training_summary.json:训练步数、日志和最终摘要;
  • training_args.bin:Transformers 训练参数快照。

加载 adapter

以下示例加载 Qwen 主实验。其他 adapter 只需替换 subfolder 和对应的 base_id

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "geyuxu/york-milestone-project-self-traing-loop-model"
subfolder = "phase1/qwen-main-dpo-v3"
base_id = "Qwen/Qwen2.5-1.5B-Instruct"

tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
base_model = AutoModelForCausalLM.from_pretrained(
    base_id,
    torch_dtype="auto",
    device_map="auto",
)
model = PeftModel.from_pretrained(
    base_model,
    repo_id,
    subfolder=subfolder,
)

Llama adapter 需要先在 Hugging Face 接受 meta-llama/Llama-3.2-1B-Instruct 的访问条款,并使用有权限的账户登录。

完整性验证

从仓库根目录执行:

sha256sum -c MANIFEST.sha256

MANIFEST.sha256 覆盖 phase1/ 下发布的全部文件。Safetensors 通过 Git LFS 管理;基础模型权重不会被提交到本仓库。

许可证与限制

  • Qwen adapter 依赖 Apache-2.0 许可的 Qwen2.5 基础模型;
  • Llama adapter 的使用受 Llama 3.2 Community License 及其访问条款约束;
  • 训练数据的来源、许可和限制以配套数据仓库的 dataset card 为准。

这些 adapter 是研究实验产物,未针对生产安全、事实准确性或具体行业用途做保证。

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support