JEV / code /configs /train.yaml
cloudyu's picture
Upload JEV v0.7.0 (Qwen3.5-9B distilled from Jev 1.13)
b2f3bf4 verified
Raw
History Blame Contribute Delete
1.02 kB
# S2 main config — Qwen3.5-9B on 1x B200 (DESIGN §7.6, adapted v0.7)
model_path: /root/models/Qwen3.5-9B
data_dir: data
stage: s2
seed: 42
subset_frac: 1.0
max_seq_len: 1024
epochs: 2
batch_size: 128 # samples per optimizer step (v0.6 had 64; larger amortises the ~300ms CPU floor)
max_padded_tokens: 10000 # micro-batch B*T cap; 9B no-ckpt peaks ~100 GB at 10k
gradient_checkpointing: false
lr_head: 2.0e-4
lr_lora: 1.0e-4
weight_decay: 0.0
warmup_frac: 0.03
min_lr_frac: 0.10
grad_clip: 1.0
lambda_rps: 0.5
d1_policy: downweight
d1_downweight: 0.05
d1_scope: yuri_v1
choice_permute_prob: 0.30
kind_floor: 0.1667
lora:
r: 16
alpha: 32
dropout: 0.05
# all Linear leaves of the qwen3_5 decoder layer except in_proj_a/in_proj_b (4096->48 gate scalars;
# LoRA there adds launch overhead and no capacity)
target_modules: [in_proj_qkv, in_proj_z, q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj, out_proj]
eval_every: 500
eval_rows: 4000
patience: 3
log_every: 20
num_workers: 8