| |
| |
| |
|
|
| |
| base_llm: |
| model_name_or_path: "Qwen/Qwen2.5-0.5B-Instruct" |
| mid_layer_idx: 12 |
| d_model: 896 |
| num_layers: 24 |
| num_heads: 14 |
| vocab_size: 151936 |
| max_prompt_len: 512 |
| max_target_len: 100 |
|
|
| |
| dit: |
| d_model: 896 |
| num_layers: 10 |
| num_heads: 14 |
| mlp_ratio: 8.0 |
| block_length: 100 |
| max_seq_len: 1024 |
| dropout: 0.1 |
| use_rope: true |
| use_block_causal: false |
| gradient_checkpointing: true |
| adaln_zero: true |
| time_embedding_dim: 256 |
| apply_rmsnorm_head: true |
| use_projection_head: true |
| projection_head_depth: "deep" |
| init_from_base: true |
| init_num_layers: 6 |
| init_start_layer: 6 |
| init_base_model_name: "Qwen/Qwen2.5-0.5B-Instruct" |
|
|
| |
| training: |
| learning_rate: 7.0e-4 |
| min_lr: 1.0e-6 |
| weight_decay: 0.01 |
| warmup_steps: 200 |
| max_steps: 5000 |
| batch_size: 16 |
| gradient_accumulation_steps: 1 |
| max_grad_norm: 1.0 |
| precision: "bfloat16" |
| save_interval: 1000 |
| eval_interval: 200 |
| log_interval: 10 |
| output_dir: "./checkpoints_improved" |
| |
| |
| block_length_curriculum: true |
| curriculum_start_steps: 0 |
| curriculum_increase_interval: 2000 |
| curriculum_factor: 2 |
| curriculum_min_block: 20 |
|
|
| |
| loss_weights: |
| lambda_fm: 1.0 |
| lambda_disp: 0.1 |
| lambda_kl: 0.1 |
| use_kldiv_loss: true |
| kl_temperature: 2.0 |
| lambda_ce: 1.0 |
| use_ce_loss: true |
| lambda_nn: 0.1 |
| use_nn_loss: true |
| nn_temperature: 0.1 |
|
|
| flow_matching: |
| sigma_min: 1.0e-5 |
| time_sampling: "uniform" |
|
|