model_kwargs: model_id: Llama-3.2-1B-Instruct sft_method: colar chat_template: false do_lora: true lora_config: r: 128 lora_alpha: 32 latent_cot_config: ce_weight: 1 embed_modeling_weight: 1 embed_modeling_loss: mse entropy_weight: 0 pred_embed_forward_weight: 0 max_compression_factor: 5 pred_compressed_cot: true sqrt_mean: true latent_policy_config: lp_determinisitc: false lp_intermediate_size: 2048 latent_generation_config: max_n_latent_forward: 64 latent_temperature: 1.0 compression_factor: 5 answer_generation_config: max_new_tokens: 16 do_sample: true top_p: 0.9 temperature: 1.0 do_rl: false rl_config: average_per_token_loss: false random_speed_in_group: false filter_dataset: false exp_batch_size: 8 group_size: 8 punish_latent_length: false clip_grad_norm: 1.0 clip_eps: 0.2 use_latent_loss: true use_answer_loss: true n_train_samples_per_epoch: 512 training_kwargs: optimizer: target: torch.optim.AdamW lr: 0.0001 weight_decay: 0.01 use_scheduler: false scheduler: target: constant_schedule_with_warmup warmup_steps: 1000 all_config: trainer: target: lightning.pytorch.trainer.Trainer devices: - 0 max_steps: -1 check_val_every_n_epoch: 5 log_every_n_steps: 10 num_sanity_val_steps: 2 gradient_clip_val: 1.0 reload_dataloaders_every_n_epochs: 0 accumulate_grad_batches: 4 precision: bf16-mixed use_distributed_sampler: true strategy: auto logger: target: lightning.pytorch.loggers.TensorBoardLogger save_dir: logs/colar name: qsa-coding_mix version: 20260802-200100_983467_coding_gsmwarm max_epochs: 25 callbacks: - target: lightning.pytorch.callbacks.ModelCheckpoint save_last: true save_top_k: 3 mode: max monitor: monitor auto_insert_metric_name: false filename: epoch{epoch}__step{step}__monitor{monitor:.3f} save_weights_only: true seed: null model: target: src.models.colar.LitCoLaR model_kwargs: model_id: Llama-3.2-1B-Instruct sft_method: colar chat_template: false do_lora: true lora_config: r: 128 lora_alpha: 32 latent_cot_config: ce_weight: 1 embed_modeling_weight: 1 embed_modeling_loss: mse entropy_weight: 0 pred_embed_forward_weight: 0 max_compression_factor: 5 pred_compressed_cot: true sqrt_mean: true latent_policy_config: lp_determinisitc: false lp_intermediate_size: 2048 latent_generation_config: max_n_latent_forward: 64 latent_temperature: 1.0 compression_factor: 5 answer_generation_config: max_new_tokens: 16 do_sample: true top_p: 0.9 temperature: 1.0 do_rl: false rl_config: average_per_token_loss: false random_speed_in_group: false filter_dataset: false exp_batch_size: 8 group_size: 8 punish_latent_length: false clip_grad_norm: 1.0 clip_eps: 0.2 use_latent_loss: true use_answer_loss: true n_train_samples_per_epoch: 512 training_kwargs: optimizer: target: torch.optim.AdamW lr: 0.0001 weight_decay: 0.01 use_scheduler: false scheduler: target: constant_schedule_with_warmup warmup_steps: 1000 dataloader: batch_size: 4 val_batch_size: 32 num_workers: 8 pin_memory: true persistent_workers: true data_module: target: src.datasets.qsa.QSADataModule dataset_name: coding_mix tiny_dataset: false epoch_scaling: 1 args: model: colar dataset: qsa trainer: default devices: '0' no_log: false log_suffix: coding_gsmwarm resume_ckpt_path: null load_ckpt_path: /content/colar_hf/logs/colar/qsa-gsm/colar-final/checkpoints/colar_best.ckpt workspace_path: /content/ws do_test: false test_ckpt_path: '' test_times: 5 seed: 0 unkown_args: dataset_name: coding_mix model_id: Llama-3.2-1B-Instruct batch_size: '4' accumulate_grad_batches: '4' max_epochs: '25' check_val_every_n_epoch: '5'