{ "stage": "s1", "base_model": "Qwen/Qwen3.5-0.8B", "resume_from": "jeopardy_g4_lora", "data": "training_data/board_train.jsonl", "lr": 5e-05, "epochs": 1.0, "max_steps": null, "batch_size": 2, "grad_accum": 8, "lora_r": 16, "final_loss": 0.14736651238941012, "global_step": 189 }