feat(inference, safety): introduce AnthropicClaudePolicy and enhance safety concerns handling afbf090 ddevMhrn commited on Apr 26
feat(inference, train, eval): enhance user prompt structure with memory orchestration fields fd472a0 ddevMhrn commited on Apr 26
fix(train): preserve exact backwards compatibility when --resume is not passed 9b56b18 gowtham-sai-yadav commited on Apr 26
feat(train): add --resume flag to continue from latest checkpoint acdc2f7 gowtham-sai-yadav commited on Apr 26
fix(train): pass eos_token_id list via GRPOConfig.generation_kwargs (Qwen GRPO termination) 6e7004b gowtham-sai-yadav commited on Apr 26
fix(train): pin chat-end token as EOS so Qwen generation stops on turn end 55edcd8 gowtham-sai-yadav commited on Apr 26
fix(prompts,train): kill multi-step example leakage that made Qwen ramble past EOS 120d54e gowtham-sai-yadav commited on Apr 26
fix(train): teacher uses real reversibility from registry + better last_result check e8e344d gowtham-sai-yadav commited on Apr 26
refactor(inference, train): unify system prompts and enhance user prompt structure 4939dbc ddevMhrn commited on Apr 25
fix(train): revert num_generations to 4 — G=16 was 30hr ETA on T4 35d0155 gowtham-sai-yadav commited on Apr 25
fix(train): bump grad_accum to 16 to match num_generations=16 da2b8be gowtham-sai-yadav commited on Apr 25
feat(train): teacher-rollout multi-step trajectories + multi-step examples in prompt bc08009 gowtham-sai-yadav commited on Apr 25
refactor(inference): enhance circuit breaker logic and model initialization 896493a ddevMhrn commited on Apr 25
fix(train): enable KL penalty (beta=0.04) to prevent mode collapse 25f5729 gowtham-sai-yadav commited on Apr 25
fix(train+kaggle): warnings_issued patch for transformers 5.x + proper notebook shim db10391 gowtham-sai-yadav commited on Apr 25
fix(train): filter LLM extras + bound scenario_idx to real per-tier count b6695bd gowtham-sai-yadav commited on Apr 25
fix(train): rewrite reward_func to TRL 0.24 signature + drop mergekit 42ea552 gowtham-sai-yadav commited on Apr 25
fix(train): proper llm_blender shim + add mergekit shim for TRL 0.24 982fd44 gowtham-sai-yadav commited on Apr 25
fix(train): stub llm_blender + unpin TRL/hub for GRPOConfig access 7520094 gowtham-sai-yadav commited on Apr 25
feat(inference, train): add baseline policies and training script for Viveka f35f935 ddevMhrn commited on Apr 25