viveka-env / train.py

Commit History

feat(inference, safety): introduce AnthropicClaudePolicy and enhance safety concerns handling
afbf090

ddevMhrn commited on

feat(inference, train, eval): enhance user prompt structure with memory orchestration fields
fd472a0

ddevMhrn commited on

fix(train): preserve exact backwards compatibility when --resume is not passed
9b56b18

gowtham-sai-yadav commited on

feat(train): add --resume flag to continue from latest checkpoint
acdc2f7

gowtham-sai-yadav commited on

fix(train): pass eos_token_id list via GRPOConfig.generation_kwargs (Qwen GRPO termination)
6e7004b

gowtham-sai-yadav commited on

fix(train): pin chat-end token as EOS so Qwen generation stops on turn end
55edcd8

gowtham-sai-yadav commited on

fix(prompts,train): kill multi-step example leakage that made Qwen ramble past EOS
120d54e

gowtham-sai-yadav commited on

fix(train): teacher uses real reversibility from registry + better last_result check
e8e344d

gowtham-sai-yadav commited on

refactor(inference, train): unify system prompts and enhance user prompt structure
4939dbc

ddevMhrn commited on

fix(train): revert num_generations to 4 — G=16 was 30hr ETA on T4
35d0155

gowtham-sai-yadav commited on

fix(train): bump grad_accum to 16 to match num_generations=16
da2b8be

gowtham-sai-yadav commited on

feat(train): teacher-rollout multi-step trajectories + multi-step examples in prompt
bc08009

gowtham-sai-yadav commited on

refactor(inference): enhance circuit breaker logic and model initialization
896493a

ddevMhrn commited on

fix(train): enable KL penalty (beta=0.04) to prevent mode collapse
25f5729

gowtham-sai-yadav commited on

fix(train+kaggle): warnings_issued patch for transformers 5.x + proper notebook shim
db10391

gowtham-sai-yadav commited on

fix(train): filter LLM extras + bound scenario_idx to real per-tier count
b6695bd

gowtham-sai-yadav commited on

fix(train): rewrite reward_func to TRL 0.24 signature + drop mergekit
42ea552

gowtham-sai-yadav commited on

fix(train): proper llm_blender shim + add mergekit shim for TRL 0.24
982fd44

gowtham-sai-yadav commited on

fix(train): stub llm_blender + unpin TRL/hub for GRPOConfig access
7520094

gowtham-sai-yadav commited on

feat(eval): add AQI evaluation scripts and reliability diagrams
34129e1

ddevMhrn commited on

feat(inference, train): add baseline policies and training script for Viveka
f35f935

ddevMhrn commited on