Commit History

Update BlogPost.md
c562150
verified

AdityaGuntur commited on

Update README.md
f2699c7
verified

AdityaGuntur commited on

Update README.md
8e8b964
verified

AdityaGuntur commited on

Update README.md
9c90904
verified

AdityaGuntur commited on

fix: resolve merge conflict, restore HF frontmatter + full README
3d2e8d7

Aditya Guntur commited on

fix: restore HF Space YAML frontmatter + update README with full content
36068f1

Aditya Guntur commited on

Update README.md
818155d
verified

AdityaGuntur commited on

Update README.md
3c4463c
verified

AdityaGuntur commited on

Update BlogPost.md
ec0945c
verified

AdityaGuntur commited on

Rename blockPost.md to BlogPost.md
4856cf9
verified

AdityaGuntur commited on

Update blockPost.md
73ddbd3
verified

AdityaGuntur commited on

docs: add blog post — PM-Ops: The Product Manager Benchmark
898e16b

SavK1 Claude Sonnet 4.6 commited on

docs: rewrite README with full system documentation
2ee348e

SavK1 Claude Sonnet 4.6 commited on

fix(v4): increase T4 SFT to 50 eps, add action trace to eval output
16705aa

SavK1 Claude Sonnet 4.6 commited on

fix(v4): reduce MAX_COMP_LEN 384→192, fix eval hanging with for_inference
2f02c01

SavK1 Claude Sonnet 4.6 commited on

feat(training): add clean v4 notebook with all reward fixes
4b0fc8a

SavK1 Claude Sonnet 4.6 commited on

fix(notebook): rewrite run_grpo_episode with runbook-compliance reward
094fade

SavK1 Claude Sonnet 4.6 commited on

fix(grpo): fresh reward design — runbook-compliance scoring
1c6aad2

SavK1 Claude Sonnet 4.6 commited on

fix(grpo): eliminate zero-advantage collapse from stale rewards
38457df

SavK1 Claude Sonnet 4.6 commited on

fix: format runbook as readable key-value pairs for model
fff1405

SavK1 commited on

fix: increase runbook truncation limit 800->2000 chars
b9588df

SavK1 commited on

fix(grpo): harden rollout reward injection on cloud runtime
962ea9c

SavK1 commited on

fix(pm_ops_trainer): use direct closure capture instead of _self_ref
0ddcea5

SavK1 Claude Sonnet 4.6 commited on

fix(pm_ops_trainer): use direct closure capture instead of _self_ref
8d3837e

SavK1 Claude Sonnet 4.6 commited on

fix(pm_ops_trainer): capture rewards via rollout_func wrapper, not inputs
dc36ffd

SavK1 Claude Sonnet 4.6 commited on

fix(train_v3): use PMOpsGRPOTrainer to fix reward kwarg plumbing
22d40fb

SavK1 Claude Sonnet 4.6 commited on

Merge remote-tracking branch 'hf/main' into train/v1
1b68f93

SavK1 commited on

fix(training): fix GRPO reward bugs + add v3 notebook with SFT warmup
703b668

SavK1 Claude Sonnet 4.6 commited on

fix(reward): harsh -1.0 for zero JSON output, -0.30 for zero task completion
5bcbe7f

Aditya Guntur commited on

fix(rollout): safe model unwrapping for accelerate/PEFT/DDP in _generate_no_vllm
606e517

Aditya Guntur commited on

fix(rollout): replace generate_rollout_completions (vLLM-only) with direct model.generate()
5d330b7

Aditya Guntur commited on

feat(training): PMOpsGRPOTrainer — override _calculate_rewards to inject rollout rewards directly
29d6757

Aditya Guntur commited on

fix(train_v2): drop Unsloth, use bitsandbytes+PEFT to fix dep conflicts
14d4979

SavK1 Claude Sonnet 4.6 commited on

fix(training): reward signal flow + new v2 notebook
5e6d53a

SavK1 Claude Sonnet 4.6 commited on

made minor type check changes, open env has strict type checking
74d0de6

SavK1 commited on

modifying the training script to be more memory efficient: Unsloth, also reduced the number of steps to 15 instead of 40
860d7e4

SavK1 commited on

writing the GRPO script to train qwen1.7 on A100 GRPO
5bce7ac

SavK1 commited on

modified inference
6c48c5d

Aditya Guntur commited on

updated inference
89d9242

Aditya Guntur commited on

Fix pyproject.toml: use setuptools.build_meta, add project.scripts entry point
673e239

Aditya Guntur commited on

Fix: inherit from openenv Environment base class to resolve reset_async/concurrency errors
e48dce9

Aditya Guntur commited on

Add SUPPORTS_CONCURRENT_SESSIONS=True to PMOpsEnvironment
42466e3

Aditya Guntur Claude Sonnet 4.6 commited on

Add close() method required by openenv create_app validation
dab7b94

Aditya Guntur Claude Sonnet 4.6 commited on

Fix imports and Dockerfile for HF deployment
410e78d

Aditya Guntur Claude Sonnet 4.6 commited on

Fix Dockerfile: use pip instead of uv sync --frozen
f9375ea

Aditya Guntur Claude Sonnet 4.6 commited on

Fix README.md encoding: convert from UTF-16 to UTF-8
aa8d9a1

Aditya Guntur Claude Sonnet 4.6 commited on

base iteration
1f213fe

Aditya Guntur commited on

first commit
48d089d

Aditya Guntur commited on