pushpam14 commited on
Commit
6fc3f63
·
verified ·
1 Parent(s): 2ce0305

Sync BLOG.md with public WandB Report URL

Browse files
Files changed (1) hide show
  1. BLOG.md +4 -4
BLOG.md CHANGED
@@ -40,7 +40,7 @@ We built a hosted OpenEnv environment called **Enterprise Contract Guardian**.
40
  Live environment: https://huggingface.co/spaces/pushpam14/api-contract-validator
41
  Primary HF Space writeup: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
42
  Trained adapter: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
43
- Training run: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/runs/gch0eg3k
44
  Source code: https://github.com/kumarpushpam17-personal/Hackathon
45
  GitHub README: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
46
 
@@ -160,7 +160,7 @@ We trained Qwen2.5-7B-Instruct (4-bit) with LoRA r=16 for 300 GRPO steps on a si
160
 
161
  The important detail: the reward function is the **environment's own grader**, called step by step. This is not supervised fine-tuning on a static dataset. The model samples actions, sends them to the OpenEnv environment, receives reward, and GRPO updates the LoRA adapter from that feedback.
162
 
163
- [Public WandB run: `grpo-7b-l4-300steps-v3`](https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/runs/gch0eg3k)
164
 
165
  ## 5) Results
166
 
@@ -196,7 +196,7 @@ The training run is backed by public, reproducible artifacts:
196
 
197
  | Artifact | Link |
198
  |---|---|
199
- | Public WandB run | https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/runs/gch0eg3k |
200
  | Training proof summary | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/TRAINING_RUN_PROOF.md |
201
  | Full training log | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_full_log.txt |
202
  | Training state JSON | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_state.json |
@@ -224,7 +224,7 @@ There is no existing RL benchmark for multi-service contract reasoning. This is
224
  - **Live environment**: https://huggingface.co/spaces/pushpam14/api-contract-validator
225
  - **Primary HF Space writeup**: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
226
  - **Trained adapter**: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
227
- - **WandB run**: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/runs/gch0eg3k
228
  - **GitHub**: https://github.com/kumarpushpam17-personal/Hackathon
229
  - **GitHub README**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
230
  - **Story doc + technical guide**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/ENTERPRISE_CONTRACT_GUARDIAN_STORY.md
 
40
  Live environment: https://huggingface.co/spaces/pushpam14/api-contract-validator
41
  Primary HF Space writeup: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
42
  Trained adapter: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
43
+ Training run: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb
44
  Source code: https://github.com/kumarpushpam17-personal/Hackathon
45
  GitHub README: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
46
 
 
160
 
161
  The important detail: the reward function is the **environment's own grader**, called step by step. This is not supervised fine-tuning on a static dataset. The model samples actions, sends them to the OpenEnv environment, receives reward, and GRPO updates the LoRA adapter from that feedback.
162
 
163
+ [Public WandB run: `grpo-7b-l4-300steps-v3`](https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb)
164
 
165
  ## 5) Results
166
 
 
196
 
197
  | Artifact | Link |
198
  |---|---|
199
+ | Public WandB run | https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb |
200
  | Training proof summary | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/TRAINING_RUN_PROOF.md |
201
  | Full training log | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_full_log.txt |
202
  | Training state JSON | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_state.json |
 
224
  - **Live environment**: https://huggingface.co/spaces/pushpam14/api-contract-validator
225
  - **Primary HF Space writeup**: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
226
  - **Trained adapter**: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
227
+ - **WandB run**: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb
228
  - **GitHub**: https://github.com/kumarpushpam17-personal/Hackathon
229
  - **GitHub README**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
230
  - **Story doc + technical guide**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/ENTERPRISE_CONTRACT_GUARDIAN_STORY.md