Spaces:
Sleeping
Sleeping
Sync BLOG.md with public WandB Report URL
Browse files
BLOG.md
CHANGED
|
@@ -40,7 +40,7 @@ We built a hosted OpenEnv environment called **Enterprise Contract Guardian**.
|
|
| 40 |
Live environment: https://huggingface.co/spaces/pushpam14/api-contract-validator
|
| 41 |
Primary HF Space writeup: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
|
| 42 |
Trained adapter: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
|
| 43 |
-
Training run: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/
|
| 44 |
Source code: https://github.com/kumarpushpam17-personal/Hackathon
|
| 45 |
GitHub README: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
|
| 46 |
|
|
@@ -160,7 +160,7 @@ We trained Qwen2.5-7B-Instruct (4-bit) with LoRA r=16 for 300 GRPO steps on a si
|
|
| 160 |
|
| 161 |
The important detail: the reward function is the **environment's own grader**, called step by step. This is not supervised fine-tuning on a static dataset. The model samples actions, sends them to the OpenEnv environment, receives reward, and GRPO updates the LoRA adapter from that feedback.
|
| 162 |
|
| 163 |
-
[Public WandB run: `grpo-7b-l4-300steps-v3`](https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/
|
| 164 |
|
| 165 |
## 5) Results
|
| 166 |
|
|
@@ -196,7 +196,7 @@ The training run is backed by public, reproducible artifacts:
|
|
| 196 |
|
| 197 |
| Artifact | Link |
|
| 198 |
|---|---|
|
| 199 |
-
| Public WandB run | https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/
|
| 200 |
| Training proof summary | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/TRAINING_RUN_PROOF.md |
|
| 201 |
| Full training log | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_full_log.txt |
|
| 202 |
| Training state JSON | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_state.json |
|
|
@@ -224,7 +224,7 @@ There is no existing RL benchmark for multi-service contract reasoning. This is
|
|
| 224 |
- **Live environment**: https://huggingface.co/spaces/pushpam14/api-contract-validator
|
| 225 |
- **Primary HF Space writeup**: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
|
| 226 |
- **Trained adapter**: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
|
| 227 |
-
- **WandB run**: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/
|
| 228 |
- **GitHub**: https://github.com/kumarpushpam17-personal/Hackathon
|
| 229 |
- **GitHub README**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
|
| 230 |
- **Story doc + technical guide**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/ENTERPRISE_CONTRACT_GUARDIAN_STORY.md
|
|
|
|
| 40 |
Live environment: https://huggingface.co/spaces/pushpam14/api-contract-validator
|
| 41 |
Primary HF Space writeup: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
|
| 42 |
Trained adapter: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
|
| 43 |
+
Training run: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb
|
| 44 |
Source code: https://github.com/kumarpushpam17-personal/Hackathon
|
| 45 |
GitHub README: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
|
| 46 |
|
|
|
|
| 160 |
|
| 161 |
The important detail: the reward function is the **environment's own grader**, called step by step. This is not supervised fine-tuning on a static dataset. The model samples actions, sends them to the OpenEnv environment, receives reward, and GRPO updates the LoRA adapter from that feedback.
|
| 162 |
|
| 163 |
+
[Public WandB run: `grpo-7b-l4-300steps-v3`](https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb)
|
| 164 |
|
| 165 |
## 5) Results
|
| 166 |
|
|
|
|
| 196 |
|
| 197 |
| Artifact | Link |
|
| 198 |
|---|---|
|
| 199 |
+
| Public WandB run | https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb |
|
| 200 |
| Training proof summary | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/TRAINING_RUN_PROOF.md |
|
| 201 |
| Full training log | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_full_log.txt |
|
| 202 |
| Training state JSON | https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/results/training_state.json |
|
|
|
|
| 224 |
- **Live environment**: https://huggingface.co/spaces/pushpam14/api-contract-validator
|
| 225 |
- **Primary HF Space writeup**: https://huggingface.co/spaces/pushpam14/api-contract-validator/blob/main/BLOG.md
|
| 226 |
- **Trained adapter**: https://huggingface.co/pushpam14/api-contract-validator-grpo-7b
|
| 227 |
+
- **WandB run**: https://wandb.ai/pushpamsubscriptions-inn/openenv-contract-guardian/reports/Enterprise-Contract-Guardian-GRPO-training-Qwen-7B-LoRA-300-steps---VmlldzoxNjY3MTAxMA?accessToken=3dhumexjta1umyk04rq6dx47iww4t25utt3j0x7063b7pvzzibp8jah29grhlwpb
|
| 228 |
- **GitHub**: https://github.com/kumarpushpam17-personal/Hackathon
|
| 229 |
- **GitHub README**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/README.md
|
| 230 |
- **Story doc + technical guide**: https://github.com/kumarpushpam17-personal/Hackathon/blob/main/api_contract_validator/ENTERPRISE_CONTRACT_GUARDIAN_STORY.md
|