meta-agent-gym β Qwen3-1.7B LoRA Adapter (GRPO/DAPO)
LoRA adapter trained with GRPO + DAPO loss on the meta-agent-gym reinforcement learning environment (OpenEnv Hackathon 2026).
The policy learns to emit discrete commands to produce deployable AGENT.md
specifications: set_name, set_description, add_skill, write_prompt,
set_model, submit.
Training Results
| Metric | Value |
|---|---|
| Success rate | 80% (8/10 eval rollouts) |
| Mean reward | +7.68 |
| Base model | Qwen3-1.7B, 4-bit LoRA via Unsloth |
| Algorithm | GRPO with DAPO loss |
| Hardware | Google Colab T4 |