meta-agent-gym β€” Qwen3-1.7B LoRA Adapter (GRPO/DAPO)

LoRA adapter trained with GRPO + DAPO loss on the meta-agent-gym reinforcement learning environment (OpenEnv Hackathon 2026).

The policy learns to emit discrete commands to produce deployable AGENT.md specifications: set_name, set_description, add_skill, write_prompt, set_model, submit.

Training Results

Metric Value
Success rate 80% (8/10 eval rollouts)
Mean reward +7.68
Base model Qwen3-1.7B, 4-bit LoRA via Unsloth
Algorithm GRPO with DAPO loss
Hardware Google Colab T4

Links

Downloads last month

-

Downloads are not tracked for this model. How to track
Video Preview
loading

Space using Kaviya-M/meta-agent-gym-adapter 1