DIAL: GRPO on looped models Collection Random-depth SFT and depth-as-action GRPO checkpoints for Ouro-1.4B-Thinking. • 2 items • Updated 6 days ago • 1
DIAL: GRPO on looped models Collection Random-depth SFT and depth-as-action GRPO checkpoints for Ouro-1.4B-Thinking. • 2 items • Updated 6 days ago • 1
RL4RLM: Training Native Recursive Language Models Collection LoRA adapters (Qwen3-1.7B) for training RLMs via RL. SFT, STaR, DPO, GRPO-v4. Code: github.com/pythonomar22/rl4rlm • 4 items • Updated Mar 3 • 1
RL4RLM: Training Native Recursive Language Models Collection LoRA adapters (Qwen3-1.7B) for training RLMs via RL. SFT, STaR, DPO, GRPO-v4. Code: github.com/pythonomar22/rl4rlm • 4 items • Updated Mar 3 • 1