Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver.
HyunseokLee
hyunseoki
AI & ML interests
None yet
Organizations
RLTR: Learning Robust Reasoning via Transfer
Checkpoints (bf16, 50-step) + train/eval data for RLTR (transfer-reward RL) incl. cross-family (gemma) receiver.
Meta-Harness v1b: Policy x Harness Co-Evolution
Co-evolution GRPO (verl, Qwen3.5): shared policy = grader/solver + harness-editor. IMO/paper-review/math. bf16 checkpoints + evolved scaffolds.
Trajectory-Memory RAG for GUI Agents
Does a retrieved past step (screenshot+action) help a GUI agent pick the next action? Cold Qwen3.5-4B, 3-arm A/B. v1 single-seed.