Efficient Reasoning via Decoupled Reward Policy Optimization
Gang Li
ganglii
AI & ML interests
None yet
Recent Activity
updated a dataset 3 days ago
ganglii/self_replay2k10 published a dataset 3 days ago
ganglii/self_replay2k10 updated a dataset 5 days ago
ganglii/OpenMathReasoning_len8k_0.6_self_replay2k10Organizations
None yet