Efficient Reasoning via Decoupled Reward Policy Optimization
Gang Li
ganglii
AI & ML interests
None yet
Recent Activity
updated a dataset 2 days ago
ganglii/self_replay2k10 published a dataset 2 days ago
ganglii/self_replay2k10 updated a dataset 4 days ago
ganglii/OpenMathReasoning_len8k_0.6_self_replay2k10Organizations
None yet