Ctrl+K
- claim-1-maxrl-defines-a-compute-indexed-family-of-sample-based-objectives-that-interpolates-between-standard-rl-and-exact-maximum-likelihood-as-sampling-compute-increases-abstract
- claim-2-the-maxrl-objectives-admit-a-simple-unbiased-policy-gradient-estimator-for-non-differentiable-sampling-settings-abstract
- claim-3-the-paper-claims-maxrl-converges-to-maximum-likelihood-optimization-in-the-infinite-compute-limit-abstract
- claim-4-empirically-maxrl-pareto-dominates-tested-existing-methods-across-all-evaluated-models-and-tasks-abstract
- claim-5-maxrl-reports-up-to-20x-test-time-scaling-efficiency-gains-compared-with-a-grpo-trained-counterpart-abstract
- conclusion
- executive-summary
- 1.6 kB