Claim 4 (Thm 11): test variance bound with expressive deep MLP policies (up to 5089 params) 504e723 verified DineshAI commited on 11 days ago
Restore judged-good logbook ba80c845 (revert stale 08:12 auto-sync that dropped claim content) 6a426d2 verified DineshAI commited on 11 days ago
Update logbook: Repro - Non-Uniform Noise-to-Signal Ratio in the REINFORCE Policy-Gradient Estimator (Ol99zoW31J) f9af3c3 verified DineshAI commited on 11 days ago
Rewrite Claim 3 (Thm 8 exponential variance vs horizon); add Claim 4 (Thm 11 NN-policy bound) and Claim 5 (Prop 10 polynomial moment-evaluation) ba80c84 verified DineshAI commited on 12 days ago
Update logbook: Repro - Non-Uniform Noise-to-Signal Ratio in the REINFORCE Policy-Gradient Estimator (Ol99zoW31J) 8ac3be6 verified DineshAI commited on 12 days ago