| Paper: Distributed Direct Preference Optimization | |
| OpenReview: ljNZyrAlaa | |
| arXiv: 2605.20696v1 (only revision at audit time) | |
| PDF SHA-256: ce6faba012d2e862d59aa6d5a05fccf6f004e331d4769ae95607ec63483904c5 | |
| source archive SHA-256: 43d8384c31b601422addeba43f148391e8cf39f756a28a72fb9c4ec316b48ec4 | |
| Stanford Human Preferences rows 0..599 from the Hugging Face datasets server: | |
| rows 0-99 SHA-256: ba49c5332c94e438dfa575c84d8389f32464b941b973a96a0120052c05d676fe | |
| rows 100-199 SHA-256: 3f4a7d7e1540b8b53ccf5f05d79de799de24a93fb0d4496fa2e9f842f2b28ac8 | |
| rows 200-299 SHA-256: 57d07b51e1498f272feefcc9d9886d65e0730c47ad474537d58b633bf89ea52c | |
| rows 300-399 SHA-256: 01fa42003ab85554ff3d55d6152ecebb6775a835df6cef10acf13ca2792fdf8d | |
| rows 400-499 SHA-256: 31ada479d91a26ccc0ceadda09a1c2b3e97fa03ae1bc43784225dd3609cd4ea7 | |
| rows 500-599 SHA-256: 17a8823add2699a4cbdcaab5e886926d37f9367b247a58534f9edcbed086ee39 | |
| The sole revision matches every live theorem number. Scope retained: | |
| Corollary 5.2 removes partial-participation amplification but retains averaged- | |
| client variance; Theorem 5.4 assumes bounded drift; Theorem 5.5 is a | |
| constructed DPO-like family; and Theorem 6.1 assumes symmetric doubly | |
| stochastic mixing. | |