Paper: Distributed Direct Preference Optimization OpenReview: ljNZyrAlaa arXiv: 2605.20696v1 (only revision at audit time) PDF SHA-256: ce6faba012d2e862d59aa6d5a05fccf6f004e331d4769ae95607ec63483904c5 source archive SHA-256: 43d8384c31b601422addeba43f148391e8cf39f756a28a72fb9c4ec316b48ec4 Stanford Human Preferences rows 0..599 from the Hugging Face datasets server: rows 0-99 SHA-256: ba49c5332c94e438dfa575c84d8389f32464b941b973a96a0120052c05d676fe rows 100-199 SHA-256: 3f4a7d7e1540b8b53ccf5f05d79de799de24a93fb0d4496fa2e9f842f2b28ac8 rows 200-299 SHA-256: 57d07b51e1498f272feefcc9d9886d65e0730c47ad474537d58b633bf89ea52c rows 300-399 SHA-256: 01fa42003ab85554ff3d55d6152ecebb6775a835df6cef10acf13ca2792fdf8d rows 400-499 SHA-256: 31ada479d91a26ccc0ceadda09a1c2b3e97fa03ae1bc43784225dd3609cd4ea7 rows 500-599 SHA-256: 17a8823add2699a4cbdcaab5e886926d37f9367b247a58534f9edcbed086ee39 The sole revision matches every live theorem number. Scope retained: Corollary 5.2 removes partial-participation amplification but retains averaged- client variance; Theorem 5.4 assumes bounded drift; Theorem 5.5 is a constructed DPO-like family; and Theorem 6.1 assumes symmetric doubly stochastic mixing.