rDPO Kills Off-Policy Preference Data for Visual Reasoning
rDPO introduces instance-specific rubrics for visual preference optimization, outperforming standard DPO on fine-grained reasoning tasks. This paper argues that off-policy perturbations are fundamentally inadequate for multimodal alignment.











