Robuta

https://ar5iv.labs.arxiv.org/html/2305.18290 [2305.18290] Direct Preference Optimization: Your Language Model is Secretly a Reward Model While large-scale unsupervised language models (LMs) learn broad world knowledge and some reasoning skills, achieving precise control of their behavior is... preference optimizationyour language https://arxiv.org/abs/2505.21061 [2505.21061] LPOI: Listwise Preference Optimization for Vision Language Models Abstract page for arXiv paper 2505.21061: LPOI: Listwise Preference Optimization for Vision Language Models preference optimizationvisionlanguagemodels https://3rdat.github.io/publication/2024-11-01-TPO-6 Triple Preference Optimization: Achieving Better Alignment using a Single Step Optimization - Aswin... May 1, 2024 - PhD Student in CS at ASU. a single steppreference optimizationtripleachievingbetter https://arxiv.org/abs/2409.13474 [2409.13474] Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language... Abstract page for arXiv paper 2409.13474: Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models preference optimization https://huggingface.co/papers/2412.02685 Paper page - T-REG: Preference Optimization with Token-Level Reward Regularization Join the discussion on this paper page paper pagepreference optimizationreg https://arxiv.org/abs/2501.13919 [2501.13919] Temporal Preference Optimization for Long-Form Video Understanding Abstract page for arXiv paper 2501.13919: Temporal Preference Optimization for Long-Form Video Understanding preference optimizationlong formtemporalvideounderstanding https://huggingface.co/papers/2509.10515 Paper page - Adaptive Preference Optimization with Uncertainty-aware Utility Anchor Join the discussion on this paper page paper pagepreference optimizationadaptiveuncertaintyaware https://huggingface.co/papers/2406.06424 Paper page - Margin-aware Preference Optimization for Aligning Diffusion Models without Reference Join the discussion on this paper page paper pagepreference optimization https://scholars.cityu.edu.hk/en/publications/an-optimization-approach-to-multiperson-decision-making-based-on-/fingerprints/ An optimization approach to multiperson decision making based on different formats of preference... https://arxiv.org/html/2512.17370v1 TakeAD: Preference-based Post-optimization for End-to-end Autonomous Driving with Expert Takeover... https://arxiv.org/html/2407.09072v1 New Desiderata for Direct Preference Optimization newdesideratadirectpreferenceoptimization https://arxiv.org/abs/2508.14460 [2508.14460] DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization Abstract page for arXiv paper 2508.14460: DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization https://huggingface.co/papers/2411.07595 Paper page - Entropy Controllable Direct Preference Optimization Join the discussion on this paper page paper pageentropycontrollabledirectpreference https://arxiv.org/abs/2407.18676 [2407.18676] Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference... Abstract page for arXiv paper 2407.18676: Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift right now https://pmc.ncbi.nlm.nih.gov/articles/PMC12083703/ Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization... The scarcity of high-quality multimodal biomedical data limits the ability to effectively fine-tune pretrained Large Language Models (LLMs) for specialized... large language modelsknowledge transfermultimodalintegrated https://research.birmingham.ac.uk/en/publications/r-metric-evaluating-the-performance-of-preference-based-evolution/ R-Metric: Evaluating the Performance of Preference-Based Evolutionary Multi-Objective Optimization... the performance https://huggingface.co/papers/2601.10416 Paper page - LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time... Join the discussion on this paper page