永續 AI 資料庫 / AI 應用直接偏好最佳化Direct Preference Optimization(DPO)別名:DPO直接偏好最佳化是利用成對偏好資料直接調整語言模型的訓練方法,原始方法不需另訓練顯式獎勵模型或執行傳統強化學習迴圈。企業如何使用這個概念?評估用偏好對改善回答風格的可行性。容易混淆之處DPO 使用偏好比較,不等同只模仿單一標準答案。定義依據原始研究論文(arXiv)來源查核日期:2026-09-09繁體中文為編輯工作譯名;本次未取得統一官方繁中譯名的證據,英文名稱保留概念辨識,不冒充標準條文譯本相關服務AI 應用服務 →返回查找結果