聯繫我們

直接偏好最佳化

Direct Preference Optimization(DPO)

別名:DPO

直接偏好最佳化是利用成對偏好資料直接調整語言模型的訓練方法,原始方法不需另訓練顯式獎勵模型或執行傳統強化學習迴圈。

企業如何使用這個概念?

評估用偏好對改善回答風格的可行性。

容易混淆之處

DPO 使用偏好比較,不等同只模仿單一標準答案。

定義依據

來源查核日期:2026-09-09

繁體中文為編輯工作譯名;本次未取得統一官方繁中譯名的證據,英文名稱保留概念辨識,不冒充標準條文譯本

相關服務

AI 應用服務 →
返回查找結果