聯繫我們

人類回饋強化學習

Reinforcement Learning from Human Feedback(RLHF)

別名:RLHF

人類回饋強化學習是利用人對模型輸出的評價或偏好建立回饋訊號,再以強化學習調整模型的方法,用於改善回應與偏好的一致性。

企業如何使用這個概念?

理解模型如何以人類偏好調整回答行為。

容易混淆之處

RLHF 不代表每次使用模型都有真人即時審查。

定義依據

來源查核日期:2026-09-09

繁體中文為編輯工作譯名;本次未取得統一官方繁中譯名的證據,英文名稱保留概念辨識,不冒充標準條文譯本

相關服務

AI 應用服務 →
返回查找結果