LuAITools.com
提交工具
🎯AI
RLHF

人类反馈强化学习

RLHF 通过人类的偏好排序来调整模型行为,是让 AI 输出更安全、更符合人预期的核心训练技术之一。

RLHF 是什么?

大模型刚训练完时,就像一个「什么都敢说」的天才少年:知识渊博,但分不清什么话该说、什么话不该说,也搞不懂你到底想要哪种回答。RLHF(人类反馈强化学习)要做的,就是给它请一位「导师」——用人类的偏好,一点点把它调教成「既有本事、又懂分寸」的样子。

它为什么需要人类参与?

「说得好」不等于「说得对」
模型能写出一堆话,但未必是你想要的。比如问它「怎么减肥」,它可能给你列出危险的极端方法。人类反馈的价值,就是告诉它:这种回答是坏的,那种才是好的。
好坏没有固定标准,得靠人来教
什么叫「有帮助」、什么叫「无害」、什么叫「符合预期」,这些判断很主观,机器自己学不来,只能靠大量的人工标注。

RLHF 大概是怎么做的?

第一步:训练一个「奖励模型」
先让模型对同一个问题给出好几个回答,再让人把这些回答从好到坏排个序。拿这些排序数据,训练出一个「评分器」,让它学会给回答打分——分数越高的,越是人类喜欢的。
第二步:用评分器反过来调模型
有了评分器之后,就可以让模型不断生成回答、不断被打分,再朝「分数更高」的方向调整自己。这个过程循环往复,模型就越来越懂人的心意。

它解决了什么问题?

RLHF 是 ChatGPT 这类产品「好用」的关键之一。它让 AI 回答得更符合人的价值观、更少胡编乱造、也更愿意承认「我不知道」。可以说,没有 RLHF,大模型就只是「会说」,而有了 RLHF,它才变得「会说人话、也听得进人话」。

一句话记住:RLHF 就是用人类的判断当「尺子」,一步步量着调教 AI,让它从「会说话」变成「懂分寸、合心意」。

评论