强化学习是什么?
想想你怎么训练一只小狗:它做对了,你给颗零食;做错了,就得不到奖励。几次下来,它就知道该怎么做。强化学习(RL)用的就是这套逻辑——让 AI 在环境中不断试错,做对了给奖励,做错了扣分,慢慢学会一套「最优策略」。它和监督学习有什么不同?
监督学习:照着标准答案学有人告诉它每个例子的正确答案,它模仿。
强化学习:自己在试错中学
没人给它标准答案,它得自己探索,从「奖励信号」里悟出什么是对的。
几个关键概念
智能体与环境智能体在环境里做动作,环境给它反馈。
奖励(reward)
做得好加分、做不好扣分,是它唯一的学习信号。
策略(policy)
最终学会的那套「遇到什么情况该怎么做」的规则。
它为什么重要?
强化学习早就让 AI 在围棋、电子游戏里打败人类,如今更是 RLHF、推理模型等大模型训练的关键一环。凡是「没有标准答案、只能靠反复试」的问题,都少不了它。一句话记住:强化学习就是「做对了给糖、做错了没糖」,让 AI 在反复试错中自己学会最优解。
评论