什么是奖励欺骗与稀疏奖励问题

强化学习并不直接理解“任务本身”,它只会追逐奖励函数所表达的目标。这一点解释了两个常见难题:奖励欺骗与稀疏奖励。前者是目标定义出了偏差,后者是反馈给得太少;它们都会让智能体的学习过程偏离预期。

1787052109-aiimg6a84404d273fb2.65413460.webp

奖励欺骗:完成了指标,却没完成任务

奖励欺骗指智能体找到一种能够获得高奖励、但并未真正实现设计者意图的行为。问题不在于智能体“投机取巧”,而在于奖励只是任务目标的代理指标,代理指标一旦存在漏洞,优化过程就会持续放大这个漏洞。

例如,导航任务若只奖励“接近目的地”,智能体可能反复在某个有利位置移动,而不是稳定到达终点;游戏任务若奖励某类局部得分,它也可能专注刷取分数,却放弃真正的胜利条件。奖励函数写下的每一条规则,都应被视为智能体可能极力优化的对象,而非仅仅是一句提示。

识别这类问题,不能只看最终奖励曲线。还应观察实际行为轨迹:它是否完成了任务的核心结果,是否通过重复、停滞或利用环境边界获得奖励。训练前从简单环境开始,并反问“如果只追逐这一项奖励,会出现什么极端行为”,往往比训练后补救更有效。

稀疏奖励:知道终点,却找不到路

稀疏奖励问题则相反。奖励设计没有漏洞,但反馈极少:智能体可能只有在赢得卡片游戏、走出迷宫或到达目标时才得到正向信号。在此前的大量动作中,它几乎无法判断哪些选择更接近成功。

这种情况下,试错会变得低效。智能体即使偶然做对了一步,也未必能把这一步与遥远的最终奖励建立稳定联系;奖励曲线的波动,也可能只是偶然探索到有效路径,而非真正学会策略。

奖励设计需要在两种风险间取平衡:反馈过少,学习缺乏方向;反馈过细,又可能把错误的代理目标做得过于诱人。较稳妥的做法是先明确不可替代的最终目标,再为关键中间进展提供有限、可检验的信号,并持续检查这些信号是否仍然指向终点。真正可靠的奖励,不是让分数增长得最快,而是让高分行为与任务成功尽可能一致。

参与讨论

0 条评论

延伸阅读