夜雨聆风学习资料网

ARTICLE · 1025665

《神经网络与深度学习通识版》第七章习题选3

《神经网络与深度学习通识版》第七章习题选3
第7,8,9题。
第七题:
AlphaGo学习了人类棋谱,AlphaZero则完全不看人类数据从零自我对弈.请思考:AlphaZero的更强表现,是对‘人类经验’的否定,还是对‘人类经验所能触及之上限’的突破?二者看似相似,含义其实大不相同.
据说从这一事实出发,可以判断出人类经验所能触及的上限远远没有达到物理世界的全局最优,虽然对于任何一个理性的人,理解这一点是很自然的事,但是亲眼目睹在如此短的时间内,通过这么简单的方式就实现突破,还是有相当震撼的。
既然说是没有达到全局最优,那么是不是局部最优呢?应该说,这也是显然的,其实即便是AlphaZero完全不用人类棋谱转而采用只设定规则(蒙特卡洛树搜索下一步),从零开始自我对弈的方式进行训练,并且最终战胜人类之后,回顾双方对弈的过程,也能看到,双方的开局和收官的方式是很类似的,这说明在人类花费数千年积累的经验中,只是对这两段进行了较充分的探索,但是在中盘阶段,还有非常大的盲区,这也说明用强化学习来模拟人们的学习方式是能够对人们做出巨大帮助的。
既然人类部分经验确实已经接近局部最优,那么和AI的成果之间就不是一种对立和被取代的关系,相反,可以认为AI的成果在某种程度上验证和认可了人类经验,但是又成为人类经验集合的超集。下一步会不会再出现更进一步的超集呢?这也会是很自然的事。
但是据说目前这种对人类经验的全面突破,还是局限在类似围棋这种规则明确、目标清晰、过程可模拟、试错成本低的有限领域,对于规则模糊、目标多元的开放环境,人类经验的价值目前还没有被完全取代。
这个结果既是对强化学习方式的验证,也是对人们继续探索的鼓舞,在创新的途径上传承和积累很重要,发现也会成为新的模式。
第八题:
RLHF本质上是把‘人类偏好’作为奖励,这和AlphaGo的‘胜负’奖励有一点根本差别:人类偏好是主观的、模糊的、会冲突的.请分析这种主观奖励带来了什么新问题(例如谄媚、过度拒答、偏见放大)?
这个问题似乎和上一章讨论规模定律催生的大模型训练以及随之而来的安全问题有些类似,也说明作者在机器学习领域的研究和洞察足够深入广泛,对读者的启发也是足够全面的。也许不是所有人都会非常深入地去了解此类问题。
RLHF是一个缩写,意思非常直白,就是利用人类反馈所进行的强化学习训练,但是单从名字还不能完全领会其工作全貌以及其所期望解决的问题。看起来还确实和刚才说的上一章那个问题有关系。正式由于大模型预训练结束后,有很多潜在的安全问题,因此需要对其进行监督微调和价值观对齐训练。应该说,正是由于目前阶段没有比人的直接参与反馈更好的方式来展现所谓的人类价值观,因此RLHF方法才会被如此广泛地加以运用,似乎成为解决此问题的不二途径。至于采用强化学习的方法,自然和人类反馈的奖励形式关联在一起。
所以说,从其要达成的目标就很清楚,训练是为了使预训练后的模型的输出更符合人类偏好和价值观。具体分析人类给出反馈时对输出的排序高低,自然是希望其认同自己观点、语气温和有礼的排名靠前、对于和自己价值观偏差大的回答永远排名最后、主流多数观点被不断强化、少数观点被过度惩罚、边缘表达被反复压制、刻板印象被统计放大,总之这种训练方法本来就是要引入人类的主观情感,而不是只给出客观数据,模型自然在反复训练之后学习到顺着用户说、采取保守策略、拒绝风险回答、强调部分群体的偏见等等策略,这不是个人标注行为造成的结果,而是群体的行为在学习规则的作用下形成的。
总之,这是在只使用全集客观数据之后,为了修正模型偏离人类价值观的问题,不得不进行带有主观反馈的强化学习出现的附带后果,应该说,这是一个系统性结构性的问题,而不是强化学习本身的问题。
第九题:
奖励作弊(reward hacking)是强化学习的经典病症,智能体找到了奖励的漏洞而不是真正完成任务.请举一个具体例子(现实或虚构均可),并思考:这是否也预示了未来AGI对齐问题的关键难点?
本章中提出这个问题,不仅是为了暴露目前强化学习中一个的一个暗面,更重要的是引出对目前强化学习中最重要的奖励机制的设计的反思。
题目中提到的这个经典问题叫做奖励作弊,实际上从英文来看,hacking是动作,reward实际上是动作的目标,主语被省略。其实应该是智能体hacking了reward。中文中用作弊来表达对智能体不听话的不满,但实际上,智能体只是忠实地完成了针对奖励函数最大化的学习任务,只不过是没有按照设计者预期的方式而已,这似乎又是一个突破人类认知的案例,并且这一次,人类认知也许被打上了较低的分数。
网上有提示认为,目前的奖励机制的设计方式也许是问题的根源,一个更简单的思路是,为何不让智能体从零开始自己去设计所需要的奖励函数呢?也许用人类认知来架设从期望完成的任务,到检验任务完成度的方案之间的桥梁,这个任务本身也可以通过机器学习的方式去完成。
当然,也可能首先从正向的角度,从多个维度去设计奖励函数,减少出现漏洞的可能性,总之,题目中已经给出了提示,这个问题的总的限定领域是一个对齐问题,不过名称比较吓人,是AGI的对齐问题,不管怎么称呼,这是一个很明确的探索入口,读者可以根据这个提示继续深入了解未来可能的方案。

相关学习资料

返回首页浏览学习资料