Hello-Agent第一章习题分享第一章习题
1.请分析以下四个case中的主体是否属于智能体,如果是,那么属于哪种类型的智能体(可以从多个分类维度进行分析),并说明理由:case A:一台符合冯·诺依曼结构的超级计算机,拥有高达每秒2EFlop的峰值算力答:不属于智能体。不能通过环境感知外界环境,只能依靠人为输入得到结果。而且不能自己进行思考提高回答质量。case B:特斯拉自动驾驶系统在高速公路上行驶时,突然检测到前方有障碍物,需要在毫秒级做出刹车或变道决策。答:属于智能体。属于基于模型的反射智能体-反应式智能体,有自己的内部世界,在某些规定的情况下做出反应,有初步记忆。及时反映(毫秒级别)没有长远规划。case C:AlphaGo在与人类棋手对弈时,需要评估当前局面并规划未来数十步的最优策略。答:属于规划式智能体。回答前有思考未来局势的能力,根据外界环境的变化不断更新自己的思考再根据环境的反馈进行新一轮的思考得到基于当前和未来变化的最优解。此智能体还有记忆功能,case D:ChatGPT扮演的智能客服在处理用户投诉时,需要查询订单信息、分析问题原因、提供解决方案并安抚用户情绪。答;属于混合式智能体。拥有反应式和规划式二者的优点的结合。它需要根据不同用户的提问快速做出应答,先安抚再解决问题。不同的用户提出的问题不同,因此并没有统一固定的话术模板。用户提出的问题解决难度不同,解答方式也不同需要考虑未来如果再次出现这种情况怎么能得到即满足用户又能维护公司的利益的最优解。并且能将回答计入到经验库中,方便以后学习优化。是现代LLM智能体的代表。2.假设你需要为一个"智能健身教练"设计任务环境。这个智能体能够:a.通过可穿戴设备监测用户的心率、运动强度等生理数据;b.用户的健身目标(减脂/增肌/提升耐力)动态调整训练计划;请使用PEAS模型完整描述这个智能体的任务环境,并分析该环境具有哪些特性(如部分可观察、随机性、动态性等)。答:(1)P(Performance,性能度量):评判任务完成好坏的标准;(2)E(Environment,环境):智能体所处的外部场景与约束;(3)A(Actuators,执行器):智能体可采取的行动手段;(4)S(Sensors,传感器):智能体可获取的环境信息来源。P:根据不同用户以及用户健身目标制定相对应的健身计划。例如:男性用户目标减脂,减脂持续时间和目标减脂后体重。E:根据用户健身的外部环境制定合理的健身计划,不同的场地给出不同的健身计划。A:根据用户的健身动作给出实时指导,纠正动作。用户可根据自己喜好选择不同的提示音。S:可根据用户上传的实时体重,计算用户的减脂效率以此作为依据为后续的健身做计划。也可以支持用户上传的每日餐食判断用户每日摄入的热量,结合实际情况来给用户提出每日饮食计划。3. 某电商公司正在考虑两种方案来处理售后退款申请:方案 A( Workflow ):设计一套固定流程,例如: A.1 对于一般商品且在 7 天之内,金额 < 100RMB 自动通过;00-500RMB 由客服审核;500RMB需主管审批;而特殊商品(如定制品)一律拒绝退款A.2 对于超过7天的商品,无论金额,能由客服审核或主管审批;方案 B( >500RMB 需 Agent ):搭建一个智能体系统,让它理解退款政策、分析用户历史行为、评估商品状况,并自主决策是否批准退款请分析:这两种方案各自的优缺点是什么?在什么情况下 Workflow 更合适?什么情况下 Agent 更有优势?如果你是该电商公司的负责人,你更倾向于采用哪种方案?是否存在一个方案 C,能够结合两种方案,达到扬长避短的效果?答:方案A属于是工作流,可执行力强,适合有明确规则的流程。方案B是智能体,有不确定性和随机性。但在一定方面有智能体的自主性和智能性,也可以节约人工。方案C:先让方案B的Agent先搭建一个系统,学习退款政策、分析用户历史行为、评估商品状况。遇到0500RMB商品未超过7天且不影响二次售卖,可以直接退款但要在后台上报客服得到客服许可,并给出用户的历史行为分析报告让客服判断。遇到500RMB的商品且未超过7天的商品,将用户的历史记录和商品的情况上传给客服并给出Agent的逻辑判断辅助客服进行审核。所有超过7天的商品,Agent整理商品情况和用户评估分析上传给客服进行审核。如果客服不能进行判断可上传给主管进行审核。4. 在1.3节的智能旅行助手基础上,请思考如何添加以下功能(可以只描述设计思路,也可以进一步尝试代码实现):提示:思考如何修改 Thought-Action-Observation循环来实现这些功能。(1)添加一个"记忆"功能,让智能体记住用户的偏好(如喜欢历史文化景点、预算范围等);(2)当推荐的景点门票已售罄时,智能体能够自动推荐备选方案;(3)如果用户连续拒绝了 3 个推荐,智能体能够反思并调整推荐策略。答:(1)记忆功能:可以根据用户自己填写偏好或者根据用户历史选择的景点进行判断来为下一次推荐景点作为第一优先级。(2)在推荐景点之后,自行查找该门店是否有票。若是没票推荐备选景点。无法确认;推荐用户去官方平台核实(3)用户若是持续拒绝3个推荐,agent进行反思。可以根据用户历史及记录来统计用户点击频率最高的景点类型,得到结果之后搜索目的地有无相同类型的景点来进行推荐,要是没有则对历史第二高的点击率来进行景点推荐。5.卡尼曼的"系统1"(快速直觉)和"系统2"(慢速推理)理论为神经符号主义AI提供了很好的类比。请首先构思一个具体的智能体的落地应用场景,然后说明场景中的:提示:医疗诊断助手、法律咨询机器人、金融风控系统等都是常见的应用场景(1)哪些任务应该由"系统 1"处理?(2)哪些任务应该由"系统 2"处理?(3)这两个系统如何协同工作以达成最终目标?非刑事案件、简单法律问题咨询、回答程序性问题由系统1处理。刑事案件、多个案件联系的案件、面对没有明确对错的法律灰色地带、生成结构化的法律文书由系统2处理。在法律咨询机器人中,整个工作流程可以这样理解:用户提出问题后,系统1会先用最快的速度判断问题的类型(是劳动纠纷还是合同问题?),并立即做出一个初步的风险预警,比如发现“拖欠工资”就立刻拉响警报。这相当于一个经验丰富的助理先帮你摸清底细。随后,系统2会真正“坐下来”进行严谨的逻辑推导,它会仔细核查法律条款、分析案件的各种要素和边界条件,权衡不同方案的利弊,最终形成一份逻辑严密的解决方案。最后,系统1再次登场,它把这份充满法言法语的严谨方案“翻译”成用户听得懂、听得进去的大白话,还会根据用户的情绪调整语气——对着急的人多一些安抚,对犹豫的人多一些鼓励。如果用户接着追问,系统1会再次捕捉新问题,并判断是否需要让系统2重新启动一轮深度分析。6. 尽管大语言模型驱动的智能体系统展现出了强大的能力,但它们仍然存在诸多局限。(1)为什么智能体或智能体系统有时会产生"幻觉"(生成看似合理但实际错误的信息)?(2)在1.3节的案例中,我们设置了最大循环次数为5次。如果没有这个限制,智能体可能会陷入什么问题?(3)如何评估一个智能体的"智能"程度?仅使用准确率指标是否足够?答:(1)在智能体的“感知、思考、行动、观察”循环中:智能体通过传感器获取信息,但这些信息往往是部分可观察的。当外部观察信息不足或存在歧义时,LLM会依赖其内部的统计知识进行“补全”。这种“补全”在缺乏事实约束时,极易演变为“编造”。(2)这是ReAct(推理+行动)范式固有的风险。LLM可能会在Thought中不断重复分析同一个问题,或者因为对Observation的解读出现偏差,而反复调用同一个无效的工具。例如,它可能重复搜索“北京的天气”,得到的都是相同结果,但它的Thought却认为“信息不够,需要再搜一次”,从而陷入无限循环,永远无法执行Finish指令。(3)不够。鲁棒性与稳定性:面对错误、歧义或缺失信息时,智能体能否降级和自我纠错。准确率只看结果,看不出它是否具备从错误中恢复的韧性。效率:完成任务走了多少step或者消耗多少token。准确率高的智能体可能非常“愚蠢”,比如走了20步才算出2+2=4,而优秀的智能体只需2步。成本是衡量智能体“聪明”程度的关键指标。