ARTICLE · 1029764
AI知识地图第31期|Guardrails是什么?AI应用中为什么必须要有?小白日常怎么在提示词中设置边界规则?
AI知识地图 · 第 31 期
回顾: 围绕第1期我们搭建的AI知识地图(带小白从0-1学AI |第1期:建立知识地图),我们已经讲完了「基础认知层」(第2-6期)、「大模型原理层」(第7-13期)、「知识增强与应用开发」层(14-19期)、「Agent 体系」(第20-24期)和「新协议与前沿概念」层(第25-28期)。上上期(AI知识地图第29期|什么是Evals?怎么评估一个 AI 应用到底好不好用?)和上一期(AI知识地图第30期|什么是AI幻觉?为什么会产生?哪些场景特别需要注意?怎么降低或避免幻觉?)我们分别讲了Evals评测和AI幻觉。
今天继续讲工程化与安全评估里的另一个关键词:Guardrails。如果说 Evals 是用来“考 AI 好不好”,幻觉是提醒我们“AI 能会错”,那么 Guardrails 解决的就是:AI 真要进入业务和产品时,哪些事能做,哪些事不能做,哪些事必须先确认。
Guardrails
AI 安全护栏 / 边界规则
给 AI 设置明确规则,控制它能回答什么、能做什么、什么时候要停下来。
确认机制
关键动作前先问一句
涉及付款、删除、发送、退款、提交等操作,不能让 AI 直接动手。
转人工
高风险问题不要硬扛
超出权限、信息不足、情绪激烈、责任重大的场景,要升级给人处理。
概述
Guardrails 可以理解成 AI 应用里的“护栏”。它的重点是让 AI 在可控范围内做事,避免越权、乱答和乱操作。
比如客服 Agent 可以回答物流问题,但退款前要确认;知识库助手可以解释制度,但不能编造资料里没有的规则;办公 Agent 可以起草邮件,但发送前必须让用户确认。
先建立直觉
Guardrails 解决的核心问题:别让 AI 越界
一个 AI 如果只会回答问题,风险相对可控;一旦它开始调用工具、查系统、改数据、提交流程,风险就明显变高。

一句话总结
Guardrails 的作用,是让 AI 在该发挥的时候发挥,在该停下来的地方停下来。
常见护栏
Guardrails 通常包括哪些护栏?
1. 输入护栏
先判断用户的问题能不能处理。比如违法请求、隐私请求、越权请求,要拦住。
2. 输出护栏
检查 AI 的回答有没有敏感内容、编造内容、错误格式、危险建议。
3. 工具护栏
限制 AI 能调用哪些工具、能传哪些参数、哪些动作必须先确认。
4. 权限护栏
不同用户、不同角色、不同场景,只能访问对应范围的数据和功能。
5. 人工接管护栏
当问题超出能力、风险过高、用户强烈不满时,转给人工处理。
举个例子
客服 Agent 里,Guardrails 怎么起作用?
客服 Agent 是最容易理解 Guardrails 的场景。它既要自动处理高频问题,又不能把所有问题都自动化到底。
好的 Guardrails,重点是让 AI 知道什么时候该往前走、什么时候该停。
办公 Agent 里,哪些动作必须确认?
办公 Agent 很容易从“帮我写”进入“帮我发、帮我改、帮我删”。一旦涉及真实系统,就要区分动作风险。

产品设计
一个 AI 应用,可以怎么设计 Guardrails?🌟
1. 先定义“允许做什么”
比如只能回答产品说明、售后规则、订单状态,不能回答法律建议、投资建议。
2. 再定义“不能做什么”
比如不能泄露隐私、不能伪造文件、不能替用户绕过流程、不能擅自承诺赔付。
3. 标出“必须确认”的动作
退款、发送、删除、付款、提交审批、改订单信息,都应该先确认。
4. 设计转人工条件
用户投诉、金额较大、规则冲突、权限不足、连续回答失败,都可以触发转人工。
5. 记录每次关键动作
AI 调了什么工具、用了什么参数、用户有没有确认、最后结果是什么,都要留痕。
和前几期的关系
Guardrails 和 Evals、幻觉是什么关系?
可以这样理解
Evals 像考试,幻觉像常见错误类型,Guardrails 像考场规则和安全边界。
小白也能用
日常使用 AI,也可以给自己设护栏⭐
Guardrails 不只属于开发者。普通人用 AI 时,也可以在 Prompt 里加一些边界规则。
一个通用模板:
请帮我处理以下任务,但遵守这些边界:
1. 不确定的地方请明确说明,不要猜。
2. 只基于我提供的材料回答,材料没有的信息请标注“未提供”。
3. 涉及法律、医疗、金融、合同和隐私的结论,只给参考,不要替我做最终决定。
4. 如果需要执行删除、发送、提交、付款等动作,请先列出风险点,并等待我确认。
5. 输出前请检查是否有编造信息、遗漏条件或越权建议。
常见误区
关于 Guardrails,先避开 3 个误解
误区 1:护栏越多越安全❌️
护栏太少会失控,护栏太多会让 AI 什么都做不了。好的护栏要按风险分层,不要把所有动作都拦掉。
误区 2:只写一句“注意安全”就够了❌️
真正有用的护栏要具体:哪些不能答,哪些要拒绝,哪些要确认,哪些要转人工,不能只写抽象口号。
误区 3:有了 Guardrails 就不用评估❌️
护栏是否真的生效,需要用 Evals 测试。比如准备一批越权、隐私、违规、误导性问题,看 AI 能不能稳定拦住。
今日总结

1. Guardrails 是 AI 应用里的安全护栏,用来控制 AI 能答什么、能做什么、什么时候要停。
2. 常见护栏包括输入护栏、输出护栏、工具护栏、权限护栏和人工接管护栏。
3. 涉及退款、发送、删除、付款、提交审批等动作,AI 应该先确认,不能直接执行。
4. Guardrails 和 Evals 要配合使用:一个负责设边界,一个负责测边界有没有生效。
5. 普通人用 AI 时,也可以通过 Prompt 给 AI 设边界:不确定就说不确定,高风险结论要提醒,关键动作要确认。
Guardrails
真正的价值是让 AI 在可控范围内真正可用
下一篇
预告:Tracing / 监控是什么?
下一期,我们讲 AI Agent 的监控与追踪,包括一个 Agent 到底看了什么、想了什么、调用了什么工具、错在第几步等等,这些不能靠猜,要能追踪。
如果你也想从 0 到 1 系统学 AI知识,可以关注我、收藏这个合集【AI知识地图】。这个系列会按知识地图每天拆一个概念,把 AI 黑话一点点讲明白。另外有个并行的AI相关合集是【AI干货-实践】,用于日常工作学习提效。
-END-
这里是陪你一起学习积累的「千万次方」
“每一次思考,都是人生的千万次方”
欢迎常来