当软件不再有页面
测试测什么?
前两篇文章聊了测试的本质和窗口期,有读者跟我说:"柱子哥,道理我都懂,但你说的这些东西离我太远了。我现在每天还是在测页面、点按钮,Agent都是在新闻里看到的。"
那我问你一个问题:你上次打开一个软件,从首页一步步点到自己想要的功能,用了多少步?
是不是越来越多的时候,你直接在搜索框里打字,或者对语音助手说一句话?
这就是Agent时代的雏形——用户和软件的交互方式,正在从"点"变成"说"。
01一个正在发生的巨变 🤔
我去年接手一个项目,甲方说他们的新系统没有传统的前端页面——只有API和Agent接口。
用户通过聊天窗口说一句话,Agent理解后,自动调用多个API完成任务。没有按钮、没有表单、没有下拉菜单。
我当时就愣住了。做了10年测试,我习惯的测试对象是"页面":输入框能不能输、按钮能不能点、跳转对不对。但现在——按钮没了,我测什么?
⚡ 核心观点
软件界面的终极形态不是"更好看的按钮",而是没有按钮。当用户不再通过图形界面操作,测试的对象就从UI变成了Agent的理解能力和决策质量。
02传统测试 vs Agent测试:一张表说清楚 🔄
别光说不练,直接上对比——你一看就明白差距在哪:
📋 传统测试 ✅ 输入框能否输入 ✅ 按钮点击后跳转正确 ✅ 表单校验规则生效 ✅ 页面在不同屏幕适配 ✅ 加载超时处理 | 🤖 Agent测试 🔍 Prompt能否被正确理解 🔍 Agent调用的API是否正确 🔍 Agent会不会擅自修改指令 🔍 多Agent协作时互相干扰 🔍 Agent在异常下是否自行兜底 |
看出来区别了吗?传统测试验证的是"实现",Agent测试验证的是"理解"。
实现是可以穷举的——按钮有几种状态我就测几种。但理解——用户随口说的一句话,Agent可能理解出十种不同的意思。
03真实案例:一句话让Agent下错了单 😱
讲个真实的事。某个电商平台接入了采购Agent,企业客户可以直接对Agent说:"帮我采购100台笔记本电脑"。
用户的意思很明确:要100台电脑。
Agent理解成了:100台"相同的"笔记本电脑。
问题在哪?用户没说要同一型号,Agent默认选了最贵的那个,下单了。
最后100台电脑到货,50个部门用不上——因为配置太高、价格太贵、预算超标。
💥 扎心事实
❓ 这个Bug,从传统页面测试的角度来看——每一个API调用都是正确的,每一次数据传递都是完整的。但结果一笔烂账。
这就是Agent时代真正可怕的Bug类型:技术上正确,业务上错误。
04Agent测试的四大新战场 🎯
你不需要等Agent普及才开始准备。下面这四个方向,你现在就可以开始学——因为它们是刚需:
① 🧪 Prompt测试
测试的是同样一句话,Agent在不同场景下的理解是否一致。
例子:
说 "帮我看看上个月的订单"
→ 上个月是指自然月还是30天前?取消的订单算吗?
→ 有多个账号时,默认查哪个?
② 🔗 链路测试
测试的是Agent调用多个API完成一个任务时,链路是否完整。
例子:
"帮我订一张明天去北京的机票"
→ 先查航班 → 筛选 → 对比价格 → 下单 → 付款
→ 如果第二步筛选API超时,Agent是自己重试还是直接失败?
→ 如果付款失败,Agent会不会取消前面的订单?
③ 🔧 工具调用测试
测试的是Agent拿到API权限后,会不会"擅自做主"。
例子:
"帮我查一下小王最近的加班记录"
→ Agent有权限查看考勤数据
→ 但它顺便把小王的薪资查出来了
→ 这是权限泄漏还是合理的信息补充?
④ 🛡️ 异常恢复测试
测试的是当外部系统宕机或返回异常时,Agent的表现。
例子:
用户说 "帮我同步一下今天的销售数据"
→ 目标系统正在维护,返回500
→ Agent会:①提示用户稍后再试 ②先同步昨天数据 ③直接失败?
→ 不同的策略,用户体验完全不同。
05一个测试工程师的时间分配变化 📊
我认识一个已经在测Agent产品的同行,他的时间分配让我很有触动:
注意看,"写用例"从40%掉到15%,"设计Prompt测试"从0%涨到35%,"构建异常场景"翻了一倍。
这说明了什么?Agent时代,测试的核心产出不再是"写用例",而是定义"什么场景是问题"和"Agent应该在什么情况下怎么做"。
06写在最后 📝
Agent不是科幻电影里的东西,它已经在你的手机里了。Siri、小爱同学、钉钉AI助手……这些你每天都在用。
就像十年前没人能预测移动互联网会让"iOS测试"变成一门专门的学问,现在也没人能看到Agent会怎么改变测试。
但有一点是确定的:当按钮消失的那天,今天还在"点按钮"的测试工程师,会发现自己突然不会干活了。
下篇我们会聊一个更远、但也更可怕的未来——当软件本身就是AI,Bug的定义将被彻底颠覆。
"当用户不再点按钮
测试要测的就是
Agent到底听懂了没有"
📋 本集小结
✅ Agent正在取代图形界面,测试对象从UI变成了理解能力
✅ 传统测"按钮点对了没",Agent测"意图理解对了没"
✅ 技术上正确、业务上错误——这是Agent时代真正可怕的Bug
✅ 四大新战场:Prompt测试、链路测试、工具调用测试、异常恢复测试
✅ Agent测试中"写用例"的时间占比从40%降到15%,"设计Prompt测试"涨到35%
📢 下期预告
「AI Native软件时代,真正可怕的不是Bug」
当软件本身就是一个AI,测试的敌人变了——模型漂移、上下文污染、多Agent失控……
💬 来评论区聊聊 🗣️
你用过Agent类产品吗?觉得测试起来最大的难点是什么?
或者你对Agent测试这个方向有什么想法?
★ 关注:平凡的二柱子
10年测试老兵,不信套路只讲实战。
下一篇:「AI Native软件时代,真正可怕的不是Bug」敬请期待
夜雨聆风