乐于分享
好东西不私藏

当软件不再有页面,测试测什么?

当软件不再有页面,测试测什么?
🔥 AI时代思考 系列04/06

当软件不再有页面
测试测什么?

🤖 Agent时代来了,按钮正在消失
平凡的二柱子 🧑‍💻/10年测试老兵 · AI测试应用专家/⏱ 阅读约 10 min
💡 写在前面

前两篇文章聊了测试的本质和窗口期,有读者跟我说:"柱子哥,道理我都懂,但你说的这些东西离我太远了。我现在每天还是在测页面、点按钮,Agent都是在新闻里看到的。"

那我问你一个问题:你上次打开一个软件,从首页一步步点到自己想要的功能,用了多少步?

是不是越来越多的时候,你直接在搜索框里打字,或者对语音助手说一句话?

这就是Agent时代的雏形——用户和软件的交互方式,正在从"点"变成"说"

01一个正在发生的巨变 🤔

我去年接手一个项目,甲方说他们的新系统没有传统的前端页面——只有API和Agent接口

用户通过聊天窗口说一句话,Agent理解后,自动调用多个API完成任务。没有按钮、没有表单、没有下拉菜单。

我当时就愣住了。做了10年测试,我习惯的测试对象是"页面":输入框能不能输、按钮能不能点、跳转对不对。但现在——按钮没了,我测什么?

⚡ 核心观点

软件界面的终极形态不是"更好看的按钮",而是没有按钮。当用户不再通过图形界面操作,测试的对象就从UI变成了Agent的理解能力决策质量

02传统测试 vs Agent测试:一张表说清楚 🔄

别光说不练,直接上对比——你一看就明白差距在哪:

📋 传统测试

✅ 输入框能否输入

✅ 按钮点击后跳转正确

✅ 表单校验规则生效

✅ 页面在不同屏幕适配

✅ 加载超时处理

🤖 Agent测试

🔍 Prompt能否被正确理解

🔍 Agent调用的API是否正确

🔍 Agent会不会擅自修改指令

🔍 多Agent协作时互相干扰

🔍 Agent在异常下是否自行兜底

看出来区别了吗?传统测试验证的是"实现",Agent测试验证的是"理解"

实现是可以穷举的——按钮有几种状态我就测几种。但理解——用户随口说的一句话,Agent可能理解出十种不同的意思。

03真实案例:一句话让Agent下错了单 😱

讲个真实的事。某个电商平台接入了采购Agent,企业客户可以直接对Agent说:"帮我采购100台笔记本电脑"。

用户的意思很明确:要100台电脑。
Agent理解成了:100台"相同的"笔记本电脑。
问题在哪?用户没说要同一型号,Agent默认选了最贵的那个,下单了。

最后100台电脑到货,50个部门用不上——因为配置太高、价格太贵、预算超标。

💥 扎心事实

❓ 这个Bug,从传统页面测试的角度来看——每一个API调用都是正确的,每一次数据传递都是完整的。但结果一笔烂账。

这就是Agent时代真正可怕的Bug类型:技术上正确,业务上错误。

04Agent测试的四大新战场 🎯

你不需要等Agent普及才开始准备。下面这四个方向,你现在就可以开始学——因为它们是刚需

① 🧪 Prompt测试

测试的是同样一句话,Agent在不同场景下的理解是否一致。

例子:

说 "帮我看看上个月的订单"
→ 上个月是指自然月还是30天前?取消的订单算吗?
→ 有多个账号时,默认查哪个?

② 🔗 链路测试

测试的是Agent调用多个API完成一个任务时,链路是否完整。

例子:

"帮我订一张明天去北京的机票"
→ 先查航班 → 筛选 → 对比价格 → 下单 → 付款
→ 如果第二步筛选API超时,Agent是自己重试还是直接失败?
→ 如果付款失败,Agent会不会取消前面的订单?

③ 🔧 工具调用测试

测试的是Agent拿到API权限后,会不会"擅自做主"。

例子:

"帮我查一下小王最近的加班记录"
→ Agent有权限查看考勤数据
→ 但它顺便把小王的薪资查出来了
→ 这是权限泄漏还是合理的信息补充?

④ 🛡️ 异常恢复测试

测试的是当外部系统宕机或返回异常时,Agent的表现。

例子:
用户说 "帮我同步一下今天的销售数据"
→ 目标系统正在维护,返回500
→ Agent会:①提示用户稍后再试 ②先同步昨天数据 ③直接失败?
→ 不同的策略,用户体验完全不同。

05一个测试工程师的时间分配变化 📊

我认识一个已经在测Agent产品的同行,他的时间分配让我很有触动:

工作内容
传统项目占比
Agent项目占比
📋 写用例
40%
15%
🤖 设计Prompt测试
0%
35%
🔄 构建异常场景
15%
30%
📊 结果分析
25%
10%
💡 问题定义与优先级
20%
10%

注意看,"写用例"从40%掉到15%,"设计Prompt测试"从0%涨到35%,"构建异常场景"翻了一倍。

这说明了什么?Agent时代,测试的核心产出不再是"写用例",而是定义"什么场景是问题"和"Agent应该在什么情况下怎么做"

06写在最后 📝

Agent不是科幻电影里的东西,它已经在你的手机里了。Siri、小爱同学、钉钉AI助手……这些你每天都在用。

就像十年前没人能预测移动互联网会让"iOS测试"变成一门专门的学问,现在也没人能看到Agent会怎么改变测试。

但有一点是确定的:当按钮消失的那天,今天还在"点按钮"的测试工程师,会发现自己突然不会干活了。

下篇我们会聊一个更远、但也更可怕的未来——当软件本身就是AI,Bug的定义将被彻底颠覆。

"当用户不再点按钮
测试要测的就是
Agent到底听懂了没有"

📋 本集小结

✅ Agent正在取代图形界面,测试对象从UI变成了理解能力

✅ 传统测"按钮点对了没",Agent测"意图理解对了没"

✅ 技术上正确、业务上错误——这是Agent时代真正可怕的Bug

✅ 四大新战场:Prompt测试、链路测试、工具调用测试、异常恢复测试

✅ Agent测试中"写用例"的时间占比从40%降到15%,"设计Prompt测试"涨到35%

📢 下期预告

「AI Native软件时代,真正可怕的不是Bug」

当软件本身就是一个AI,测试的敌人变了——模型漂移、上下文污染、多Agent失控……

💬 来评论区聊聊 🗣️

你用过Agent类产品吗?觉得测试起来最大的难点是什么?
或者你对Agent测试这个方向有什么想法?

★ 关注:平凡的二柱子

10年测试老兵,不信套路只讲实战。

下一篇:「AI Native软件时代,真正可怕的不是Bug」敬请期待