乐于分享
好东西不私藏

AI 落地第一步:我记了一周时间账,写了个脚本,才知道靶子一直打错了

AI 落地第一步:我记了一周时间账,写了个脚本,才知道靶子一直打错了

一个答不上来的问题

先讲一个我最近看到的真实场景。
某公司的测试负责人小陈,在季度汇报里讲团队怎么用 AI 提效,讲得挺热闹。汇报完,VP 只问了一句:"效率提升了多少?"
小陈张了张嘴,答不上来。不是他不行——是他手里根本没有能回答这个问题的数据。
这个故事来自腾讯云开发者社区一篇讲测试团队 AI 转型度量的文章,里面有个判断我非常认同:没有可信的度量,转型价值就停留在"感觉上",而"感觉上"换不来持续的资源投入。
我自己也没好到哪去。[补充:你的经历——用过哪些工具、为什么"感觉有用但说不清",两三句]
于是我没去研究新工具,而是做了两件更笨的事:记一周时间账,然后写了个脚本把账变成报告。本文的截图和数字都是这套流程的真实输出。

为什么"感觉有用"不可信

你可能会说:AI 生成的用例确实多了啊,这不就是提升吗?
这里有个特别容易被忽略的坑:产出不等于有效产出。度量方法论里有个参考区间——纯手工设计用例大约 8-15 条/人天,AI 辅助成熟期能到 20-35 条/人天。但前提是"有效",即通过审核、真正入库的用例。AI 生成 500 条、80% 被废弃,堆出来的数字反而是误导。
更扎心的是今年 AiDD 峰会相关讨论里的一句话:

"很多团队只在用例生成、需求分析这类低门槛场景用 AI,结果是用例堆积如山,执行队列却空空如也。"

翻译一下:大家都在 AI 最容易出彩的地方用力,但瓶颈根本不在那儿。IDC 和中国银行业协会的数据是,测试执行阶段占全生命周期工作量的 60%~80%,回归测试占大头。靶子几乎总在执行侧,而我们的注意力总被生成侧的"惊艳感"吸走。
正面教材是天猫团队:他们动手前先测出"用例设计到回归占 QA 约 70% 时间",然后才决定主攻用例生成。先算账,再选靶子,最后才是选工具。顺序反了,就是小陈的结局。

实战:一周时间账 + 一个脚本

方法简单到不像"方法论"。第一步,连续记 5 个工作日,每天按 7 个分类给时间打标:需求理解、用例设计、测试执行、回归测试、缺陷处理、环境与数据、沟通汇报。不用精确到分钟,每天上下班前花 5 分钟补就行。
第二步,把记录放进一个 CSV,每行一条:

date,start,end,category,duration_hours,note

2026-08-17,09:30,11:00,需求理解,1.5,版本需求评审

2026-08-17,16:00,17:00,测试执行,1.0,新功能冒烟验证

2026-08-17,17:00,19:30,回归测试,2.5,V2.3回归-交易模块

...

第三步,跑我写的小脚本(文末自取),终端直接出报告:
一周 41 小时、24 条记录,跑完 0.1 秒出结果。报告长这样,重点看三块:
① 分布:
执行侧(橙色两项)合计 25h,占61%——正好落在行业 60%~80% 区间里。其中回归测试一项 19.5h,占47.6%,接近一半。
而我之前用 AI 在干嘛?生成用例。用例设计只占 12.2%。我在用 AI 优化那 12%,真正的 47.6% 原封不动。
② 每日结构:
堆叠图看得更直观:回归测试(深橙)几乎天天满格,越接近发版越重,周五一天回归占了 5.5h。这是发版周的典型形态,也是自动化最该先吃掉的部分。
③ 脚本给出的靶子建议:回归测试 + 测试执行。只选这 1-2 项做 AI 试点,别撒网——因为落地试点需要真实场景、人工审核位和度量,撒网式"全面 AI 化"注定样样都浅。
对照行业锚点校验一下你的结果:执行侧低于 60%?大概率是漏记了执行类时间(大家天然不爱记重复劳动);设计侧超过 40%?那你的问题可能是需求质量而非测试效率,AI 用例生成对你才是对的靶子。时间账不是标准答案,是校准器。

提前打两个预防针

第一,执行速度是陷阱指标。有个真实案例:某团队把执行时间从 12 小时压到 4 小时,看着翻倍了,但 AI 误报处理时间从 1 小时涨到 5 小时——净周期只缩短了 31%。诚实的回归周期要算总账:执行 + 结果分析 + 误报核实 + 报告生成。这也是为什么时间账要现在记:它是你的基线,没有基线,后面所有的"提升"都无法证伪。
第二,别只报好消息。度量最有价值的不是那张证明成功的对比表,而是暴露问题的警告——比如误报率涨了,那恰恰是下一步改进的方向。只报好消息的度量,老板迟早会问出你答不上来的问题。

这本账还有第二个用途

时间账不只是给 AI 找靶子的,它还是你绩效汇报和简历的素材库。
"用 AI 提升了测试效率"这句话没有分量,但"先摸清回归执行占了团队 61% 的时间,再把回归周期从 3 天压到 2 小时"——这句话每个环节都有数据撑着,是从小陈的窘境里走出来的唯一路径。
测试岗位正在被重新定价:AI 测试工程师年薪区间已经到 50-100 万,而纯功能测试的校招薪资在往下走。分化背后不是"会不会用 AI 工具",而是"能不能定义问题、度量效果、推动落地"——时间账就是这三种能力共同的起点。
工具获取:后台回复「时间账」,拿走 CSV 模板 + 分析脚本(约 100 行 Python,只需 pandas 和 matplotlib),换成你的数据重跑,出你自己的报告。
明天开始,记一周试试。
下一篇预告:靶子找到了(回归测试),但为什么我劝你别先学最炫的工具?我们从"占比最大处切入"的正确姿势讲起。