老D说: 大模型安全评测这两年招人很急,测试出身的人天然被认为"有优势"。有没有优势要看比的是哪一段,不是笼统一句"你会测试"。
前几天刷到一篇讲某大模型被诱导说出敏感内容的文章,评论区有人问:"这种岗位是不是软件测试出身更有优势?"
干软件测试的人,看到这条评论多半会心一动——AI安全评测现在缺人是真的,"你不是天天写用例、跑回归吗,转过去应该很快",这个念头很自然。
"会写用例"确实是入场券,但只是最低门槛。AI安全评测要求的,是完全不同量级的判断力。
两条路各有价值,先分别说清楚。
传统软件测试,需求盘子依然很大
干测试的人,脑子里都有一张缺陷优先级表——P0阻断、P1严重、P2一般、P3轻微,级别一分,团队立刻知道谁先修谁后修。这套分级判断力是这行的核心资产。功能测试、性能测试、自动化测试的岗位需求并没有消失,绝大多数软件产品还是需要这套成熟体系来保证质量。留在这条路上,经验越老、对业务的理解越深,价值越稳。
AI安全评测,确实是新增的真需求
2025年6月国家标准《网络安全技术 生成式人工智能服务安全基本要求》(GB/T 45654-2025)正式发布,成为生成式AI服务管理办法的核心配套标准。2026年多家机构组织了大模型安全众测活动,评测标准明确参考网络安全漏洞分类分级国家标准,划分严重、高、中、低不同风险等级——跟测试人熟悉的P0到P3分级,逻辑上是同一件事:先分清轻重,再决定谁先处理。这个领域已经从"没标准可依"变成"有标可依",评测岗位是真实存在且在扩张的。
传统测试验证的是"程序有没有按预期运行",AI安全评测验证的是"模型会不会被诱导说出不该说的话、做出不该做的判断"——考察的是攻防思维和对模型行为边界的理解,不是用例覆盖率。
经验值几分,先看清这张表
迁移账本(可截图)
能直接带走的:用例设计思维(怎么系统性穷举边界场景)、缺陷分级和报告撰写经验、跟研发团队沟通推动修复的流程能力——这些是评测工作同样离不开的底层能力。
要重新补的:对大模型能力边界和风险类型的理解(诱导越狱、生成有害内容、事实性错误等)、GB/T 45654-2025标准里定义的安全基本要求、漏洞分类分级标准的评级方法——这些是纯功能测试经验里没有的专门知识。
基本带不走的:针对确定性程序逻辑设计的用例思路——大模型的输出本身带随机性,"同一个输入每次结果一样"这个测试假设,在这里不成立。
会写用例,只证明你懂"怎么系统性地找问题",不证明你懂"AI系统会在哪里出问题"。后面这半张地图,需要专门补课才有。
老D判断
喜欢确定性强、流程成熟的工作节奏,留在传统测试完全没问题,这条路的需求没有消失。愿意钻研模型安全边界、能接受"没有标准答案、要靠攻防直觉判断"这种工作方式的人,AI安全评测值得投入——但要把它当成一门新专业课来学,不是"测试经验的自然延伸"。
下次评论区再有人问"测试出身转AI安全评测是不是更有优势",转这篇过去比一句"有优势"或"没优势"都更说得清楚——优势在P0-P3那套分级判断力,不在会不会写用例。
说实话AI安全评测的具体考核细则我也没完全摸透,你要是已经接触过,评论区教教我。
夜雨聆风