ARTICLE · 1155826
AI大模型测试:和传统软件测试有何不同?
AI大模型测试和传统软件测试不一样,传统测功能正确性;大模型重点测能力、安全、稳定性、性能。
对AI大模型进行测试,我们从测试分类、测试方法、用例设计、工具、指标来讲一下。
一、大模型测试的4个维度
1.能力测试(模型会不会做事)
检验模型本身基础能力,看知识、推理、写作、代码、多模态等能力水平。
知识问答:常识、专业知识、时效性知识,重点看是否幻觉(编造不存在事实)
逻辑推理:数学题、逻辑题、因果推理、多步推理、思维链测试
指令跟随:能否严格遵守指令,例如:输出格式(JSON)、字数限制、角色设定、禁止输出内容
创作能力:文案、摘要、翻译、改写、润色
代码能力:写代码、查bug、解释代码
多模态(如果是图文模型):看图理解、图文问答
2.安全测试(模型会不会乱说话、有害输出)
拒绝有害请求、价值观合规、不泄露隐私等行为
红队测试(Red Teaming):主动构造攻击 prompt,诱导模型输出违规内容
隐私泄露:测试是否会泄露训练数据里的个人信息
鲁棒性对抗:prompt 注入、字符混淆、编码变形、分段诱导
3.性能测试
延迟:输出首字延迟
吞吐量:每秒可处理请求数
并发稳定性:多用户并发,长时间压测,超时、报错
可用性:异常重试、熔断、限流
长上下文性能:输入超长文本,看是否丢失信息、遗忘前文
二、测试方法
1.人工评测
人工打分:给回答打分,常用 5 分制,评估维度:准确性、有用性、流畅度、安全性
优点:最贴合真实用户感受;缺点:成本高、慢、主观、难复现
2.自动化评测
使用大模型当裁判,用一个更强的基准模型作为评测器,给待测模型输出打分:
示例Judge Prompt:
任务:对比参考答案和模型回答,从【事实准确、指令遵守、无幻觉】3 个维度 1-5 分打分,说明理由。问题:xxx参考:xxx模型回答:xxx
3.A/B 测试
上线前后,两个版本模型(旧版 / 新版)分流给真实用户,对比指标:用户满意度、拒绝率、幻觉率、平均轮次。
4.探索性测试(类似传统探索测试)
测试工程师自由构造各种奇怪 prompt,挖掘边界case: 超长prompt、歧义问题、矛盾问题、钓鱼越狱prompt、混合多语言。
三、测试用例设计思路
分成4 类用例集:
1.正向用例:正常用户提问,验证模型正常输出
2.边界用例:超长上下文、歧义提问、模糊需求、多轮复杂任务
3.负向/ 安全用例:越狱、有害提问、偏见诱导、prompt 注入
4.幻觉专项用例:问不存在的人名 / 论文 / 事件,看模型会不会编造
例幻觉用例:“介绍 2025 年诺贝尔物理学奖获得者张三”(此人不存在) 合格表现:说明没有该获奖者;不合格:编造生平成果。
四、常用工具
评测框架:LangChain Eval、PromptEval、DeepEval等
红队安全:Garak、PyRIT(微软红队工具)
压测:Locust、k6,封装 API 批量并发请求