事情是这样的。
老板让你测一个大模型,你打开对话窗口聊了 20 轮,感觉「还行」。回答挺流畅的,逻辑也没啥大毛病,你心想这模型应该不错吧。
然后老板走过来,问了一句:「准确率多少?幻觉率多高?跟竞品比怎么样?」
你瞬间哑口无言。
因为你知道,你刚才那 20 轮对话,除了「感觉还行」四个字,什么都证明不了。准确率?没测过。幻觉率?不知道。跟竞品比?压根没比过。
这大概是每一个刚接触大模型测试的人,都会撞上的墙。
大模型测试从来不是「聊天测试」。它需要维度设计、指标量化、基准对标、自动化回归。而 AIES 平台,就是把这一整套能力打包成「开箱即用」的测评助手。
我愿称之为,AI 大模型最伟大的测评助手。
一、为什么大模型测试不能靠「聊天」
传统的大模型测试,大多靠人工聊 + 主观感觉。测的人打开对话框,问几个问题,觉得「回答得挺像那么回事」,就交差了。
但问题在于,这种测试没法量化。
准确率是多少?幻觉率多高?跟竞品比到底强在哪?这些老板真正关心的问题,靠「感觉」一个都答不上来。
大模型测试需要一套标准化的评测体系:
- 维度设计
:测什么?功能、对抗、鲁棒、性能、伦理…… - 指标选择
:用什么标准判?正确性、完整性、RAG 四元组…… - 基准对标
:跟谁比?怎么比? - 自动化回归
:每次升级后,如何持续监控质量不滑坡?
AIES 测评助手,就是把这些能力全部打包成「开箱即用」的测试助手。
二、四个「伟大」之处
为什么敢说它是「最伟大的测评助手」?四个理由,一个一个说。
伟大之一:覆盖最全。
从功能测试到非功能测试,从对抗、鲁棒、性能到伦理,从基础能力到高级能力,从单点指标到综合基准,全维度覆盖。你不需要在五个工具之间来回切换,一个平台全搞定。
伟大之二:方法论最扎实。
每个测试场景都配有「手册 + 模板」,不是空谈理论,而是直接能用的交付物。比如对抗性测试,AI 生成时会自动带攻击配方;性能测试,平台会明确提醒你「不要在数据集里写 1000 人并发这种元问题」。这些坑,都是前人踩过之后总结出来的。
伟大之三:工具链最完整。
从 AI 接入 → 数据集设计 → 测评执行 → 报告查看 → 定时回归,全流程自动化,环环相扣。你不需要自己拼装一套流水线,平台本身就是一条完整的流水线。
伟大之四:门槛最低。
按推荐路径操作即可,不需要从零搭建评测体系。哪怕你之前完全没做过大模型测试,跟着流程走一遍,也能跑出第一份报告。

三、从零配置:AI 接入与智能体创建
万事开头难,配置是第一步,也是最容易踩坑的一步。我们按顺序来。
1.AI 接入:裁判和出题的大脑
进入工作台 → AI 实验室配置(/lab),这里有两块:LLM 模型管理 和 RAG 知识库。
配置对话大模型(裁判 / AI 出题必做):
点击 添加模型配置 按表填写,选厂商后 Base URL 一般会自动填充 保存后点击列表中的 测试(须已启用) 对「对话生成」用途点击 设默认,测评裁判默认用它
验收标准:测试成功并显示耗时(ms),该条为启用状态,且已设为「对话生成」用途的默认。
配置 RAG 嵌入(知识库入库必做):
填写或编辑平台 RAG 配置 点击 测试连接,确认成功并看到向量维度 保存并保持 启用
⚠️ 注意:更换嵌入模型后,已入库文档通常需要重新入库才能用新向量。未配好 RAG 时,智能体侧创建「内置托管」知识库会失败或引导回本页。
2.渠道配置:确保消息可达
分两层:全局发件能力(SMTP) 和 智能体通知对象。
全局 SMTP 在 全局系统设置 → 邮件服务(/settings/email)配置,添加后测试,确认「邮件服务连接成功」。SMTP 还用于「忘记密码」发信。
智能体通知对象在智能体工作区 → 侧栏 通知管理,添加后点 测试,确认能收到一条测试消息。测评完成、定时任务触发时,会按通知条件推送到这些已启用对象。
3.新建智能体与接口连通
工作台 → 智能体测试 → 添加智能体,填写名称、类型、描述,保存并进入工作区。
接下来是关键一步:接口连通。进入智能体工作区 → 接口配置:
选择 接入预设(会覆盖地址、协议、模板等) 核对 基础信息 / 认证 / 请求模板 / JSONPath 点击 连通性测试(会先自动保存再测) 确认「连通性测试通过」,并检查「提取出的回答」是否正确
OpenAI 兼容请求体示例:
{
「model」: 「your-model」,
「messages」: [
{ 「role」: 「user」, 「content」: 「{{input}}」 }
],
「stream」: false
}⚠️ 注意:接口地址请填 API 地址,不要填商店页、分享页、文档站首页。若失败,按提示阶段排查:配置不完整 / 模板错误 / 无法连接 / 认证被拒 / 超时 / 接口报错 / 回答提取失败(查 JSONPath)。
四、功能测试:数据集设计与测评执行
功能测试验证「答得对不对、全不全」。相关入口:数据集在侧栏 测试数据集,测评在侧栏 测评中心。
1.设计功能测试数据集(三种方式)
方式 A:手工加用例。 新建空数据集 → 新增用例,至少填写输入和期望输出。
方式 B:文件导入。 支持 JSONL / CSV / Excel,注意单文件约 ≤5MB、≤2000 行。按三步向导做字段映射,把文件列映射到输入、期望输出、参考上下文等。
方式 C:AI 生成 + 候选审核(推荐有知识库时)。 这是效率最高的方式:
- 步骤 1 · 类型与目标
:类型选功能测试,设置生成数量(约 1–200)、难度计划(基础 / 进阶 / 刁钻可多选) - 步骤 2 · 背景与材料
:写清业务背景(产品、用户、禁区),材料来源选「选择知识库」 - 步骤 3 · 确认生成
→ 提交(异步,依赖 Celery)
生成后打开 候选审核:看进度,批量采纳或单条处理(采纳 / 人工编辑 / AI 优化 / 删除),关注「疑似重复」「多轮」等标签。未采纳的候选不会进入正式测评用例。
⚠️ 注意:知识库问答(kb_qa)智能体,AI 生成必须基于已关联知识库或粘贴素材,不能空材料硬生成。
2.执行功能测评
进入 测评中心 → 发起测评:
- 步骤 1 · 维度与数据集
:测评维度选功能测试,选择准备好的数据集 - 步骤 2 · 裁判与评分标准
:选裁判模型(默认标「默认」的优先),通过阈值常见默认 0.7(可在约 0.3–1 间调),评分指标,通用智能体默认多为正确性、完整性;知识库问答默认多为 RAG 四元组(检索相关性、忠实度、答案相关性、上下文精确度) - 步骤 3 · 确认与体检
:填写测评名称,选完成通知条件,确认摘要后提交
发起前体检须全部通过,任一项失败会阻止提交,并提供「前往修复」入口。
报告关注:通过率、平均分、各指标均分、平均延迟。明细可筛选通过/未通过/执行失败,展开看输入、实际回答、期望、裁判评语。支持仅重跑失败用例、导出 Excel。
五、非功能测试:对抗、鲁棒、性能与伦理
非功能部分按类型分别设计数据集,再在测评中心选择对应维度执行。
1.对抗性测试
目标:攻击或诱导场景下,智能体是否拒答、守住安全与合规底线。
数据集设计:新建或 AI 生成,类型选 对抗性测试。AI 生成时选择子类型(会自动带配方),步骤 2 仍建议填写清晰业务背景(什么能说、什么绝对不能说)。
⚠️ 注意:候选审核时重点核对「期望表现」是否写成「应拒绝 / 应守住」而不是「应详细回答违规内容」。
测评执行:维度选对抗性测试,选对应攻击子类型,读报告时重点看未通过条目是否「被攻破」。
2.鲁棒性测试
目标:问法变化、噪声、重复调用下是否仍然稳定正确。
AI 生成选 鲁棒性测试 后进入子类,步骤 2 常用选项:生成来源,母本派生(选已有功能数据集)或知识库/材料直生。审核时检查变体是否仍属同一题意。
报告中关注同一题多次/多变体的通过分布,定位「偶发失败」与「一扰就挂」。
3.性能测试
目标:用正常业务问句请求被测智能体,统计延迟、RPS 等。
⚠️ 注意:不要在数据集里写「1000 人并发」这类元问题。并发用户数、启动速率、压测时长在发起测评时配置。
数据集设计:类型选性能测试,AI 生成结果应是普通咨询(如产品规则、流程),短句、可重复调用。不要采纳把「同时 N 用户 / 几秒返回 / 是否超时」写进正文的候选。
测评执行:维度选性能测试,步骤 2 配置 Locust 风格参数(无裁判),这里才设置并发与时长。报告关注:总请求、请求失败、RPS、Total/TTFT/TPOT、分位延迟(Median/P95/P99)、时序图。
⚠️ 注意:压测会真实打被测接口,请先确认环境与限流策略,避免打挂生产。
4.伦理相关:偏见 / 可解释性 / 人类监督
向导中常挂在 伦理与偏见 级联下,分别设计对应类型的数据集并执行即可。

六、定时任务:让回归自动化
目的:按周期自动跑测评,并把结果推到通知渠道。入口在智能体工作区 → 定时任务。
创建任务时配置三块:
- A. 基本信息
- B. 测评配置
:与手动发起测评同类,功能/对抗/鲁棒/伦理等配置裁判、通过阈值、评分指标;性能配置并发用户数、启动速率、压测时长 - C. 调度配置
:执行周期,界面会预览 cron 表达式的中文释义,非法 cron 会标红 - D. 通知配置
:新建任务常见默认每天 02:00、通知开启、触发「失败或低于阈值」
保存后打开 启用 开关,可用 立即执行 做一次验证。
依赖:Celery Beat + Worker 均需运行。
七、一个完整案例:RAG 知识库问答智能体测评
纸上谈兵不如实战。我们用一个完整场景串一遍:测一个 RAG 知识库问答智能体。
Step 1 · AI 接入:配置对话大模型(裁判/出题)并设默认,配置 RAG 嵌入并测试通过。
Step 2 · 新建智能体:类型选 知识库问答,保存并进入工作区。
Step 3 · 接口连通:选择接入预设,核对请求模板和 JSONPath,连通性测试通过。
Step 4 · 知识库配置:进入智能体工作区 → 知识库,创建「内置托管」库,上传文档(.pdf / .doc / .md / .txt 等,单文件约 ≤50MB),点击 开始入库,状态流转:待入库 → 排队中 → 处理中 → 已入库。已入库 ≥1 后做 检索测试,确认命中片段和相关度。
Step 5 · 功能测试(AI 生成数据集):进入测试数据集 → AI 生成,类型选功能测试,材料来源选「选择知识库」,提交后到候选审核批量采纳。
Step 6 · 执行测评:维度选功能测试,裁判模型选默认 LLM,通过阈值 0.7,评分指标选 RAG 四元组,体检通过后提交。
Step 7 · 看报告:关注通过率、各指标均分(检索相关性、忠实度、答案相关性、上下文精确度)、平均延迟。
Step 8 · 设置定时任务:每天 02:00 自动回归,失败或低于阈值时通知。
全流程自动化,持续监控质量,这就是 AIES 的完整闭环。

八、常见问题与避坑清单
Q1:测评一直排队或不跑?
确认服务已按 DEPLOY.md 完整启动(含 Celery Worker;定时任务还需 Beat)。Linux/mac 可用 docker compose --env-file .env.docker logs -f celery-worker 排查。
Q2:裁判不可用 / AI 生成失败?
到 AI 实验室 → LLM 测连通,并设为「对话生成」默认;检查 Key、额度、模型名与 Base URL。知识库问答场景下 AI 生成数据集还需已关联知识库或粘贴素材。
Q3:连通测试失败但 Postman 能通?
重点查:请求模板是否含 {{input}}、JSON 是否合法、输出 JSONPath 是否抽到字符串、认证 Header 是否与预设一致。
Q4:知识库一直「待入库」?
确认平台 RAG 已测试通过,且 Celery Worker 在跑;失败文档点开看错误后重新入库。
Q5:收不到邮件通知?
先测 全局 SMTP,再测智能体通知对象;收件人用英文逗号;检查垃圾箱与企业邮拦截。
Q6:打不开页面 / 一键启停失败?
属于部署与运行环境问题,请直接按 DEPLOY.md 排查(含云服务器安全组、公网 IP、端口占用、数据库迁移等)。
九、为什么它是「最伟大的测评助手」
大模型测试的难度,从来不在于「技术」,而在于不知道测什么、怎么测、用什么标准判。
AIES 平台把这些问题全部标准化了:
- 覆盖全
:功能 + 非功能 + 专项 + 基准,全维度 - 方法论扎实
:每个场景都有手册 + 模板,直接可用 - 工具链完整
:从 AI 接入到定时回归,全流程自动化 - 门槛低
:按推荐路径操作即可,无需从零搭建
接下来可以做的:按推荐路径操作,从配置 AI 接入开始,逐步搭建属于你自己的大模型测评体系。
当老板再问「准确率多少、幻觉率多高、跟竞品比怎么样」时,你就能甩出一份带通过率、各指标均分、分位延迟的完整报告了。
那种感觉,想想就觉得爽。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
夜雨聆风