夜雨聆风学习资料网

ARTICLE · 1107343

AI测试基础实战手记专栏目录索引

AI测试基础实战手记专栏目录索引

目录索引

A 入门认知篇(10 篇)

  1. 做了10年电商测试,我眼里的"AI测试"到底新 
  2. 测试 AI 功能 ≠ 测试传统功能:3 个本质差异
  3. 大模型应用怎么测?一张从 Prompt 到 RAG 
  4. 用 AI 写测试用例:模板与避坑 
  5. 自动化测试"自愈":从脚本到智能用例 
  6. 电商 AI 实战①:搜索/推荐系统的测试坑 
  7. 电商 AI 实战②:智能客服与风控的测试重点 
  8. TOC vs TOB:AI 功能测试的侧重点 
  9. 怎么定义 AI 产品"好用"?评测体系搭建 
  10. 测试人的 AI 能力地图与 30 天入门路径 

B 评测实操篇(7 篇)

  1. 评测集从0到1:我搭退款意图集的全过程 
  2. 评分卡别写"好不好",改成扣分项才准 
  3. 用大模型当裁判,这三个坑我全踩过 
  4. 如何把AI评测集和评分串成闭环 
  5. 评测样本中边界负样本别靠灵感,5 招批量造 
  6. 模型评测靠人盯必漏,智能化进阶闭环 

C Agent 评测篇(7 篇)

  1. Agent 评测不是 LLM 评测,90 分也翻车 
  2. Agent 评测集别照抄,5 类来源可选 
  3. Agent 评测容易踩的3个坑 
  4. agent工具调用 评测3 个错法 
  5. Agent 评测5 档稳定性度量横向比较 
  6. Agent 安全评测4 类攻击面 
  7. Agent 双轨评测3步搭起来,避免上线就失控 

阅读路径

你的状态
建议路径
刚接触 AI 测试
A 系列 article01→10,建立认知框架
要亲手建评测集
B 系列 eval-prac-01(建集)→02(评分卡)→03(LLM裁判)→05(边界样本)
想让评测自动化
B 系列 eval-prac-04(闭环)→06(智能化)
从零做 Agent 评测
C 系列 agent-eval-01(地基)→02(任务集)→03(过程分)→04(工具)→05(pass^k)→06(安全)→07(上线)
Agent 已上线出问题
直奔 C 系列 agent-eval-07(双轨)+06(安全红队)

相关学习资料