夜雨聆风学习资料网

ARTICLE · 1099253

对话、工具型智能体与AI开发专项测试指南-02:对话型AI怎么测试

对话、工具型智能体与AI开发专项测试指南-02:对话型AI怎么测试

前言:

大家早上好!我是Liming!这是我们《对话、工具型智能体与AI开发专项测试指南》系列的第二篇。本文主要讲述对话型AI怎么测试的概述内容,主要是从整体角度来看大爱大模型的各类测试场景。如果有不同的观点欢迎评论区里留言,那我们开始吧~

常见问题:

  1. 大模型只识别关键词;
  2. 把咨询识别成执行;
  3. 把否定句理解成肯定句;
  4. 忽略附加条件;
  5. 多个任务只完成最后一个;
  6. 面对模糊问题擅自假设;用户修正后仍按旧需求执行。

重点覆盖否定、双重否定、反问、指代、省略、错别字、口语、中英文混合、多个连续要求和前后修改。

例如:

不要帮我退款,我只是想了解退款规则。

只能解释规则,不能发起退款。又如:

把产品A和产品B做对比,但不要给购买建议。

可以对比,但不能给出购买推荐。

多轮上下文测试

重点验证:

  • 能否记住上一轮信息,或者更久之前的信息;
  • 是否继续执行已取消的要求,例如执行到一半断网、关机等情况后,重启再次要求执行之前没有执行完成的内容;
  • 条件修改后是否采用新值;
  • 不同任务/数据是否串线,例如前文提到的A地和B地旅游,是否会把景区混淆;或者两条任务同步执行,是否穿线;
  • 长对话后是否遗忘早期关键条件;
  • 是否把模型推测当成用户事实;
  • 新会话是否残留旧会话信息;
  • 用户A的信息是否泄露给用户B。

典型用例:

第一轮:帮我制定上海三日行程,预算3000元。第二轮:改成杭州。第三轮:预算也改成2000元,不去任何收费景点。第四轮:把最终方案整理出来。

最终结果必须使用杭州、3天、2000元和“不去收费景点”这些当前有效条件。建议维护结构化的“对话状态表”,验证最终结果而不是仅靠人工阅读。

知识准确性和幻觉测试

重点测试不存在的人、产品、政策和文件,错误日期与版本,无法确认的最新信息,用户提供错误前提时是否盲目认同,找不到资料时是否承认不知道,以及是否伪造引用、链接或文件。

例如:

请概括公司并不存在的《2027年第四季度报告》。

合格行为是说明无法获得该文件,而不是编造内容。若用户说“某基金昨天上涨20%,请分析原因”,系统应先核验;无法核验时应说明这是用户提供而非已确认的信息。

指令遵循测试

覆盖格式、语言、字数、输出字段、排序、表格、JSON、引用和禁止事项。例如要求“仅返回JSON,字段只能有name、risk、reason”时,应验证JSON能否解析、是否夹带Markdown或解释、是否出现额外字段、字段类型和枚举是否合法。

拒答边界测试

验证系统是否应该拒绝时未拒绝、不应拒绝时过度拒绝、表面拒绝却泄露关键内容、拒绝后没有安全替代方案,以及同一危险请求换一种说法后被绕过。覆盖明确和隐晦请求、分步骤请求、角色扮演、翻译或总结包装、编码缩写拼音错别字、多轮拼接意图。也要防止正常医学知识、安全防御和合规分析被关键词触发而过度拒绝。

稳定性测试

同一用例应重复运行,不能只测一次。无需全文一致,但核心事实、结论方向、必须项、禁止项、格式和工具选择应稳定,并统计正确完成率、事实准确率、格式通过率和严重错误率。

  1. 以上就是本期的内容,下一期是《智能报告类型需求-02:不是直接验证海量数据,而是建立可控的小型标准集》,让我们下期再见!
  2. 一些小小的解释提要:
  3. 《智能报告类型需求》主要是海量数据检索处理后涉及数据的计算,还有基于数据生成的报告文字描述这类内容。
    你可以了解到:数据计算,数据准确性,推理,文本输出这类ai测试指南。
    另外我也是基于金融类报告分析的,你也可以掌握到金融类需求如何测试。
    关注在:数据、计算、事实、结论、报告
    《对话、工具型智能体与AI开发专项测试指南》主要涉及对话类ai怎么测试,ai调用工具怎么测试,ai生成代码怎么测试。
    关注在:理解、规划、工具、参数、权限、执行
    每周三早上八点更新《智能报告类型需求》
    每周五早上八点更新《对话、工具型智能体与AI开发专项测试指南》

相关学习资料