ARTICLE · 1114548
AI 给我打了分 然后呢?SpeakFlow 构建记录 01
假如你和 AI 练完一轮英语,屏幕上出现分数、点评,还有一个“再试一次”的按钮,接下来会做什么?不看提示,换一个问题,还能自己问清楚吗?
这是我做 SpeakFlow 时要回答的问题。我想把它做成一个能帮助人持续进步的 AI 教练。现在已经有了可操作的原型,接下来需要补上的,是判断学习有没有发生的办法。
欢迎来到浩哥AI实验室,这是我正在做的另一个项目,解决AI时代的语言学习与表达的问题。
先把一个工作问题问清楚
第一步先收窄到一个商务英语场景:你是一名分析师,和扮演 CFO 的系统讨论一家公司的收入增长。你需要用英语弄清楚,增长来自涨价、销量,还是客户结构变化,以及这些增长能否持续。
不熟悉估值也没关系。可以把它理解成一次有目的的工作对话:对方说公司收入涨了,你需要把原因问明白。英语在这里承担一个具体任务,句子是否漂亮之外,还要看它有没有帮你得到所需的信息。
这个场景同时考验两件事:话有没有说清楚,问题有没有问到点上。比如,问“为什么增长了”,对方可能给一段笼统解释;继续追问涨价和销量各贡献多少,才有机会拿到可以核对的信息。
当前原型已经能呈现任务、进行角色对话,并显示访谈覆盖了哪些主题。图里的测试提问就在追问价格与销量的贡献;完整界面上,仍有客户结构、客户集中度和可持续性等主题没有覆盖。

图 1 当前版本 CFO 访谈局部。无密钥合成数据流程测试,仅展示交互,不代表真实访谈、AI 能力或学习效果。
分数后面还缺一次检验
结束访谈后,页面会把英语表达和估值访谈分开反馈,给出改进建议,并提供 Retry 入口。这样的安排有一个清楚的方向:让反馈紧挨着下一次练习,少一次“看完点评就关掉”的中断。
但这次检查也暴露了一个问题。在没有接入模型的本地回退流程里,部分评分依赖关键词和回答长度。多提到几个词、把句子写长一些,就可能影响结果。它能帮助检查页面和流程,却不能据此判断一个人真的学会了。
Retry 也还有缺口。界面会保留薄弱项和练习记录,但生成下一轮对话的提示还没有用上前一次尝试。这样一来,系统虽然提醒你继续练,却未必围绕刚才那个具体问题来追问。

图 2 当前版本的反馈与 Retry 区域。截图中的分数和建议来自无密钥合成测试,不能当作个人能力测评。针对上次回答的重试机制仍待完善。
所以,浏览器流程测试通过之后,还要继续追问:用户能否在没有提示时完成同类任务?目前的原型还缺少换题检验和隔一段时间后的复查。真实模型对话和录音链路,也不能由这次合成测试代为验证。
练习记录还应说明问题如何被解决。如果两轮之间只有分数变化,没有原话、提示和修改的对应关系,就很难解释进步发生在哪里。这正是下一步要补的部分。
下一步先试一个十分钟任务
下一轮,我想先做一个小实验:十分钟里,只练习如何追问收入增长的来源。下面是准备尝试的设计,还没有加入当前版本。
开始时先不给示范句,让使用者自己问一轮,留下原始回答。这份记录很重要,后面才能看出,哪些内容是原来就会的,哪些是在提示之后才补上的。
反馈先只选一个有原话依据的薄弱点。假设问题没有限定时间,教练就指出缺少哪一段信息,给一个短提示,例如“把时间范围说清楚”。先不直接贴上完整答案,让使用者自己改。
然后只重试这一小段,把前后的两句话放在一起看。改动是否真的补上了时间范围?对方现在能否知道要回答哪一年的情况?比较应当落在具体表达上,暂时不急着给出一个总分。
例如,初次提问只说了“收入增长”,重试时主动加上“去年”,就可以明确记下这项变化。如果只是照着示范句抄了一遍,也照实记下来。两种情况都完成了练习,但留给后续检验的问题并不一样。
最后换一家公司或一组数字,撤掉提示,再问一次。之后再安排一次隔天复查,看看同样的追问方式还能不能自己用出来。一次答得更好,值得记录;换题和隔天还能做到,才提供了更多判断学习进展的依据。
这十分钟也可能卡住。如果使用者看完提示仍然不知道怎么改,先检查提示是否足够具体,任务是不是太大。把卡住的那句话保存下来,比简单追加一道题更有助于决定下一次改什么。
这也是边做产品、边写记录的价值。把当前画面留下来,把没解决的问题说清楚,下一篇就有了可以对照的起点。
SpeakFlow 目前走到了“能练习、能反馈、能再来一次”。接下来最值得验证的,是提示逐步减少之后,人还能留下多少能力。第一步,就从这一个十分钟任务开始。