ARTICLE · 1143340
AI说做完了?这个模型专查哪里没做对
AI说做完了?这个模型专查哪里没做对
AI回复“完成了”,事情就真的做完了吗?
Laminar发布了flow-1,一个用强化学习训练、专门检查Agent执行记录的模型。它运行在Signals里,沿着模型调用、工具结果和交付内容找证据。
① 为什么单独做一个模型?
Agent可能每次工具调用都成功,却引用错文件、漏做步骤,最后还汇报完成。传统报错监控看不到这种问题;人工逐条看很慢,用强模型全部复查又贵。flow-1想把过程质检做得更便宜,覆盖更多任务。
② 它具体查什么?
官方案例里,代码Agent把两个测试失败都归咎于同一个旧问题,但日志只支持其中一个。检查器要对照“它说了什么”和“证据显示什么”,输出问题及证据位置。也能提取用户意图、未解决需求、缺少的集成。
③ 它怎样工作?
把一条执行记录当成代码仓库,每一步当成文件。先看概览,再检索、展开相关步骤,按你定义的JSON字段返回结果。RL训练的是这套调查过程:看哪里、怎样取证、何时报告;接入后并不代表你的Agent自动学会纠错。
④ 实际怎么用?
先用SDK把任务过程送到Laminar,再创建Signal:写清检查要求、输出字段、触发条件和过滤规则。可以先回查历史任务,点开事件核验证据,再开启持续检查和提醒。新项目已有Failure Detector,默认检查超过1000 tokens的记录。
⑤ “便宜23倍”怎么看?
官方在523条困难记录上测试:flow-1检测F1为0.835,GPT-6-sol为0.816,Opus 5为0.890。少于10万tokens的记录,平均分析成本约0.0011美元与0.026美元。是特定任务比较,F1也不是正确率。
实际购买还要算平台费。当前Starter为30美元/月,Signals另按分析用量计费;一次性5美元额度不是每月赠送。评测成本与套餐账单别混算。
更有意义的是把反复出错的过程归类,修正后再验证有没有改善,也能发现用户一直想做却没做成的事。检查器仍可能误判、漏判,判断要能回到证据。
#AI智能体 #Agent #flow1 #AI产品 #开发工具