
飞书 Aily、WorkBuddy、千问办公都在抢工位:写周报、跑数据、处理工单。
麻烦是,Agent 每天上班,不会因为多跑几次就自动变稳。
2025 年 10 月,Pyromind 成立。
它把自己放在一个很窄的切口上:RLaaS 和 AutoRL。不是再做一个办公入口,也不是再包装一套 Prompt 模板,而是把任务反馈、奖励生成、训练、验证、模型更新连成一条管线。企业想要的不是 Agent 会喊“我能做”,而是出错之后,有没有一套机制让它下次少错。

年初,持续学习开始变成明星团队的共同语言。
智谱把记忆、持续学习和自我评判写进 GLM-5.2 的规划里。Jerry Tworek 离开 OpenAI 后创立 Core Automation,方向也指向生产中的持续学习。
Richard Sutton 拉起 Oak Lab,目标更直接:让 AI 从自身经验里学习。三条线放在一起看,信号很清楚。静态部署的模型,已经很难解释企业对长期 Agent 的期待。

上个月底,生产环境给了更硬的一刀。

Cognizant 宣布成立 EMEA AI 部门,靶心就是企业 Agent 从演示走向生产。Fiddler AI 的生产可靠性研究同时被摆上桌:受控演示里,单次运行成功率约 60%;放到生产负载下连续跑 8 次,成功率跌到 25%。

这组数字比一句“Agent 不稳定”更刺眼。演示里的数据干净,权限顺,接口文档也规整。真实工位里不是这样:工单字段会变,表格权限会断,人工修正会插进流程,业务规则还会临时改。演示能跑,只说明它会做这一次;连续 8 次还能扛住,才说明它能上班。
过去 18 个月,模型变强了,可靠性没同步跟上。
普林斯顿研究者评测 14 个 Agent 后也给出类似观察:模型能力突飞猛进,可靠性的提升却很慢。这个落差把办公 Agent 的问题改写了。用户已经不只问“它会不会写周报”,而是在问“它能不能连续 20 次都把周报、数据、工单接住”。

这里就轮到记忆、上下文工程、SFT 和后训练分家了。
记忆能调取偏好,比如记住你喜欢哪种周报格式;上下文工程管的是这一次怎么执行;SFT 让模型学会复制标准轨迹。这些都管用,但它们更像把员工手册写厚。真实任务里的失败、返工、人工修正,如果没有进入训练和验证,经验就停在日志里,不会变成下一次的能力。
Pyromind 押的就是这最后一段路。
AutoRL 的卖点不是炫技,而是降低强化学习的工程门槛。它要处理的问题很脏:哪些反馈算有效,奖励怎么生成,训练怎么排队,效果怎么验证,模型怎么灰度接回线上。任何一环断掉,企业都很难放心把 Agent 放进长期流程里。

PyroDash 是一个数字世界的注脚。它在五项数学推理基准上,让平均准确率超过纯大模型基线;偏重成本的配置下,总成本可以降低九成以上。对长期高频调用的 Agent 来说,这不是省一笔小钱,而是在决定这套系统能不能一直跑下去。
R2VLA 则把同一件事推到物理世界。规则系统先当老师,在真实设备上自动生成动作轨迹,再做时间对齐、自动打标、质量筛选和后训练。材料里给出的数字是连续 24 小时零人工运行,整体数采时间降低 50% 以上。一个降推理账单,一个降数据采集成本,最后都落在同一个问题上:经验能不能低成本回流。
所以看办公 Agent,接下来别只盯它接了飞书、钉钉还是表格。更该看三件事:失败轨迹有没有被留下,人工修正能不能进训练,更新后的模型有没有验证和灰度。
如果这条链路搭不起来,入口再多,Agent 也只是在重复上班。
夜雨聆风