AI自迭代的范式转移:从Harness打补丁,到让经验写回参数我做AI产品刚满一年。有一个问题每隔几个月就会重新冒出来——你做了一个Agent,上线,跑了两周。发现它不够聪明。你怎么办?你优化提示词。你给它加记忆系统。你调工具链。你重新设计RAG pipeline。你甚至给它写了一套复杂的自我反思机制——每次执行完任务,让它自己review一遍,把经验存进向量数据库,下次遇到类似场景调出来用。它确实变好了一点点。但只有一点点。
这个循环我做了一遍又一遍。每次都觉得「这次应该差不多了」,然后过两周,用户反馈回来,还是那些问题——长任务跑偏、工具调用出错、跨会话状态丢失。你以为是工程没做好。你以为是数据不够。你以为是自己对Agent的理解还不够深。Harness层优化 vs 参数更新闭环
过去几年,不少AI产品所谓的「自我进化」「持续学习」,主要都在同一层做文章——我管它叫Harness工程层。什么是Harness?简单讲,就是模型外面包的那层壳。提示词模板、记忆系统、工具调用、RAG pipeline、多Agent编排、工作流引擎——所有这些东西,都是Harness。Harness工程=Agent-LLM
你写了个很复杂的System Prompt,模型变聪明了。这是Harness层的改进。你给Agent接了个向量数据库做长期记忆,它记得住用户偏好了。这是Harness层的改进。你用LangGraph搭了一套多Agent协作框架,任务拆解得比以前好。这也是Harness层的改进。但这些改进有一个共同的天花板:模型本身没有变聪明。它只是被更聪明地「使用」了。就像你给一个普通员工配了更好的SOP、更顺手的工具、更详细的checklist——他确实做得更好了,但他的能力上限没有改变。它没有只在应用壳上做文章,而是把可插拔的参数更新、递归训练闭环和运行时Harness放进同一套系统里共同设计。它试图做的,不只是给壳打补丁,而是让壳里积累的经验有机会回到参数里。
这两者的区别,就像给一个人配更好的笔记本,和建立一套能把实践经验内化成能力的学习机制。前者是工具优化,后者触及了能力更新。他们到底做了什么
Macaron-V1 是 Mind Lab 在7月21日发布的正式版模型,包含 Venti 和 Tall 两个版本。本文重点讨论旗舰版 Venti。根据团队在发布页列出的名单,参与这次发布的成员约80人。据创始人在WAIC分享,Mind Lab的模型API商业化两周后,ARR达到1000万美元。公开报道还提到,其母公司Mindverse此前完成了5000万美元A轮融资。他们做了三件事,分别落在参数更新、训练闭环和运行时工具复用三个层次。每一件单拿出来都值得聊,放在一起则构成了一次值得关注的系统协同尝试。第一件事:MoL架构——冻结基座,用约0.54%的适配器参数承载专业能力。
Macaron-V1-Venti 站在 GLM-5.2 的肩膀上:冻结744B基座,在上面挂四个独立的1B LoRA专家——Chat、Agent、Coding、GenUI。四个适配器合计4B,约为基座参数量的0.54%。其中L0 Chat兼任入口路由:每个新请求先由它选择更适合的专家,后续推理和工具交互则留在被选中的LoRA上下文中。四个专家各管一类能力,但共享同一个基座的知识。图:根据官方发布信息整理;概念示意,不代表完整网络拓扑。这意味着什么?意味着新能力可以通过新的适配器加入,而不用直接改写基座参数。LoRA本身并不是新东西,真正值得关注的是:Mind Lab把多个独立LoRA做成了明确的训练和服务架构,让不同能力在各自的参数空间里优化,降低彼此干扰和灾难性遗忘的风险。过去很多系统不是完全学不会,而是部署之后缺少低成本、可控的参数更新接口。
第二件事:MindForge——让模型自己发现、解决、学习更难的任务。
MindForge 是一个三阶段的递归自我改进框架。发现阶段:从一个种子任务出发,模型自己构造更难、更多样的任务,自己验证答案,然后按质量、难度和学习价值筛选。扩展阶段:模型解决这些任务,审计自己的执行轨迹,然后迭代改进 HCP 配置文件——就是那个统一训练和生产环境的Harness配置标准。更新阶段:优化后的轨迹和配置用来训练模型参数。更新后的模型又能生成更具挑战性的任务,再进入下一轮循环。发现 → 扩展 → 更新 → 发现更难的任务 → 继续扩展 → 继续更新。
图:根据官方对Discovery、Expansion与Update三个阶段的描述整理。这是一个正向循环。它让任务生成不再完全依赖人类持续扩写固定题库,模型也能参与出题、求解、验证和筛选。但这不等于人类彻底退出。种子任务、验证器、奖励定义和安全门槛仍然需要设计。真正的变化是:课程可以从一份静态题库,变成一台能够持续扩展的数据引擎。我们做产品的人最头疼的是什么?是用户场景的多样性。你永远不可能穷举所有corner case。MindForge 的思路是:我不穷举,我让模型自己去发现边界、撞到边界、然后学会突破边界。第三件事:REPL Harness——模型能自己写工具,并且跨会话复用。
REPL Harness 给模型提供了一个持久化的 Python 命名空间。模型可以自己写代码、封装成工具(save_tool)、验证、然后提升为全局工具(promote_tool),下次开新会话还能继续用。模型今天在处理一个任务时,发现有个计算逻辑反复用到,它自己写了个函数封装起来。下次遇到类似场景,直接调用,不用重新推理一遍。工具只有通过验证才会被提升,以降低错误逻辑被长期保留的风险。这不就是一个人类程序员的成长方式吗?遇到重复劳动就抽象成工具,下次直接用。
MoL 提供低成本、相互隔离的参数更新接口(冻结基座 + 可插拔专家)。MindForge 提供了「持续学习」的驱动引擎(自我发现 → 自我改进 → 自我更新)。REPL Harness 提供运行时行为的沉淀和复用机制(自写工具 → 验证 → 跨会话复用)。它们并不是严格意义上的「缺一不可」。MindForge训练出的参数本身就能跨任务复用,REPL解决的是另一类问题:怎样把已经验证过的执行逻辑变成随时可调用的工具。三者分别处理参数、训练和运行时,拼出了一套比单点优化更完整的协同方案。这对做产品的人意味着什么
过去三年我们做Agent产品的方式,是不是从根上就偏了?不是说那些工程手段没用。提示词优化有用,记忆系统有用,RAG有用。但它们本质上是在一个「不会自己变聪明」的模型上叠buff。就像你给一台计算器做了全世界最好的UI,它也不会变成计算机。Macaron-V1 给出的信号是:「持续学习」不应该只是一个产品功能,它应该成为模型与训练系统的基础能力。意味着未来做Agent产品,核心竞争力可能不再只来自提示词工程和工作流编排。你选择的模型是否支持低成本参数更新,训练系统能不能从真实经验中持续提取信号,也会变得越来越重要。产品的一部分护城河,正在从「工程层的精巧设计」迁移到「模型、训练与Harness如何协同」。
这个转变很残酷。因为它意味着很多团队过去积累的工程资产,可能在下一代模型面前快速折价。但也让人兴奋。因为如果模型自己能持续变聪明,产品经理就可以把精力从「怎么让模型表现更好」转移到「怎么让模型和用户一起成长」。Macaron-V1 的定位是「个人智能体」,强调三件事:能力、连贯、表达。能力好理解。连贯是指跨时间的一致性——它记得你是谁、你的偏好、你上次聊到哪了。表达是指它不只是完成任务,而是以恰当的方式呈现结果。注意,「连贯」这个词在他们文档里反复出现。为什么强调连贯?因为一个真正的个人智能体,不是每次对话都从零开始的工具。它是一个跟你一起进化的存在。你今天跟它说了你的工作习惯,三个月后它还应该记得。你今天教会它一种处理邮件的方式,以后应该默认用这种方式。你今天纠正了它的一个错误,它不应该再犯。这些需求,靠Harness层的记忆系统不是不能做——我们已经在做了。但那种做法像什么呢?像你每次跟一个朋友聊天之前,先给他发一份你们的聊天记录让他复习一遍。能work,但别扭。Macaron-V1的MoL架构,加上团队此前在MindClaw里探索的LoRA RL,提供了一条可能的路径:把反复出现的高价值偏好和技能逐步写进参数,而不是永远靠检索重新塞回上下文。但这里必须说清楚:这不等于Macaron-V1已经会在每次用户纠正后,自动更新一个专属LoRA。用户级参数化记忆仍然涉及反馈质量、训练频率、隐私隔离、遗忘与回滚等一整套工程和安全问题。今天更准确的说法是:这套架构让这种未来第一次显得足够具体。这更接近「个人智能体」应该走向的方向。
更深一层:AI产品的架构分工正在被重新定义
如果 Macaron-V1 的路线是对的,那整个AI产品的技术栈会重新分工。过去的分工大致是这样:模型公司做基座,中间层做工具和框架,应用层做产品。三层泾渭分明。Macaron-V1并没有简单地把Harness「吃进模型参数」。它做的是另一件事:把生产环境使用的Harness带进训练闭环,再用HCP统一训练和服务时的上下文配置;REPL Harness则让模型能够在运行时编写、验证和复用工具。这意味着什么?意味着模型训练与应用运行之间的边界正在从分离走向协同设计。以前我们选模型,看的是推理能力、多模态能力、价格。以后可能还要看:它有没有低成本、可持续的参数更新机制?它的Harness协同设计做得好不好?它是否为用户级LoRA个性化留出了接口?这些过去常被当成应用团队自己的事。Macaron-V1至少给出了一个信号:有些问题可以在训练、参数和Harness的协同层面解决,而不必全部留给应用层打补丁。威胁在于:如果你的产品核心壁垒建立在「比竞争对手更会调提示词、搭工作流」上,那这个壁垒可能很快会被模型能力的进化冲垮。机会在于:如果你能利用好这种从经验中持续更新的能力,产品就有可能从「更好用的工具」,走向「会跟用户一起成长的智能体」。这两者的区别,就像卖一台配置固定的电脑,和培养一个会不断学习的助理。工具用完就旧了。智能体越用越值钱。
上个月我跟一个做Agent创业的朋友聊天,他说了一句让我记到现在的话。他说:「我们花了两年时间,把提示词从100行优化到了5000行。现在回头看,可能方向就错了。不是不该优化,而是该优化的不是提示词。」因为我突然意识到,我自己也是这样的。每次模型发布新版本,我们的提示词就得重写一遍。每次基座能力提升,我们之前费心搭的那些工程层优化就有一大半变成冗余。Macaron-V1 让我看到的是另一种可能性:让模型自己学会变好,而不是靠我们在外面拼命拽着它变好。这条路能不能走通,现在下结论还太早。Mind Lab才成立不到一年,Macaron-V1也才刚发布。两周1000万美元ARR的公开口径,至少说明已经有客户愿意为相关模型API和后训练能力付费,但它不能直接证明技术路线已经成立,更不能证明「个人智能体」愿景已经实现。不是因为技术多炫,而是因为它回答了一个产品人最核心的困惑:为什么我们做了那么多努力,Agent还是不够好用?以上。写这篇的时候一直在想一个问题:如果模型与训练系统真的把持续学习这件事接过去了,那我们这些做产品的人,核心竞争力到底是什么?还没想清楚,但隐隐觉得答案不只在工程细节里,更在对「人机关系」的理解深度上。如果觉得这篇文章值得讨论,随手转给一个也在做AI产品的朋友。认知差往往出现在范式转移的初期——早一点看到,就早一点准备。羊尼克说 · 记录真实的产品判断