Cursor官方实验:多智能体集群依据文档用Rust重建SQLite,最高得分85%点击上方蓝字关注我们📌 导读Cursor官方发布了一项研究实验:仅提供835页SQLite文档,多智能体集群用Rust从零实现数据库引擎,在sqllogictest中取得73%—85%的得分。实验成本最低为1,339美元,所有配置最终通过完整测试集。Cursor官方近期公布了一项实验,他们让多个AI智能体协作,仅凭一份835页的SQLite官方文档,用Rust语言从零构建一个数据库实现。实验未提供SQLite的源代码、测试套件或二进制文件,也不允许访问互联网。最终,这套多智能体系统产出的Rust实现,通过了包含数百万条查询的sqllogictest测试集。官方数据显示,四小时截止时新版框架得分为73%—85%,所有新版配置最终都通过了完整测试。01仅凭835页文档,多智能体协作重建数据库Cursor团队设计这项实验,是为了验证新版智能体集群框架的极限。他们选择了数据库引擎这一软件工程中的硬骨头——SQLite,作为重建对象。实验规则十分严格:只给835页官方文档,不提供SQLite的C源码,不提供sqllogictest测试集,也不给二进制文件,智能体甚至不允许访问互联网。sqllogictest是SQLite项目自建的测试套件,包含数百万条已知答案的查询。Cursor官方称,智能体集群事先不知道这套预留测试的存在,运行后还会进行人工代码和过程审查。这相当于让一个从未见过考题的学生,只靠一本教科书就去参加奥林匹克竞赛。智能体集群被分为两类角色:规划者(planner)负责拆解任务和设计架构,执行者(worker)负责编写具体代码。规划者不看实现细节,执行者不做架构决策,每个智能体只维护自己任务树中的局部上下文。四小时后,一个用Rust写的数据库实现诞生了。它能运行,并通过了数百万条SQL查询的验证。官方测试了GPT-5.5、Grok 4.5、Opus 4.8+Composer 2.5、Fable 5+Composer 2.5四种模型配置,新版框架在每种组合中均优于旧版。四小时截止时,新版得分在73%到85%之间。Cursor官方称,所有新版配置最终都通过了完整的测试集。这仍是一个实验性重建,不是成熟的生产级SQLite替代品。官方明确表示,运行结束后有人类审查代码和过程。02从七万次冲突到不足千次,上下文分离的作用旧版框架的表现暴露了单智能体模式的缺陷。Cursor官方数据显示,旧版Grok 4.5在前两小时产生了约68,000次提交,累计超过70,000次合并冲突。新版完整运行四小时,冲突少于1,000次。Cursor官方将这一改进归因于上下文分离:规划者不写实现,执行者不做规划,每个智能体只维护任务树中的局部上下文。执行者不需要了解整个数据库架构,只需按接口规范完成局部任务,完成后提交并领取下一个任务。这种模式类似纪律严明的工程团队:架构师定义蓝图,工程师各司其职,接口清晰,互不越界。官方研究判断,上下文分离是swarm的主要收益,但这不是独立验证的结论。官方token分布图显示,各次运行中执行者至少承担69%的token,多数运行超过90%。前沿模型主要用于任务拆解和设计决策,低成本模型承担大部分执行token。这相当于用最贵的脑子想最难的问题,写代码等重复性工作交给便宜模型。03实验成本最低1,339美元,模型分层带来成本差异Cursor官方成本图显示,Opus 4.8规划器+Composer 2.5 worker的组合运行成本为1,339美元,GPT-5.5规划器与worker组合为10,565美元。官方强调这是不同模型角色配置下的实验成本,不应外推为通用开发成本。成本差异的核心在于模型选择。Opus 4.8规划加Composer 2.5执行的组合,将昂贵模型用在刀刃上;GPT-5.5全包的模式,虽然属于更昂贵的全前沿模型配置,但每一行代码都在消耗最贵的token。官方数据显示,这种分层架构让总成本显著降低。上下文分离也削减了隐形消耗。每个执行者只看局部上下文,无需塞进整个项目的代码,也无需反复回溯之前的决策,从而减少了错误重试和推理轮次。Cursor官方认为,智能体集群带来了新的模型经济学,任务的拆解方式、模型选择策略和协作效率比单纯的token单价更重要。04从写代码到定义目标,开发者角色的可能转向这次实验让人关注的是,智能体只获得了835页手册,没有获得源码、测试套件、二进制文件或互联网访问权限。没有人类直接编写这次实验的实现代码,但Cursor官方明确表示,运行结束后有人类审查代码和过程。产出的Rust实现仍是研究结果,不是生产可用的SQLite替代品。过去AI编程的隐喻是“副驾驶”,人类掌握方向盘。Cursor的集群实验展示了另一种工作方式:人类只需定义目的地,路线规划和驾驶由智能体完成。但官方强调,运行后有人工审查代码和过程,人类仍参与验证和判断。这对开发者的角色提出了问题。当AI能从文档直接生成系统实现,程序员的核心价值可能从写代码转向定义目标、设计约束、审查输出和验证安全。这更像是从建造者变成监理,从工匠变成质量工程师。质量和安全仍是关键。AI自主生成的数据库,即使通过了测试和人工审查,也可能存在边界条件的bug或安全隐患。维护性同样值得关注:AI写的代码,未来由人类维护还是再次生成,目前没有明确答案。05规范驱动开发:当手册成为唯一人类输入Cursor的实验起点是835页手册,没有源码、测试、二进制或互联网。人类提供的全部价值就是一份需求文档。这让我们重新思考编程的本质:把人类意图翻译成机器指令的过程。过去需要程序员逐行编写,现在AI直接从文档跳到可执行系统。当文档足够精确完整时,AI能自主完成从规范到实现的全部工作。SQLite手册恰好定义了每个SQL命令的行为、数据结构的约束和边界条件的处理。这不是魔法,而是规范驱动开发的一种形态:人类定义规范,机器实现规范,中间的编码、调试、测试全部自动化。未来的程序员可能不再只承担代码编写,而会更多负责目标定义和结果验证。工作会变成写出足够精确的需求文档,再审查AI生成的系统是否符合约束。Cursor的四小时阶段成绩说明部分实现工作可以被显著加速,但不能据此推断完整生产开发周期。程序员与产品经理的区别在于精确性。产品经理定义用户需求,程序员必须定义机器可执行的规范——索引结构、查询语法、排序算法、分页逻辑、缓存策略等。AI能帮助实现,但前提是人类能把这些精确描述出来。Cursor的实验显示,当手册成为唯一人类输入,编程的门槛不在写代码,而在写清楚你到底想要什么。06实验验证的是多智能体编排,不是AI复刻生产SQLiteCursor官方这次实验的真正价值,在于验证了多智能体编排、上下文隔离和模型分层的工程收益,而不是宣称AI已经复刻了生产级SQLite。实验产出的仍是实验性Rust数据库实现,不能替代成熟产品。1,339美元、四小时、835页手册,这些数字展示了规范驱动开发的潜力。但人类并未退出——目标定义、约束设计、质量审查和结果验证,这些仍需开发者承担。当手册成为唯一人类输入,编程的本质可能从写代码转向写清楚需求。这个问题本身,或许比写代码更具挑战。讨论话题:Cursor官方实验表明,多智能体集群能从文档出发重建数据库实现。你觉得开发者的核心能力会如何变化?是继续深入学习Rust这样的系统语言,还是转向更精确地定义需求和约束?END往期推荐:DeepSeek V4引入峰谷定价,7月中旬上线!motion-skills开源,AI代理获50项新技能!美团开源LongCat-2.0,万亿参数1M上下文!