ARTICLE · 1111737
聊聊信通院的驾驭工程:赋能智能原生软件工程研究报告
架构师之道
● AI · LLM · Agents | Enterprise Architecture | Digital Transformation

这份报告想干的事很清楚:在 AI 智能体开始大规模写代码、调工具、跑流程的背景下,总结了业界兴起的“驾驭工程(Harness Engineering)”这个新框架,说以后软件工程不能只靠提示词、上下文工程,也不能只靠传统 DevOps,而要有一套专门管住智能体的运行环境、约束规则、反馈闭环和治理体系。
一、这份报告主要讲了什么
报告一共六章,主要线索就是一句话:AI 从“辅助写代码”变成“自主干工程”,传统软件工程管不住它,所以要搞驾驭工程。
1. 背景:为什么现在提驾驭工程
报告认为,大语言模型和智能体已经从实验室走到生产环境,软件工程从“人主导”变成“人机协同”,正在从“工具集成期”走向“流程自治期”。以前提示工程、上下文工程只能优化模型输入,解决不了长任务、多工具、跨系统、可审计、可回滚的问题。所以需要驾驭工程,把 AI 放进一个“有边界、有反馈、有治理”的笼子里,让它在边界内自主干活。
报告还列了政策与市场驱动:国家层面有“人工智能+”行动、工信部“人工智能+软件”专项,地方有北京、四川等方案。市场数据说 67.3% 软件相关企业把 AI 投入生产环节,31.2% 完成智能体与研发流程内嵌。腾讯、通义灵码、中兴等案例被拿来证明 AI 已经进入业务主干。
2. 定义:什么是驾驭工程
报告把 Harness 解释为“马具”,说 Anthropic 工程师把它引入智能体领域。定义是:为智能体构建完整运行环境、约束规则与反馈闭环的系统工程方法,让 AI 在人类设定的边界内自主、可靠、可持续地完成复杂任务。
它强调三个范式转变:- 智能体从被动代码生成器变成主动工程参与者;- 管控重心从流程节点下沉到运行时行为;- 治理逻辑从流程驱动变成“约束边界+反馈驱动”。

三代演进是:提示工程 → 上下文工程 → 驾驭工程。提示工程管单次输入,上下文工程管信息流,驾驭工程管外部管控体系,目标是端到端任务落地、受控执行、边界内自主协同。
3. 价值定位:管控框架与生态底座
报告说驾驭工程有四大职能:
- 统筹协同:
跨系统编排、统一语义层、模型通信契约、事件驱动、全局状态视图; - 规范治理:
模型准入、输出规范、版本控制、追溯、合规校验; - 效率提升:
AI 导向的 MLOps、推理优化、增量学习、资源调度; - 安全保障:
对抗鲁棒性、安全围栏、容错降级、全链路留痕。
它反复强调:驾驭工程不是工具产品,而是治理框架和产业级管控框架,负责标准互认、接口规范、审计维度。
4. 发展格局:国外引领,国内跟进
国外部分讲了 OpenAI、Anthropic、微软、AWS、LangChain、Stripe 等。比如 Anthropic 连续发博客,OpenAI 开源 Codex Harness,AWS 发 Bedrock AgentCore Harness,微软发 Agent Framework Harness。报告说国外形成“商业产品矩阵+开源公共底座”双轮驱动。
国内部分讲了阿里、腾讯、字节、DeepSeek、华为、蚂蚁、易鑫、海信等。阿里通义灵码升级 Qoder CN,DeepSeek 开源 Harness,华为 AgentArts 长程任务完成率 80%、记忆召回 90%,腾讯 WorkBuddy/CodeBuddy,蚂蚁阿福医疗,易鑫汽车金融,海信 AI 原生开发,广东政务智能中枢,瑞金医院联合华为 RuiPath 等。
5. 挑战
报告点出三大技术瓶颈:
研发团队工程化思维缺位,存量系统包袱重; 行业工程体系碎片化,200 多款大模型接口不统一,68% 开发者要单独适配; 全生命周期闭环管控缺失,68% 企业认为“AI 与工程融合不深入”是首要障碍。
标准化短板是:顶层通用标准缺位,分级分类落地标准空白。于是报告自研 L1—L5 成熟度模型来补。
6. 设计原则与技术体系
六大设计原则:
机器可读性优先; 渐进式信息披露; 边界约束与行为收敛; 闭环反馈; 安全合规内生; 动态适配与记忆沉淀。

六类技术能力:
连接能力:协议治理、能力目录、语义互通; 编排能力:任务边界、状态机、异常恢复、完成门控; 循环能力:自动触发、工作空间隔离、技能复用、子智能体分工; 效能能力:上下文预算、模型路由、缓存、Skill 复用; 安全治理能力:输入输出执行三侧联动、沙箱、审批、审计; 评估优化能力:执行、服务、资源、安全、业务五维评估。
报告还提了工程原语:任务、会话、状态、工具、记忆、权限、评估、审计,要有唯一标识、版本、生命周期、审计追溯。
7. L1—L5 成熟度
L1 工具接入级:能力可登记、可调用、可关停,低风险场景; L2 运行底座级:会话管理、上下文装配、超时、重试、状态存储; L3 治理闭环级:权限分级、安全沙箱、全链路审计、人工审批; L4 协同自治级:多智能体、多工具链、多工作流协同,可观测、可审批、可回滚; L5 规模生产级:组织级基础设施,能力市场、知识资产、统一安全、成本计量。

实施误区分四类:认知定位、架构建设、过程控制、安全合规与规模化。比如把驾驭工程等同提示词工程、盲目堆插件、把记忆当聊天记录、过早放开高危权限、先规模化后补安全合规。
8. 应用场景
软件全生命周期:需求分析、架构设计、编码、测试、部署运维。核心思路是需求变契约,架构变可执行规则,编码在沙箱里自主修复,测试自动生成归因修复,运维契约驱动、闭环自愈。

质量治理:前置治理、全链路可追溯、持续进化。
行业落地:通用行业轻量化;金融合规风控;工业功能安全;政务数据安全;医疗隐私保护。
9. 未来展望
三个阶段:2026—2027 概念验证与标准形成;2027—2028 平台化与规模化;2028 以后基础设施化。人机协同成为主流,开发者能力变成四维复合能力。生态协同和行业治理机制要跟上。
二、我觉得有价值的地方
这份报告最大的价值,是把驾驭工程总结的比较全面,它有几个点抓得挺准:
把“运行时行为”当成治理核心,而不是只在开发时写规则; 强调能力目录、接口契约、权限隔离、审计追溯; 提了工作空间隔离、独立评估智能体、熔断机制; 提了上下文预算、模型路由、Skill 复用,这些是很实际的成本问题; L1—L5 分级虽然粗,但给企业一个“先别一口吃成胖子”的路径。
从系统工程角度看,它本质上是把控制论、平台工程、安全工程、MLOps、DevOps 揉在一起,给智能体做了一个“控制面”。
三、我的一些看法
看完报告,觉得还是有一些不足之处。
第一,概念边界有点糊。Harness 在软件测试里本来就有“测试夹具”的意思,报告把它重新定义成智能体管控框架,容易和 test harness、agent framework、MLOps 平台混淆。很多内容其实是 Agent 编排、沙箱、权限、审计、评估的大杂烩,冠一个新词,概念通胀的味道比较重。我个人是不太赞成把 Harness 视为框架的,我一直把它视为方法论、工程思想。
第二,三代演进说得太线性。提示工程、上下文工程、驾驭工程不是替代关系。实际工程里,提示词、RAG、上下文管理、记忆机制仍然在驾驭工程内部大量使用。说“不再在开发阶段用规则逐条指挥 AI”有点绝对,生产系统照样需要静态检查、编译约束、代码规范、门控。
第三,L1—L5 缺少可操作指标。什么叫“可登记、可调用、可关停”?什么叫“长任务可恢复”?失败率、MTTR、越权拦截率、幻觉率、成本/任务、人工介入率、审计完整率,这些量化口径没给。没有权重、没有评测集、没有认证流程,企业很难自评,更容易变成咨询公司打分。
第四,安全和治理讲得不够清晰。提示注入、工具滥用、供应链投毒、模型后门、日志篡改、多租户逃逸、隐私计算性能损耗,这些威胁模型没有系统展开。审计日志很重要,但日志本身怎么防篡改、怎么签名、怎么最小化留存,报告没细说。
四、总结
如果把这份报告当成方向指引,它是有意义的。它提醒大家:智能体进生产,不是接个 API 就完了,必须做运行时治理。企业真要落地,我建议抓几件实在事:
- 先做能力目录和接口契约,
别急着堆插件。每个工具、数据源、模型都要有登记、权限、版本、审计。 - 把评测集和红队当基础设施,
没有评测就没有自治。独立评估智能体不能自己给自己打分。 - 权限分级、沙箱、人工审批、熔断回滚,
这四样是生产准入底线。 - 算成本账:
Token、人工干预、工具执行、等待时延、故障返工、安全治理,六类成本都要计量。 - 本体和语义层要早做,
能力描述、数据 schema、协议映射、版本兼容,这些是长期资产。 - 别迷信成熟度模型,
L1—L5 可以当自检清单,但不能当认证勋章。真正的成熟度看线上事故率、恢复时间、审计通过率、单位任务成本。
说到底,驾驭工程这个概念,本质是给非确定性智能体建一套“操作系统级”的控制面。报告把驾驭工程“应该有什么”讲的很清楚,至于“具体怎么做、怎么验、怎么算账”,企业需要自己探索。
有任何不同的看法,评论区我们可以继续聊~ 😊
https://www.caict.ac.cn/kxyj/qwfb/ztbg/202609/P020260928603514637493.pdf
提醒一句:以上资料请仅用于个人学习和研究之用,勿用于任何商业目的,切记!!!
架构师之道
架构之道,在于化繁为简,以设计思维驱动技术决策
> 关注作者并添加星标,与‘架构师之道’同行