ARTICLE · 1096259
阿里研发基础设施负责人许晓斌:AI时代的软件工程丨阿里的实践模式分析
阿里研发基础设施负责人许晓斌:AI时代的软件工程丨阿里的实践模式分析当下AI代码生成能力飞速迭代,不少研发团队的代码AI生成占比已经突破90%,甚至逼近100%。 很多人顺势产生一个认知:程序员写代码的工作要被替代,软件工程行业要彻底变天。 但在阿里巴巴研发基础设施负责人 许晓斌 看来,这恰恰是行业最大的误区。AI解决了“写代码”的表层问题,却把软件工程真正的核心难题彻底暴露了出来。 演讲视频丨阿里巴巴研发基础设施负责人许晓斌 在2026云栖大会的分享中,许晓斌结合阿里巴巴多年内部实践、千万级工程落地经验,就AI时代软件工程的真实困境、核心变革方向,行业踩坑真相等话题分享了自己的观察与思考。 两年前,行业评判AI研发能力的核心标准十分单一,主要看两个指标:代码采纳率、AI代码占比。 各大团队纷纷内卷数据,30%、40%的AI代码占比曾被视作行业标杆。但短短两年,这套评判标准已经彻底失效。 如今绝大多数团队的代码几乎都由AI生成,但软件工程的效率、质量、风险问题,不仅没有消失,反而愈发严峻。 许晓斌直言,100% AI生成代码并不是好事。AI无法为线上故障背锅,但一旦系统出问题,所有风险最终都会落到研发团队身上。 更现实的问题随之而来:AI批量产出大量代码后,人工Code Review已经跟不上节奏。 代码体量暴涨、开发语言杂乱多样,即便资深技术管理者,也难以逐一核查代码质量,团队工程质量隐患持续累积。 绝大多数人对软件工程的认知,仍然停留在“写代码”这单一环节,但真实的大型互联网工程,完全是另一套逻辑。 
许晓斌给出一组阿里内部真实数据:研发人员真正写代码的时间,仅占整体工作的20%-30%。 而在完整的软件交付链路中,编码的占比更是低到离谱:写代码的耗时不足1%,剩下99%的工作全在后续环节。 一次完整的软件上线,需要经历代码评审、多轮测试验证、多系统集成、灰度发布、线上观测、问题复盘等一系列复杂流程。 尤其是支付宝、淘宝、高德这类亿级用户的核心系统,直接关系资金安全、用户体验,零容错是底线,稳定性和可靠性远重于开发速度。 这也区分了“玩具级开发”和“真正的软件工程”:普通人用AI写代码做小项目,出错可以随时重来;但企业级大型系统,一次故障就可能造成巨额损失。 单纯压缩编码时间,根本无法提升整体研发效率,这也是AI提速编码后,企业研发瓶颈依旧存在的核心原因。 在许晓斌的视角里,AI重构的不是编码环节,而是整个软件工程体系。当下行业需要直面三大核心本质问题。 第一,大型系统的安全与可靠性难题。 AI擅长解决独立、低交互的简单开发场景,但企业真实的软件系统,是错综复杂的分布式存量体系。 千万级存量代码、多系统交叉调用、复杂业务链路,AI无法自主适配这类复杂场景,极易引发兼容故障、线上漏洞。 第二,复杂系统的协同难题。 企业软件工程从来不是单人开发,而是多团队、多角色、数百人的协同作业。 AI放大了个人开发能力,却打破了原有团队的协同节奏,人和AI的协同、多AI之间的协同,成为全新的工程难题。 第三,交付标准与信息缺失难题。 代码从来不是软件交付的全部,大量核心信息都留存于工程师的经验和脑海中。 需求细节、测试标准、系统搭建逻辑、运维规范等非结构化信息,无法自动同步给AI。这就导致AI交付的系统,看似能正常运行,实则暗藏监控兼容、容量适配、高可用缺失等隐性问题。 阿里内部就曾出现真实故障:AI完成站点搭建与交付后,数月后用户正式使用时系统宕机,核心原因就是AI仅完成基础部署,未落地高可用、监控适配、容量校验等工程标准。 如今行业普遍陷入“模型迭代狂热”:模型升级一次,大家就跟风尝试新能力。但许晓斌强调,真正制约AI工程落地的,从来不是模型能力,而是企业配套基建的缺失。 
他总结了当前行业四大核心短板,也是所有企业必须补齐的工程能力: 1. 环境与验证体系不完善 AI完成编码后,需要真实、隔离、可复刻的环境完成验证。多数企业缺乏标准化验证机制,仅靠简单接口连通就判定交付完成,大量隐性故障无法提前暴露。 2. 研发平台对AI不友好 企业内部中间件、运维平台、研发系统错综复杂,新人甚至AI都需要极高的学习成本,无法快速适配企业存量工程体系。 3. 数字员工权限与安全管控 AI没有人类的风险感知能力,权限、身份体系缺失,会被无限放大破坏力。模糊的需求、宽松的权限,极易导致AI篡改生产数据、泄露内网信息、破坏核心系统。 4. 组织人才体系脱节 传统研发岗位边界、团队边界被AI彻底打破,原有工程师、测试、运维、产品的分工模式失效,传统软件工程经验看似失效,人才激励、团队管理面临全新挑战。 针对以上痛点,阿里在内部打磨多年,落地了一整套标准化AI软件工程基建,且多项能力已开源开放。 1. Sandbox-Agent:构建安全隔离的AI运行环境 
沙箱是AI工程落地的核心基础设施,核心价值是给AI划定清晰的运行边界,实现权限、网络、资源的全面隔离。 OpenSandbox(https://open-sandbox.ai/) 阿里已将Sandbox项目开源。在阿里内部,它已实现每周千万级创建规模,可支撑AI开发、训练、评测、办公等全场景运行,兼容主流Docker、K8S架构,解决了AI运行失控、破坏生产环境的核心问题。 2. 环境系统化改造:实现全链路环境可复刻 真正的工程环境,不止代码,还包含工具链、多区域配置、数据基线、网络边界、依赖服务、监控体系等全套内容。 阿里耗时半年完成核心改造,已实现内部两三千个应用的全环境独立复刻,可从无到有复原整套系统的所有依赖。 这套能力让AI可以在独立环境中完成全量编码、测试、验证,零触碰生产环境,大幅降低线上风险。 3. 全新AI身份体系:精准溯源、可控授权 传统以人为核心的身份体系,无法适配AI作业场景,简单授权会带来巨大安全隐患。 为此阿里搭建了全新的组合式身份体系,整合操作人员、AI数字员工、运行负载三大维度信息,通过硬件加密、可信认证实现全程溯源。 系统可精准识别操作主体,针对高危行为自动校验、二次授权,从根源解决AI权限失控、操作无溯源的问题。 4. GuardRail交付系统:让AI交付可校验、可预判 针对AI软件交付的最后一公里,阿里自研GuardRail系统,解决四大核心问题:意图匹配、变更透明、风险预判、授权可控。 系统可自动校验AI代码是否匹配原始需求、清晰识别所有代码/配置/数据变更、预判变更影响范围,结合身份体系完成合规校验。 目前这套系统已在阿里内部灰度落地,目标是实现团队内半数核心生产系统由AI自主完成发布与运维,人工仅做最终确认。 在所有基建难题之外,人才与组织重构,是AI软件工程最难、最核心的命题。 AI打破了传统岗位边界,开发、测试、运维、产品的分工壁垒全面消失,单一人才可依托AI完成全链路工作。 但这种“超级个体”模式无法规模化复制,还会引发团队内卷、职责模糊、协作摩擦等一系列问题。 
对此,许晓斌给出了一些组织升级方面的思路: 首先,极致放大个人价值,驱动个体创造力。 AI时代,个体的创意、判断力、业务认知,远比基础执行能力重要。优秀人才依托AI,可释放十倍级的产能,管理者需要聚焦个体激励,激活人的主观能动性。 其次,消除组织与系统摩擦。 弱化固化的团队边界、岗位边界,搭建灵活的横向协作模式,优化考核机制,通过临时突击队等形式,解决跨团队协作低效问题。 最后,坚守业务价值本质。 AI迭代速度极快,极易出现“盲目迭代、无效产出”的问题。越是AI高效迭代,越需要团队锚定业务价值,避免陷入无意义的功能堆砌。 AI确实颠覆了“写代码”这件事,但软件工程的核心从来不是编码,而是稳定、可靠、高效、可控的系统化交付与运维。 正如许晓斌在分享中总结的:AI解决了表层的效率问题,但真正的软件工程革命,才刚刚开始。 模型能力只是基础,完善的工程基建、安全体系、组织人才模式,才是企业在AI时代站稳脚跟的核心壁垒。 据悉,阿里十余位核心工程师联合打磨的《AI Native 研发范式实践手册》已正式发布,感兴趣的读者们可通过阿里技术公众号获取电子版。 2026云栖大会AI Native研发实践相关阅读
01 行业误区:沉迷代码生成,忽略工程本质
02 残酷真相:写代码,仅占软件工程的1%

03 AI时代,软件工程的三大核心难题
04 行业共性短板:模型之外,基建全面滞后

05 阿里落地解法:四大基建,筑牢AI工程底座

06 核心命题:AI时代,组织与人才重构
