如果你在日常开发中频繁使用各类 AI 编码工具,大概率体会过这种微妙的落差:各大模型在发布会上的跑分一个比一个亮眼,刷 LeetCode 题目行云流水、对答如流;但只要你把它拉进真实的企业级仓库——面对几十个相互依赖的文件、陈旧混乱的历史遗留代码、语焉不详的报错日志以及真实的终端环境时,它往往瞬间变成了一个刚出校门就遇到服务器宕机的实习生。它要么自信满满地写出两百行看似优雅实则缺失上下文的幻觉代码,要么在终端里反复尝试错误的修复指令,硬生生把上下文窗口撑爆,最后留下一堆烂摊子还要你亲自下场收尾。过去整个行业习惯于把这种“笨拙”归咎于基座参数还不够大,于是不断堆砌算力、扩大预训练数据规模。然而,当参数量冲上万亿级别,我们却发现:仅仅让模型“多读几百亿行代码”,并不能让它学会像资深工程师那样在混乱、动态的真实工程中做决策与排错。模型缺少的从来不是语法知识,而是面对不确定性环境时的行动逻辑与反思能力。