字数 1209,阅读大约需 7 分钟
AI折腾记(二)|AI 真的很强了吗?一次课题申报书的翻车实录
最近用 AI 遇到一些问题,正好聊一聊:讲讲我踩的坑、我的推断,最后给一个实用建议。
我的 AI 工作流
• 任务执行:VSCode + Claude Code + GLM-5.3 • 知识调研:GPT(最新)+ GLM(最新)
GLM-5.3 的强项还是 coding,做规划略显吃力——这不是我瞎说,是一次课题申报书让我看明白的。
翻车现场:GLM 做规划的四个坑
背景:我计划写一个项目的课题申报书,让 GLM 先做调研,根据结果一步步总结,每个思路都整理进文档防止发散,同步验证可行性,还要同步做对外展示的 HTML。过程中我发现:
坑一:方案是花架子,仔细一看是空的。
AI 上来甩结果很厉害,提一堆看起来高深莫测的方案,仔细读其中的逻辑,全是断层。提修改建议后,它只会一点点地修,始终达不到我想要的效果,每次一眼就能发现漏洞。最明显的是数据流:我要求前后处理有逻辑性,数据流必须串起来,但它每次都冒出新参数、新公式,还不解释。
坑二:上下文一长,回复越来越看不懂。
上下文过长时前后逻辑会乱(之前提过这个问题)。我的办法是重开一个窗口,让 GLM 重新评估前面总结的方案。有用,但有新问题:它的回复越来越看不懂,新冒出一些奇怪的词。总结成一句话:简单概念解释得特别长,真正关键的科学假设反而解释不足。像极了这张图:

坑三:文档变成大杂烩。
可能和我多次开窗口评估设计文档有关,一份文档同时扮演了五六种角色:正文里正式公式、口语解释、设计理由、版本历史、待办项、"为什么不用另一种算法"混在一起。内容很多,但层级不纯。
坑四:总结和润色的手感不对。
GLM 的总结能力不尽如人意,专业表达的定位也不准,比如一份技术报告让它润色,效果不满意。具体说不上来,就是看完它润色的东西,只想跟它说:你写这玩意干啥?简简单单一句话就 OK 了!然后突突删掉一串字符。
换 GPT-5.6 之后:突然就顺了
后来我整了个 GPT Plus 账号,用 GPT-5.6 重塑了一遍工作,感觉突然顺畅了好多:写的东西咋全在我心坎里!总结到位,关键词准确,直接摘进 PPT;还能直接画图放 PPT,很好使。
当然 GPT 也不是没缺点:上下文长了同样有点控不住。但主线我已经总结出来了,工作能完成。
结论很明显:GPT-5.6 适合做规划,GLM-5.3 适合做执行。 GPT 总结到位、关键词准,背后训练数据的质量肯定很高。
我的推断:差距在参数量
根据这个使用场景,我推测和训练数据质量、参数量有关(我不是这个专业的,纯体感推测)。于是我查了各家头部模型的参数量:
(数据来自各家官方发布与技术报告,2026-08 查证)
很明显,GLM 参数量在头部阵营里是弱势,所以它把技能点点在了 coding 上。而我的场景需要全能模型——能力要上来,参数量必然上来,头部几家都到 T 级了。
所以大参数是大趋势。国产已经有 DeepSeek、Qwen、Kimi 站上 T 级,接下来就等 GLM 了——始终看好它,毕竟我可是从去年 11 月就是 GLM coding plan 的用户,期待 GLM 上 T 级模型的效果。训练数据质量的事更好解决:蒸馏一下,模型之间差距不会超过两个月。加油!
总结:选对模型,事半功倍
• 规划类工作:先上大参数(T 级)模型 • 规划文件写好后:交给 GLM 执行 • AI 提升生产力的核心,在于选一个聪明且贴合场景的模型——绝对是事半功倍的选择
夜雨聆风