2026年7月16日凌晨,Kimi官方推特账号发出了一条推文。
2.8万亿参数、100万上下文、原生多模态。 半天之内,海内外AI社区的时间线全被K3占满了。所有人都在拆解同一个问题:这家来自北京的公司,什么时候悄悄变得这么强了?
参数、架构、榜单,所有人都在分析K3的技术规格。但有一个人刷到这条消息时,脑子里浮现的画面跟别人完全不同。
他想起了两年前北京的一间会议室。
那页PPT上就一行字
Max For AI是一位长期关注中国AI领域的海外博主。K3发布当天,他没有去拆benchmark,而是写下了一段两年前的回忆。
"这两张照片是2024年 @Kimi_Moonshot 邀请我去北京他们办公室时我随手拍的。当时他们内部邀请了一些朋友去参观他们当时最新的 K0-Math模型。"
2024年的某一天,月之暗面邀请了一批圈内朋友参观他们当时最新的K0-Math模型。让Max没想到的是,站在会议室里亲自做分享的人,竟然是创始人杨植麟。
杨植麟把产品和商业化的部分全跳过了。他打开PPT,讲的是“下一代Scaling Law”。
而那页PPT上,几乎就写了一行字,
Next-Token Prediction → Reinforcement Learning Scaling
翻译成大白话:"猜下一个词"的时代快走到头了,强化学习要教模型学会真正地思考。
2024年,这听起来像一个大胆的判断。到了2026年,OpenAI、DeepSeek、Anthropic,几乎所有前沿实验室都已经走上了这条路。一个人两年前的判断,变成了一整个行业的共识。



▲ Max For AI发布的回忆长文,底部两张照片拍摄于2024年杨植麟讲解“新的Scaling Law”的现场
K0-Math:最早射出的那颗子弹
那张PPT后面,跟着的是实际行动。
2024年11月,月之暗面正式发布了K0-Math,一个专攻数学推理的模型。它的工作方式和传统聊天AI截然不同:用强化学习和思维链(chain-of-thought,简称CoT)让AI像考生一样先列草稿、验算、发现错误后回头纠正,最后才交出答案。
官方数据显示,K0-Math在中考、高考、考研等考试类数学题上超过了OpenAI的o1-mini和o1-preview。竞赛级难题上还有差距,AIME成绩大约是o1-mini最高分的83%,但追赶速度肉眼可见。
有个冷笑话式的bug暴露了早期产品的稚嫩:你问它1+1等于几,它也要先"深度反思"半天才给你答案。简单题上的过度思考,成了社区经典吐槽素材。
同一时间窗口里,DeepSeek推出了R1-Lite-Preview,阿里推出了Marco-o1。推理模型的军备竞赛,在2024年末正式打响。
杨植麟在同期接受36Kr采访时给出了一个清晰的路线图:长文本是通向moonshot的**"第一步",数学推理是"第二步"**。强化学习改变了模型的学习方式,数据由模型自身生成,需要判断思考对错,这使得AI的进化可以在训练数据见底之后继续推进。
那时候他已经在想第三步了。

▲ 2024年11月,杨植麟在公开场合展示K0-Math
从嘴上说到纸上写
喊判断容易,把判断落成可引用的工程方法论,得真刀真枪地干。
2025年1月,Kimi团队在arXiv上发表了k1.5技术报告:Scaling Reinforcement Learning with LLMs(用大语言模型扩展强化学习)。报告的立场直截了当,预训练靠静态数据驱动已经撞到天花板,扩展强化学习才是新的增长轴。
技术路线走得很干净:拉长上下文中的思维轨迹、改进策略优化算法,放弃蒙特卡洛树搜索和价值网络等更复杂的组件。在AIME和MATH-500等基准上,k1.5给出了对标o1级别的成绩。
2026年3月,又一篇论文Attention Residuals公开。它瞄准的是一个明确的工程问题:深层神经网络中,标准残差连接会让早期层的贡献越来越被稀释。AttnRes用可学习的深度注意力来选择性聚合不同层的表示,论文声称以不到2%的额外计算成本换来约25%的训练效率提升。
这两篇论文,加上Muon优化器和Mooncake推理架构等公开工作,拼出了K3底层技术栈的完整地基。两年前PPT上的一个箭头,到这时候已经长成了一棵有论文、有代码、有基准数字的技术树。

▲ k1.5技术报告,RL scaling方法论的学术锚点
K3交卷:2.8万亿参数的答案
2026年7月16日,两年的积累汇聚成了一张产品发布帖。
Kimi K3的规格表堪称暴力:总参数约2.8万亿,采用稀疏MoE架构,896个专家中每次只激活16个,用极高的稀疏度换取了惊人的模型容量;原生支持约100万token上下文;视觉能力内置,思考模式默认开启。
两个招牌架构组件在产品层全面兑现:Kimi Delta Attention(KDA) 在百万级上下文解码场景中实现最高约6.3倍加速;Attention Residuals把论文里的理论增益直接落进了生产环境。官方宣称相对上一代K2,整体scaling效率提升约2.5倍。
在编程(DeepSWE、Terminal Bench)、Agent(Automation Bench)、知识工作(SpreadsheetBench)等评测维度上,K3和Claude Fable 5、GPT-5.6 Sol等顶级闭源系统同场竞技。官方博客坦诚承认整体仍有差距,但在多数对比维度上已经展现出实打实的竞争力。产品端覆盖了kimi.com、Kimi Work、Kimi Code和API,权重承诺在7月27日前开源。
博主Michael Guo翻出三个月前杨植麟的一场GTC演讲做了对照,当时杨植麟说下一阶段scaling有三个维度:token效率、上下文长度、Agent数量。K3的产品形态,几乎逐条对应了那场演讲的核心论点。
"Open models cannot be just open. They also have to be great."
“开源模型不能只是开源,还必须足够出色。”
这句话在K3发布后被反复引用。当2.8万亿参数的权重真的摆到桌面上时,它才有了分量。


▲ K3官方发布帖与多维度benchmark对比,编程、Agent、知识工作均有覆盖
"像实验室里的PhD"
K3刷屏之后,Max写了一段让人印象深刻的人物细节。
2024年那次参观中,他注意到一个有意思的反差:聊到商业和融资的时候,杨植麟很平静。但话题一转到架构和训练方法,"整个人一下子就兴奋起来了,眼睛都是亮的,能一直不停地讲。"
参观办公区的时候,Max特意去看了杨植麟的工位。连独立办公室都找不到,估值百亿美金CEO该有的排场一点也看不见,一个普通到不能再普通的位置,桌上放着些日常用品,和周围同事没什么区别。
那个画面,Max说他记到现在。
Kimi有时候慢,有时候让外界看不懂,但它一直在啃最难的技术问题,长上下文、数学推理、长程Agent,这条线从头到尾没有断过。Max的原话是:很多公司是在追下一波浪潮,杨植麟更像是很早就选了一条路,然后一直往下挖。
有网友在他帖子下面留了一句冷静的话:"K3权重开源后,能力会很快被各家推理服务和Agent产品吸收。Kimi能留下多少价值,取决于Kimi Code和Work能不能把用户留住。"
说得很准。杨植麟押中了训练路线的方向,但产品闭环的能力还得另外证明。最强的底座,也可能帮别人养大生态。
但至少有一件事,那张PPT已经给出了答案。
2024年,杨植麟在PPT上画了一个箭头。2026年,这个箭头变成了2.8万亿参数的现实。
夜雨聆风