今天 AI 三强把牌摊开了。
8 月 12 到 13 日,DeepSeek 把压了快四个月的 V4 Pro 正式版推上线;马斯克的 Grok 4.6 紧跟发布;微软这边 MAI-Code-1.1-Flash 也刚进 GitHub Copilot 生产环境。没人约好,但撞到了同一个窗口。
三家不约而同把重心压到 Agent——不是"能聊天",是"能替你把活干完"。但细看,三家的算盘完全不一样。
先看牌面:三栏对比
| 产品 | |||
| 价格 | |||
| 入口 | deepseek-v4-pro |
价格这条线最有意思:一家预告涨,一家送额度变相降,一家直接腰斩再腰斩。后面细说。
DeepSeek:用"开源够便宜"换规模,但补贴要结束了
DeepSeek 这单的核心,是把"开放权重"和"够强够便宜"重新绑到一起。
V4 Pro 0813 结束了近四个月的预览期,正式 GA。1.6 万亿参数、100 万 token 上下文、单次最多吐 38.4 万 token——够你把整个代码库丢进去分析,也够跑长程 Agent。MIT 开源权重,可以自托管、可以商用。在 Artificial Analysis 的智能指数上,它现在是开放权重里第二强的,仅次于 Kimi K2.6。
价格还是它的强项,但有个细节很关键:缓存命中输入只要 $0.003625/百万 token,是未命中的约 1/120。这不是疏忽。Agent 每一轮都在重读同一个 repo、同一个系统提示、同一套工具 schema——把重复读取定价到近乎免费,一百轮的 Agent 循环才不再是预算黑洞。DeepSeek 很清楚地知道 Agent 工作负载长什么样。
但真正让开发者停下来的,是 DeepSeek 自己的公告:计划近期整体上调 API 定价,预计涨幅较大。
一个靠便宜起家的实验室,主动提前告诉你"便宜要结束了"。Hacker News 上半个帖子都是在做算术——那些四月刚从 GitHub Copilot 迁过来的人,在算接下来怎么办。
我的判断:DeepSeek 在 token 消耗量上已经排到仅次于 Anthropic。你不会在还在抢客户的时候预告涨价。折扣时代是获客,获客结束了。它在 Pro 上把输出价抬到 Flash 的三倍(2 元→6 元),已经是在分层收割。
DeepSeek 的算盘:用开源和性价比把人圈进来,然后开始收口。
Grok:不跟你比便宜,比谁能把活干完
Grok 4.6 走的是另一条路。
它还是 1.5 万亿参数,基于 Grok 4.5,但训练重心全压在长程运行的 Agent、复杂交互和视觉工作上。在 Artificial Analysis 的综合智能指数上拿到 61,和 GPT-5.6 Sol 持平。能连续做研究、分析信息、啃大型代码库,把一个模糊的产品想法直接变成能跑的应用。
但 Grok 真正想打的,是 Grok Bot。
它不是又一个聊天框。官方定义是"能替你完成真实工作的 AI 队友"——它们会登录你的工具,像你一样操作,然后把干完的活交还给你。目前还在早期测试,已经在 SpaceX 内部工程和营销团队里用。一条发布推文拿了 2290 万浏览。
这东西的本质,是一台"云端电脑里的同事"。马斯克赌的是:用户要的不是更聪明的对话,而是有人(哪怕是 AI)把多步骤的活真的跑完。
价格上 Grok 没走低价路线,$2/$6 跟其他前沿持平,但首周在 Grok Build 和 Cursor 里送 2 倍额度——这是抢人,不是让利。
入口也说明问题:直连 Cursor 和 Grok Build,把模型塞进开发者每天打开的编辑器里。Grok 的算盘,是用"工作成果"而不是"对话轮次"来定义价值。
微软:最不声张,但打法最系统
微软这一波看着最低调,其实布局最完整。
MAI-Thinking-1 是微软首个推理模型,350 亿激活参数,从零训练、零蒸馏,用的是企业级干净数据。盲测里独立评审更偏好它而不是 Sonnet 4.6,编码能力在 SWE Bench Pro 上追平 Opus 4.6。MAI-Code-1.1-Flash 则是 1380 亿总参、50 亿激活的 MoE,这次加了原生视觉——截图、草图、界面设计直接转代码。Token 流快 25%、省 25% token,成本直接砍到 1.0 的 1/4。
但微软真正的杀手锏不是单点模型,是闭环。
MAI-Code-1.1-Flash 直接进了 GitHub Copilot 生产环境,替换掉 10 周前才发布的 1.0(9 月 10 日 1.0 退役)。微软用 Copilot 的真实使用数据和反馈反哺训练:开发者在哪卡住,下一轮模型就补哪。官方的话很直白——"ship, learn, improve, repeat",这是 MAI 的爬山机器。
对企业,微软在 Foundry 上给了 Frontier Tuning:在你的合规边界内做强化学习,让 Agent 学你业务真实怎么运转,用你的专有数据、领域知识和工作流,形成一圈越用越精的闭环。
模型、分发(Copilot)、治理(Entra/Defender/Purview)、数据闭环,全攥在自己手里。微软的算盘,是把"企业用 AI"这件事从头到尾包圆,而不是在单模型擂台赛里抢名次。
同一个窗口,三种不同的赌法
把三家放一起看,很有意思。
它们都押 Agent,但赌的维度完全不同:
- DeepSeek 赌性价比
。开源、便宜、够强,先把人圈进来。代价是它已经开始收口——预告涨价、Pro 比 Flash 贵三倍。它赌的是"你进来就离不开"。 - Grok 赌执行力
。不卷价格,卷"能不能替你把活干完"。Grok Bot 登录你的工具、像人一样操作,这是把 Agent 从"助手"变成"同事"。它赌的是工作成果这个词。 - 微软赌闭环
。模型进生产环境,用你的数据训下一版;Foundry 给你合规边界内的自研强化学习。它赌的是企业不敢把核心流程交给别人的焦虑。
价格信号也分三路:DeepSeek 预告涨,Grok 送额度变相降,微软 MAI-Code-1.1-Flash 直接降到 1/4。同日上新,三家其实在抢同一批人——想把 Agent 真正用起来的人。
你该上哪一张?
别被"同日"冲昏头,按你的场景选:
- 做纯文本编码 Agent、批量任务、成本敏感流水线
→ 上 DeepSeek V4 Pro 0813。但赶紧在涨价前锁定用量,留 V4 Flash 当后手。它没有视觉、比 Grok 级慢,但性价比当前还是天花板。 - 想要一个帮你跑完多步骤任务的队友、已经在用 Cursor
→ 上 Grok 4.6 + Grok Bot。首周 2 倍额度先薅,体验一下"云端同事"是不是你要的。 - 企业、要合规、数据不能出边界、想让 Agent 学你自己的业务
→ 上微软 Foundry + MAI-Thinking-1 + Frontier Tuning。别只看单模型分数,看它整条链。
一句话收尾:DeepSeek 卖性价比(且在收缩),Grok 卖执行力,微软卖闭环。三张牌同一天摊开,你摸哪张,取决于你想让 AI 替你做什么。
夜雨聆风