乐于分享
好东西不私藏

从聊天工具到AI入口:微信“小微”灰度内测中

从聊天工具到AI入口:微信“小微”灰度内测中
这几天微信AI入口在灰度,值得大家关注一下,今天我们就来聊聊这块

一、14亿人即将用上AI

6月20日,微信原生AI助手"小微"开启小范围灰度内测。用户右滑一下就能唤出,说"帮我点一杯瑞幸"或"帮我转账给张三",小微自动调瑞幸小程序下单、调微信支付完成转账。
这不是又一个AI聊天机器人,微信做了一件别人做不到的事,把小程序从独立应用变成了AI可调用的"技能"。过去你点外卖,要打开美团小程序、搜索、选餐、下单、支付。现在你说一句话,AI把整个流程替你走完。
主模型是微信自研的WeLM,部分回答会调用DeepSeek。月活14亿的用户基础,右滑入口零门槛,百万级小程序的Skill生态
过去2年所有人都在讨论"AI怎么普及",要不要全民培训?要不要买新设备?怎么学提示词?微信现在给出的回答是:不需要。你每天打开的App里就有AI,你右滑一下它就出来了,你说一句话它就帮你做了。
当14亿人右滑就能用AI,相当于AI能力变成了个人默认能力。就像20年前"会用电脑"是稀缺技能,现在它是默认前提。当所有人都会用AI的时候,你的竞争优势不在于"会不会用",而在于"会不会判断AI做的东西对不对"。
小程序开发者应该是受益者,相当于多了一个入口。同时降低了开发适配难度,开发者的范式正在被根本性重塑。

二、微软偷偷把中国模型塞进了企业级产品

6月17日,微软被曝计划在Copilot Cowork中引入DeepSeek V4微调版作为分层备选模型。
方案是这样的:日常80%的简单任务自动调度DeepSeek(MoE架构算力开销远低于海外旗舰模型),只有20%的高难度推理才启用高端闭源模型。微软会搭建智能分层路由系统,配套完整的质量校验机制。
Copilot Cowork覆盖了超半数财富500强企业。但这些企业用AI Agent做复杂任务的时候,每次调用的Token消耗是传统聊天的10-50倍。固定订阅制根本覆盖不了这个成本。微软的算账结果是:80%的钱花在了日常任务上,而这些任务用DeepSeek就够了。
微软这次不是在"选更好的模型",是在"选更便宜的模型"。
80%这个数字值得停下来想一想。如果你所在的公司在用AI工具,大概率你花的钱里有80%是冤枉钱。日常写邮件、整理表格、生成周报这些事,用最贵的旗舰模型去做,就像用高铁送外卖,快是快了,但成本是打车送的三五十倍,真的有这个必要吗?
微软的做法提供了一个范式:标杆模型引流+国产模型降本。不是不用贵的模型,是只在需要的时候才用贵的模型。这个逻辑一旦被更多企业接受,会直接影响AI工具的采购决策。

三、Codex上线录制回放,演示一遍,AI自动学会

6月22日,OpenAI更新macOS端Codex,上线Record & Replay功能。
不是简单录屏,而是演示一遍完整操作流程:比如批量处理素材、整理表格、网页抓取、Codex自动抓取文件路径、操作逻辑和校验标准,把它转化成可无限复用的自动化技能。跨文件、跨网页的复杂工作流都能稳定复刻,录制好的技能还可以在远程主机持续运行。
过去2年,"提示词工程"是AI领域最火的技能之一。怎么写prompt让AI输出更好、怎么设计指令让Agent更听话,培训课、付费专栏、社群分享,包括skill也是如此。
Codex Record & Replay的逻辑完全相反:你不需要写任何文字,你只需要做一遍给AI看。
从"文字描述需求"到"行动演示需求",是一个范式级的切换。过去你必须学会用自然语言精确描述你想要什么,这对很多人来说是门槛。现在你只需要做一遍,直接零门槛。
HR演示一遍"整理简历表格",Codex自动学会,以后每次新简历自动整理。程序员提交"重构这个模块",Cloud Agent在云端异步运行数小时。
当AI能"看你做一遍就学会"的时候,你花时间学的提示词技巧,各种搜罗的skill 可能就贬值了。真正稀缺的不是"怎么让AI听懂你的话",而是"能不能定义清晰的工作流程"

四、Dropbox每12个PR有1个来自AI

6月22日,Dropbox正式公开其内部AI编程智能体平台Nova。
Nova将AI深度集成于企业CI/CD流水线,强调闭环验证
AI生成的代码必须通过与人工代码完全相同的测试和安全审查流程。目前Dropbox每12个Pull Request中就有1个由AI Agent生成。
8%的代码由AI生成,意味着每周几十个PR从AI Agent出来。但关键不在比例,而在于这些PR走的是100%人类审批流程。
前面我们聊过腾讯研究院的报告:45%的AI代码含已知漏洞,技术债务增30-41%。那期文章的结论是"能写不稀缺,会验证才稀缺"。
Dropbox Nova就是"会验证"的企业级答案。它做的事情很明确:AI写的代码和人写的代码走完全一样的流程,一样的代码审查、一样的安全扫描、一样的测试覆盖,没有人因为一个PR来自AI就降低审批标准。
大部分公司的问题是:AI代码要么不走审批,直接上线(裸奔);要么走更宽松的审批(双标),人类代码过五关斩六将,AI代码走VIP通道,两种做法都不安全。裸奔的风险不用说了,双标更危险,因为你给AI开了特权通道,恰恰是AI最容易出错的地方。
Dropbox的做法叫"零双标",听起来简单,做起来不容易。你得把AI Agent完全嵌进现有的CI/CD流水线里,让它的输出格式、测试流程、安全扫描和人类代码完全对齐。这不是"加一个AI工具"那么简单,是"重构整个工程流程"。
但这件事的价值在于:它证明了AI代码可以被管好。45%漏洞不是AI代码的宿命,是没有管好AI代码的宿命。谁能帮公司建立这套"零双标"的AI代码管理体系,谁就是下一个高需求岗位。

五、全球AI调用量中国包揽前四

据OpenRouter最新数据,上周全球AI大模型总调用量达46.7万亿Token,环比增长4.7%,连续九周上涨。中国AI大模型周调用量18.81万亿Token,连续八周超过美国并稳居全球首位。
全球调用量前四全是中国模型:DeepSeek-V4-Flash(4.94万亿)、小米MiMo-V2.5(3.94万亿)、MiniMax M3(3.77万亿)、腾讯Hy3 preview(3.63万亿)。DeepSeek旗下模型周调用总量8.65万亿Token,占全球18.5%。
过去2年所有人都在讨论"中国AI跑分不如美国"。SWE-bench、Arena、各种榜单上美国模型确实领先。跑分这个游戏,美国确实在赢。
但跑分和跑量是两个完全不同的游戏。
跑分是"谁最强",跑量是"谁被用得最多"。
打个不太精确的比方:跑分就像考试分数,考100分的人确实聪明,但如果只有10个人找他做事,而考90分的人有1000个人找他做事,谁更"成功"?
AI竞争的真实战场不仅仅是"谁考分最高",还要是"谁被用得最多"。因为"被用得最多"意味着工程化能力、性价比、真实场景适配、开发者生态,这些都是跑分无法衡量的。
更值得注意的是,同一周微软宣布Copilot Cowork接入DeepSeek V4。"跑量冠军"正在被"美国大厂采购"。从跑量领先到进入主流企业级市场,中国AI的三级跳——跑分→跑量→被采购——已经完成了。
选AI工具的逻辑变了。不要只看跑分排行榜,也要看调用量排行榜。一个被全球用得最多的模型,比一个跑分最高但随时可能被封的模型更安全。

最后

AI 正在完成从"能力竞赛"到"普及竞赛"的跨越。
当AI替你干的时候,你需要学会判断它做的东西对不对。 当AI人人可用的时候,"会用AI"不再是你的竞争优势。 当AI用得起的时候,80%的钱是冤枉钱,学会分层使用是理性决策。 当AI需要管的时候,"零双标"的管理体系是下一个高需求岗位。 当跑量时代中国赢的时候,选工具看调用量不看跑分。
AI 能力的普及速度远超预期,就像我前面写过一篇回老家感受到AI普及的震撼。不是5年后,是现在。微信已经把AI塞进了14亿人的口袋里,微软已经用中国模型给全球企业降本了,Codex已经让你不用学提示词了。
AI 给人类带来巨大的效率提升和便利的同时,我们人类也该思考一个问题:当 AI 完全替你干活,而且人人用得起之后,你的价值在哪里?