乐于分享
好东西不私藏

我刷了几轮 AI 热榜,发现大家其实都在问同一件事

我刷了几轮 AI 热榜,发现大家其实都在问同一件事

我刷了几轮 AI 热榜,发现大家其实都在问同一件事

封面图

今天我想换个写法。

不是单独测一个中转站,也不是只讲 Codex 或 Claude Code。

我把最近能查到的 AI 热点、技术社区文章、B站/知乎/公众号/行业媒体里反复出现的关键词,按同一套口径过了一遍。关键词很集中:

Codex
Claude Code
智能体
中转站
token 成本
多 Agent
国产模型
工具选型

微博、小红书、公众号排行榜这类实时榜单变化太快,我不假装拿到了一个永远准确的“全网排名”。这篇更像一份热榜雷达:把跨平台重复出现、最近热度高、又和我们读者强相关的 10 个话题捞出来,重新拆成一篇能直接看懂的趋势稿。

结论先说:

AI 工具的热度,正在从“哪个模型更强”,转向“谁能把任务稳定做完、成本别爆、出了事能兜住”。

这就是现在的主线。

热点 1:Codex 突然从程序员工具,变成了知识工作工具

Codex 爆发

最近 Codex 的热度非常明显。

OpenAI 自己披露过一个数字:Codex 周活已经超过 500 万,而且从 2 月桌面应用发布后增长了 6 倍以上;更有意思的是,知识工作者已经占到大约 20%。

这说明一件事:Codex 不再只是“帮程序员写代码”。

它开始进入更普通的工作流:

整理文档
处理表格
写内部工具
改网站文案
生成小自动化脚本
把业务需求变成可运行原型

我觉得这是一个拐点。

以前大家聊 Codex,会问它能不能写好代码。现在更关键的问题是:它能不能把一个办公室里的小任务推进到可交付?

这也是为什么 Codex 最近适合写进公众号选题。它不是单点能力升级,而是用户范围变了。

热点 2:Claude Code 的热度,来自“长期使用时长”

Claude Code

Claude Code 这边,热度不是靠一个新按钮。

Anthropic 最近的研究里提到,Claude Code 用户平均每周使用大约 20 小时;另外,GitHub 项目里出现 coding agent 活动的比例,也从 2025 年底以来翻了一倍多。

这个信号很实在。

一个工具如果只是好玩,大家会试一下。

但如果用户每周能泡 20 小时,那它已经进入工作习惯了。

Claude Code 最适合的,不是三分钟生成一个函数,而是这些事:

读一个老项目
解释复杂模块
拆一个重构计划
修一个连续失败的测试
帮你审查 AI 自己写出来的代码

说白了,Codex 更像“执行推进器”,Claude Code 更像“深度结对程序员”。这不是绝对划分,但对选型很有帮助。

热点 3:多智能体不是概念,开始变成工具层

多智能体

这一轮热榜里,我看到很多内容都在讲 subagents、多智能体、Agent SDK、Managed Agents。

这背后有个变化:以前我们让一个 AI 从头干到尾。

现在开始分工了。

一个 Agent 读需求
一个 Agent 写代码
一个 Agent 跑测试
一个 Agent 做安全审查
一个 Agent 写文档

Claude Code 已经有 subagents 和 Agent SDK;Anthropic 的 Managed Agents 也在 beta 里;OpenAI 这边 Codex 也在往更通用的工作代理发展。

这类工具热起来,不是因为大家喜欢复杂架构。

而是一个 AI 干所有事,太容易失控。

分工以后,你至少能知道:谁在写代码,谁在检查,谁负责最后解释。

热点 4:token 成本开始变成“老板也看得懂”的问题

Token 成本

以前 token 成本是开发者才关心的事。

现在不是了。

Agent 一旦开始自动跑任务,token 就会像水龙头一样流出去。普通聊天可能是一问一答,Agent 任务是一串动作:

读文件
列计划
改代码
跑测试
读日志
继续修
再跑测试
写总结

这就是为什么“AI coding cost”最近在海外内容里也很热。有些测算会提到,一次复杂 Agent 任务可能累计吃掉几十万到几百万 input token。

我不建议大家死记某个数字。

你只要记住一句话:Agent 成本不是按问题算,是按回合数和上下文膨胀算。

所以中转站、缓存、模型分层、低价模型铺底,才会越来越重要。

热点 5:中转站讨论从“能不能用”,变成“敢不敢长期用”

中转站

中转站这个话题,在国内开发者圈一直有热度。

但现在讨论重点变了。

早期大家问:

能不能调通?
便不便宜?
支不支持微信支付宝?

现在大家更关心:

会不会跑路?
会不会降智?
有没有请求日志?
模型名是不是透明?
高峰期稳定不稳定?
余额会不会过期?

这说明用户成熟了。

以前是找入口。

现在是找可信入口。

我的建议还是那句老话:中转站可以用,但不要大额充值,不要把隐私数据和核心商业机密直接丢进去。低风险任务走中转,关键任务保留官方或更可信备用通道。

热点 6:国产模型正在承担“低成本铺底”的角色

国产模型

最近关于 DeepSeek、Qwen、GLM、Kimi 这类国产模型的讨论,也和 Codex / Claude Code 连起来了。

不是因为它们一定全面超过国外模型。

而是因为它们更适合接住一大批“量大、低风险、中文多”的任务。

比如:

摘要
分类
批量改写
日志整理
数据清洗
简单脚本
客服草稿
公众号素材初稿

如果你把所有任务都交给最贵模型,成本很快就会不好看。

更合理的做法是:

国产低价模型:铺底、筛选、整理
Codex / Claude Code:执行、审查、重构
人工:确认涉及钱、权限、隐私的动作

这才是现在更实用的模型搭配。

热点 7:Claude Tag 说明 Agent 正在进入团队协作入口

团队 Agent

Anthropic 最近推出的 Claude Tag 也挺值得看。

它不是 Claude Code 的简单延伸,而是把 Claude 放进 Slack 工作流里。官方介绍里有个细节很抓人:Anthropic 内部已经把 @Claude 当成主要协作方式之一,产品团队相当一部分代码由内部版本的 Claude Tag 创建。

这意味着 Agent 不只在终端里。

它会进入团队频道。

你不一定打开 IDE,也可以在工作群里分配任务:

@Claude 看一下这个 bug
@Claude 追一下这个指标
@Claude 帮我整理支持工单
@Claude 找出这次回归的可能原因

这会带来新问题:权限、上下文、token、隐私、责任边界。

但方向很清楚。

Agent 正在从“个人工具”变成“团队成员”。

热点 8:AI 编程工具横评越来越多,但别被表格带跑

工具横评

知乎、CSDN、博客园、B站上,Claude Code vs Codex vs Cursor 的横评很多。

这些内容有价值。

但我建议你看横评时别只看总分。

你要看它测的是什么任务:

是补全,还是 Agent?
是小函数,还是老项目?
是单文件,还是多文件?
是只看结果,还是看过程可控?
是一次测试,还是连续几天?

很多横评最后会得出“某某更强”。

但真实工作不是这么用的。

我的分法更简单:

Codex:更适合推进明确工程任务
Claude Code:更适合理解、审查、重构和复杂上下文
Cursor:更适合长期待在 IDE 里的人
国产模型:更适合大量低成本中文任务

选工具,不要选冠军。

选你当前任务的短板补位。

热点 9:安全边界开始比能力更重要

安全边界

AI Agent 越强,安全边界越重要。

因为它不是只会说话。

它会:

读你的文件
改你的代码
执行命令
调用 API
访问数据库
把结果发到外部系统

这也是为什么很多官方文档都开始强调权限、MCP、安全控制、日志和回滚。

我现在的判断是:2026 年下半年的 AI 工具热点,会从“谁更聪明”,逐渐转向“谁更可控”。

可控包括:

能不能限制它访问哪些目录
能不能审查它要执行的命令
能不能记录它做过什么
能不能失败后回滚
能不能把敏感数据隔离

这类话题不会像“新模型发布”那么吸睛。

但它决定企业敢不敢用。

热点 10:公众号选题本身,也该从“资讯搬运”升级成“工作流”

内容工作流

最后这个,是我自己的观察。

如果只是把热榜新闻改写一遍,读者很快就疲了。

现在真正有用的公众号内容,应该把热榜变成工作流:

看到热点
确认来源
拆出事实
写出判断
给出使用建议
标明风险边界
生成配图
推到草稿箱
人工审核发布

这篇就是按这个流程做的。

我不想告诉你“今天全网第几名是什么”,因为热榜一刷新就变。

我更想告诉你:为什么这些热点会一起出现。

它们都在指向一个方向:AI 正在从“聊天工具”,变成“可调度的工作系统”。

写在最后

如果把今天这 10 个热点压成一句话,我会这么写:

AI Agent 的比赛,已经从模型参数,转向任务交付。

Codex 热,是因为它开始进入知识工作。

Claude Code 热,是因为它真的被开发者长时间使用。

中转站热,是因为成本和访问问题绕不开。

国产模型热,是因为低成本铺底太有用。

token 成本热,是因为 Agent 会把账单放大。

多智能体热,是因为一个 AI 干到底太容易失控。

安全边界热,是因为大家终于意识到:能自动执行的工具,必须先能被约束。

所以接下来别只问:

哪个模型最强?

更应该问:

我这件事能不能拆层?
哪层用便宜模型?
哪层必须用强模型?
哪一步需要人工点头?
出了问题能不能回滚?

这才是 AI 工具真正进入工作流以后,我们每天都会遇到的问题。

相关学习资料