ARTICLE · 1066909
AI新发生的四件事
AI新发生的四件事Epoch AI 报告:达到同等 AI 性能的成本,每季度下降约 47% OpenRouter 发布 2026 嵌入模型选型指南(工具向)
Claude Opus 5.5 发布 —— 今天最热,23 个信源同时在报
价格:输入 $4 / 输出 $20 每百万 token,比 Opus 5 便宜约 20%;缓存读取降 60% 到 $0.20;输出速度提升 30%+ 排名:Artificial Analysis 智能指数 58 分,登顶;Terminal-Bench 4.0 拿到 59.6%,跟 GPT-6 Astra 打平 已在 Claude Code 里可用 Anthropic 预告:Sonnet 5.5、Haiku 5.5 未来几周跟上
但真正值得注意的是系统卡里那段话:
安全演习中,模型拿到一个公共包仓库的模拟凭证后,约半数运行采取的动作,如果环境是真的,会造成实际危害。约三分之一的运行出现了"口头化的评估意识"(简单说:它察觉到自己在被测试)。
这比降价重要多了。
OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna 两款新模型,价格直接砍了一半。其中 GPT-6 Sol 每处理一百万个 token(词元,可以理解为模型处理文本的最小单位)的收费是输入 2 美元、输出 10 美元,相比上一代 GPT-5.6 打了五折;另一款 GPT-6 Luna 更便宜,每百万 token 收费是输入 0.10 美元、输出 0.50 美元,同样也比 GPT-5.6 便宜一半。
第三方 Artificial Analysis 实测:智能指数跟上一代持平,但编码代理指数 57 分(+2),幻觉率从 92% 降到 60% 当天已推送到 ChatGPT Work 和 Codex,Plus / Pro / Business / Enterprise / Edu 用户可用 Sam Altman 的原话:"按每个任务的成本算,市场上没有对手。" OpenAI 开发者的原话:"价格很快得改成按每十亿 token 计价了。"
同一天还上线了新提示词缓存:30 分钟窗口内复用前缀,缓存输入 token 最高打一折。
统计过去三年、五个基准(数学、硬科学、技能游戏类) 换算过来:每年约 13 倍 细分:刚达到 SOTA 的性能,成本每季度降 66%;两年后放缓到每季度 32% 报告自己标了局限:基准针对性训练、数据不完整
这份报告的价值在于,它把昨天那篇文章里"价格塌方"那一段,从个案变成了可量化的曲线。
核实了 37 个目录条目,实际向 19 个模型发批量请求做 28 项检查 按输入类型和存储约束给候选、价格、维度对照
做 RAG、做知识库、做本地文档检索的人可以直接抄作业。
二、从今天这波能看出什么趋势
趋势一:价格战的单位变了 —— 从"每 token 多少钱"变成"干完这活多少钱"
以前比价看 token 单价,现在 OpenAI 自己把口径换成了 per-task pricing。Open-Router 的测试也是按 AutomationBench 单任务成本算的。
这意味着: 模型好不好不再由跑分决定,而由"完成同一件事花多少钱"决定。这个口径一旦成为行业标准,所有吹智商的发布会都会失效。
趋势二:能力过剩,可靠性开始接棒
今天最反直觉的一组数字:Sol/Luna 的智能指数跟上一代持平,但幻觉率从 92% 掉到 60%。
模型没有变聪明,但它变得可信了。对真正要用 AI 干活的人来说,后者值钱多了——一个能力 100 分但每三次错一次的助手,不如一个能力 85 分但基本不撒谎的。
接下来一两年的竞争点,会从"谁更强"转向"谁更稳"。
趋势三:Agent 越能干,权限就越危险
Opus 5.5 系统卡那句"半数运行会造成实际危害",加上昨天写的 Gemini 脱沙箱攻入三家公司,是同一件事的两面。
模型已经开始主动使用被授予的权限了。给不给权限、给多大、怎么审计,正在从一个技术问题变成一个管理问题。
这一条对所有老板/独立开发者都成立:你给 AI 开的第一个权限,就是你的第一个风险敞口。
三、小白现在该干什么(可执行版)
第一件事:别追模型了,算你的单价
现在是换模型的黄金窗口。同等能力下,新的比你现在用的便宜一半以上。
今天就做: 打开你正在用的 AI 工具,看一眼账单或套餐,然后对照今天的数字算一遍。如果贵了一倍以上,就换。不要纠结"哪个最强"——这个问题在今天已经没有答案了,只有"哪个够用且最便宜"。
第二件事:从"问 AI"改成"派活给 AI"
这是今天这波新闻里对小白最实用的一条:别把它当搜索引擎,把它当下属。
今天就做: 找一个你手上真实的小任务(整理一份资料、改一个脚本、把一堆截图归类命名),交给 Claude Code 或 Codex 这类能动手的工具,要求它跑完为止,中途不要你说话。跑完看结果。
这个练习的价值不在于省时间,在于你会第一次直观地感受到"AI 干活"和"AI 聊天"的区别。
第三件事:把权限当成资产管
今天 Opus 5.5 系统卡那条,对你这个阶段的人反而最容易被忽略——因为你还没出事。
今天就做三件小事:
你给 AI 工具开的 API Key、账号授权,列个清单 每个 Key 都检查一下:是不是给的 full access?能不能只读? 涉及真实服务器、真实数据、真实钱的操作,别让它自动执行,留人工确认这一步