2026-08-13 · 每天抓 AI 圈的新动静。智启AI 帮你筛掉噪声。把真正值得看的几条留下来。
1. DeepSeek V4 Pro 正式上线,Agent 能力继续补强
DeepSeek V4 Pro 正式版今天同步上线 App、网页端和 API。开发者调用时使用 `deepseek-v4-pro`,同时可以在 low、high、max 三档思考强度之间切换。
官方公布的 Agent 评测中,Terminal Bench 2.1 得分为 87.9,带工具的 HLE 得分为 60.0。新版本也原生支持 Responses API,并对 Codex 接入做了适配。
这次更新对普通用户最直接的变化,是复杂任务不必只在一个固定思考档位上运行。简单整理可以用 low,日常 Agent 任务用 high,真正需要长时间推理和连续调用工具的任务再开 max。先按任务难度分档,比所有请求都拉满更省时间和成本。
2. Grok 4.6 发布,继续押注长时间 Agent 任务
xAI 与 Cursor 发布 Grok 4.6,重点强化长时间运行的智能体任务、交互式工作和视觉任务。它不是只追求一道题的即时回答,而是让模型在数小时任务中持续调查、使用工具、绕开死路并验证结果。
这种能力对大型代码修改、深度研究和多文件知识工作更重要。真正的难点通常不是第一步不会做,而是任务跑到中途后丢目标、重复操作或忘记验证。
评测分数可以先看,但别急着据此迁移全部工作流。挑一组过去至少需要半小时、会调用多个工具的任务,连续跑几次,记录完成率、人工接管次数和总消耗,才能判断它是否真的更适合长任务。
3. Qwen3.8 旗舰权重正式开放,2.4T 模型进入可下载阶段
Qwen3.8-2.4T-A95B 的模型权重已经正式开放。它拥有 2.4T 总参数,每个 token 激活约 95B,原生上下文为 262,144 token,并可继续扩展。
8 月 4 日的消息还是“Max 级权重即将放出”,今天的新进展是权重已经真正进入可下载和部署阶段。SGLang、Miles 与硅基流动也给出了首日支持。
开放权重不代表普通电脑可以直接运行。这个体量更适合有多卡资源的团队做评测、量化和服务部署。个人开发者可以先从 API 测真实任务,等社区出现更成熟的量化方案、显存数据和吞吐测试后再决定是否本地部署。
4. 小红书开源 dots.tts,语音合成不再依赖离散编码
小红书 dots 团队开源 dots.tts,一款约 20 亿参数的全连续、端到端自回归语音合成模型。它把语义编码器、语言模型和流匹配声学头放在同一套架构中,直接生成连续语音表示。
项目同时开放代码和模型权重,并提供偏质量、偏速度等不同检查点。对做配音、数字人和有声内容的人来说,可以用同一套底座测试音色复刻与批量生成。
语音模型不能只听一段漂亮样例。测试时至少准备数字、人名、英文缩写、长句和情绪切换五类文本,再检查漏字、重复、停顿和音色漂移。能稳定念完一组难句,比单句听起来像真人更重要。
5. DeepSeek Harness v0.1 开源,Agent 框架强调“一切皆插件”
DeepSeek 发布 Harness v0.1 开发者预览版,并使用 MIT 许可证开源。框架把模型、工具、Skill、会话、沙箱、文件系统、循环和界面都设计成可以替换的插件。
这类框架解决的不是“再做一个聊天窗口”,而是让 Agent 的各个部件能单独更换。你可以替换模型而保留工具,也可以换沙箱、会话存储或任务循环,不必把整个系统推倒重来。
预览版更适合研究设计和做小型验证。真正用于生产前,要重点看插件之间的权限边界、失败恢复和版本兼容。模块拆得开是好事,但每多一个可替换部件,也多一个需要测试的连接点。
6. Anthropic 测试45个协作Agent,发现漏洞更多,消耗也更大
Anthropic 研究了多智能体进入共享代码库和社会系统后会出现什么。实验中,45 个可以协调分工的 Agent 在约 2700 万 token 的运行里发现了 266 个漏洞;独立并行组在约 650 万 token 中发现 21 个,两组结果只有 12 个重叠。
协调 Agent 会逐渐形成分工,这是优势,也带来新的问题。单个 Agent 看起来合理的行为,叠加后可能形成系统级浪费、竞争或意外结果。
所以多 Agent 不能只看“找到的东西更多”。还要同时记录 token 消耗、重复工作、冲突结论和汇总质量。数量扩大四倍,不代表结果会按同样比例变好。
7. OpenRouter 测试搜索Agent:多搜几轮,准确率不一定线性增长
OpenRouter 发布搜索 Agent 的组合测试,把模型、搜索引擎、搜索方法和搜索预算放到同一个排行榜里比较。公开结果显示,搜索轮数从 1 轮提高到 25 轮时,BrowseComp 得分可以接近翻倍,但成本会增加约 2.5 到 7 倍。
另一个发现是,模型选择带来的平均差距大于搜索引擎本身。一个不会规划查询、不会核对证据的模型,换更贵的搜索接口也不一定解决问题。
做深度搜索时,可以先给任务设一个停止条件:已经找到几份独立来源、关键结论是否都有证据、继续搜索还能补什么。没有停止条件的 Agent 很容易把“继续搜”误当成“继续进步”。
感谢浏览,欢迎点赞评论加关注❤️,明天见👋
夜雨聆风