ARTICLE · 1146695
2026年10月9日AI日报 | 大模型再迎密集更新,Claude成本战与Mistral万亿参数成焦点

Anthropic 发布 Claude Haiku 5.5,面向摘要、分类、实时客服、浏览器操作和编程子智能体等高吞吐、低延迟任务,支持可调 effort、自适应思考和超长上下文。
支持 100 万 token 上下文和最高 12.8 万 token 输出 10 万 token 内输入、输出价格分别为每百万 token 0.10 美元和 0.50 美元 官方估算平均运行成本较 Haiku 4.5 降低约 75%,现已登陆 Claude Platform、AWS、Google Cloud 和 Azure
2、谷歌 SynthID Detector 面向全球开放,支持检测多家厂商 AI 水印
谷歌宣布 SynthID Detector 面向全球用户开放,用户可上传图片、视频或音频文件,检测其中是否包含谷歌及合作厂商添加的 AI 生成内容隐形水印。
支持检测谷歌、OpenAI、英伟达、Kakao 等厂商的 SynthID 水印 自 2023 年以来已为超过 1800 亿张图片和视频、24 万年音频添加水印 Search、Gemini 和 Chrome 中的相关验证功能每天处理超过 100 万次请求
3、Claude Code 团队成员推出 html-plan skill,开放社区试用
Claude Code 团队成员 Thariq 推出 html-plan skill,用于生成更清晰的 HTML 计划页面,集中展示方案、代码片段、待确认问题和 mockup。
支持调用栈展示、代码片段标注、图表和流程图优化 已通过 Claude 社区插件市场开放安装 目前主要用于收集用户反馈,后续计划探索替代默认计划模式
4、Claude SDK 内置 computer use 与 browser use 工具集
Anthropic 将 computer use 和 browser use 工具集正式内置到 Claude 的 Python 和 TypeScript SDK,降低开发者接入浏览器与桌面操作能力的门槛。
SDK 可直接运行交互循环,并把点击、输入等动作发送给驱动 API 会返回 Claude 计划执行的点击和输入操作 支持 browser_use、Browserbase、E2B、Daytona 等兼容驱动
5、GitHub Copilot 开放本地沙箱,混合推理计划月底预览
GitHub Copilot 正式开放本地沙箱能力,可限制命令执行时对文件、网络和凭据的访问,同时开始支持本地 Ollama 模型和本地、云端混合推理。
本地沙箱已覆盖 CLI、Copilot 应用和 VS Code CLI 1.0.94-0 起可通过 /model 发现本机已安装的 Ollama 模型 HydraFusion 混合推理计划于 10 月晚些时候开启实验预览
6、Liquid AI 开源 d1-3B 和 d1-omni-600M 决策模型
Liquid AI 开源 d1 决策模型家族中的 d1-3B 和 d1-omni-600M,两款模型均面向低延迟、边缘设备和多模态决策场景。
d1-3B 支持文本和图像输入,RTX 4090 单问题延迟约 8 毫秒 d1-omni-600M 支持文本加图像或文本加语音输入 两款模型权重已在 Hugging Face 开放,并支持 llama.cpp
7、Perplexity 发布 pplx-embed-v2-late 多模态嵌入模型
Perplexity 发布 pplx-embed-v2-late 系列,包含 0.6B 和 9B 两个版本,可在统一嵌入空间中检索文本、图像和视觉文档。
两款模型均基于 Qwen3.5 构建,每个 token 输出 128 维向量 支持 PDF、幻灯片和扫描件直接检索,无需 OCR 0.6B 与 9B 共享嵌入空间,可用小模型查询大模型建立的索引
8、生数科技发布 Vidu Q4 Preview,同等预算最高可多生成 5 倍视频
生数科技旗下 Vidu 发布新一代旗舰视频模型 Q4 Preview,重点提升角色表现、镜头衔接和视觉特效能力,现已通过网页端和 API 开放。
最多支持 15 张图像参考和 3 段音频参考 输出覆盖 540p 至 4K,2K 和 4K 支持 10-bit 色深 上线促销价最低 0.014 美元/秒,官方称同等预算最高可产出 5 倍视频量
9、Mistral Large 4 上线,1.05T 参数模型月底开放权重
Mistral AI 发布旗舰模型 Mistral Large 4 公开预览版,昵称 Le Chonk,采用原生多模态 MoE 架构,目前已通过 API 向所有用户开放。
总参数约 1.05T,每个 token 激活 49B 参数 原生支持 160 多种语言,并强化编码、网络安全和视觉定位能力 开源权重计划于 10 月底上线,Hugging Face 页面预计 10 月 31 日开放
10、Google 发布 Nano Banana 2.1,图像生成与编辑能力升级
Google 发布 Nano Banana 2.1 图像生成与对话式编辑模型,现已在 Gemini API 上线,并陆续接入 Gemini、AI Mode、AI Studio 和 Flow 等产品。
支持 1K、2K、4K 三档输出分辨率和最多 14 张参考图融合 强化视觉质量、提示词遵循、多轮角色一致性和文本渲染 支持 Google 搜索 grounding 和可配置 Thinking 档位
11、谷歌开源 EmbeddingGemma 2,多模态能力扩展到设备端
谷歌 DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频统一映射到同一嵌入空间,重点面向设备端轻量化部署。
总参数量 7.4 亿,纯文本任务仅需加载约 2.7 亿参数 支持 8192 token 上下文,单次可处理约 5.5 分钟音频或 29 张图像 采用 Apache 2.0 许可,权重已在 Hugging Face 和 Kaggle 开放
12、ChatGPT 推出 Meetings 插件,可自动生成会议笔记和后续事项
ChatGPT 上线测试版 Meetings 插件,可在会议过程中自动记录笔记,并结合用户既往协作内容生成个性化摘要和后续步骤。
会议笔记和摘要可保存到 ChatGPT Space,并支持私密或团队共享 会后可继续让 ChatGPT 更新项目计划或起草跟进内容 目前面向 Pro 和 Business 用户,在 macOS 版 ChatGPT 桌面应用中使用
声明:本内容由AI生成,可能包含不准确或推测性信息,请读者自行甄别并谨慎参考。
欢迎点赞收藏

