夜雨聆风学习资料网

ARTICLE · 1146695

2026年10月9日AI日报 | 大模型再迎密集更新,Claude成本战与Mistral万亿参数成焦点

2026年10月9日AI日报 | 大模型再迎密集更新,Claude成本战与Mistral万亿参数成焦点
AI日报
2026.10.9日资讯速递

1、Anthropic 发布 Claude Haiku 5.5,平均运行成本降低约 75%

Anthropic 发布 Claude Haiku 5.5,面向摘要、分类、实时客服、浏览器操作和编程子智能体等高吞吐、低延迟任务,支持可调 effort、自适应思考和超长上下文。

  • 支持 100 万 token 上下文和最高 12.8 万 token 输出
  • 10 万 token 内输入、输出价格分别为每百万 token 0.10 美元和 0.50 美元
  • 官方估算平均运行成本较 Haiku 4.5 降低约 75%,现已登陆 Claude Platform、AWS、Google Cloud 和 Azure

2、谷歌 SynthID Detector 面向全球开放,支持检测多家厂商 AI 水印

谷歌宣布 SynthID Detector 面向全球用户开放,用户可上传图片、视频或音频文件,检测其中是否包含谷歌及合作厂商添加的 AI 生成内容隐形水印。

  • 支持检测谷歌、OpenAI、英伟达、Kakao 等厂商的 SynthID 水印
  • 自 2023 年以来已为超过 1800 亿张图片和视频、24 万年音频添加水印
  • Search、Gemini 和 Chrome 中的相关验证功能每天处理超过 100 万次请求

3、Claude Code 团队成员推出 html-plan skill,开放社区试用

Claude Code 团队成员 Thariq 推出 html-plan skill,用于生成更清晰的 HTML 计划页面,集中展示方案、代码片段、待确认问题和 mockup。

  • 支持调用栈展示、代码片段标注、图表和流程图优化
  • 已通过 Claude 社区插件市场开放安装
  • 目前主要用于收集用户反馈,后续计划探索替代默认计划模式

4、Claude SDK 内置 computer use 与 browser use 工具集

Anthropic 将 computer use 和 browser use 工具集正式内置到 Claude 的 Python 和 TypeScript SDK,降低开发者接入浏览器与桌面操作能力的门槛。

  • SDK 可直接运行交互循环,并把点击、输入等动作发送给驱动
  • API 会返回 Claude 计划执行的点击和输入操作
  • 支持 browser_use、Browserbase、E2B、Daytona 等兼容驱动

5、GitHub Copilot 开放本地沙箱,混合推理计划月底预览

GitHub Copilot 正式开放本地沙箱能力,可限制命令执行时对文件、网络和凭据的访问,同时开始支持本地 Ollama 模型和本地、云端混合推理。

  • 本地沙箱已覆盖 CLI、Copilot 应用和 VS Code
  • CLI 1.0.94-0 起可通过 /model 发现本机已安装的 Ollama 模型
  • HydraFusion 混合推理计划于 10 月晚些时候开启实验预览

6、Liquid AI 开源 d1-3B 和 d1-omni-600M 决策模型

Liquid AI 开源 d1 决策模型家族中的 d1-3B 和 d1-omni-600M,两款模型均面向低延迟、边缘设备和多模态决策场景。

  • d1-3B 支持文本和图像输入,RTX 4090 单问题延迟约 8 毫秒
  • d1-omni-600M 支持文本加图像或文本加语音输入
  • 两款模型权重已在 Hugging Face 开放,并支持 llama.cpp

7、Perplexity 发布 pplx-embed-v2-late 多模态嵌入模型

Perplexity 发布 pplx-embed-v2-late 系列,包含 0.6B 和 9B 两个版本,可在统一嵌入空间中检索文本、图像和视觉文档。

  • 两款模型均基于 Qwen3.5 构建,每个 token 输出 128 维向量
  • 支持 PDF、幻灯片和扫描件直接检索,无需 OCR
  • 0.6B 与 9B 共享嵌入空间,可用小模型查询大模型建立的索引

8、生数科技发布 Vidu Q4 Preview,同等预算最高可多生成 5 倍视频

生数科技旗下 Vidu 发布新一代旗舰视频模型 Q4 Preview,重点提升角色表现、镜头衔接和视觉特效能力,现已通过网页端和 API 开放。

  • 最多支持 15 张图像参考和 3 段音频参考
  • 输出覆盖 540p 至 4K,2K 和 4K 支持 10-bit 色深
  • 上线促销价最低 0.014 美元/秒,官方称同等预算最高可产出 5 倍视频量

9、Mistral Large 4 上线,1.05T 参数模型月底开放权重

Mistral AI 发布旗舰模型 Mistral Large 4 公开预览版,昵称 Le Chonk,采用原生多模态 MoE 架构,目前已通过 API 向所有用户开放。

  • 总参数约 1.05T,每个 token 激活 49B 参数
  • 原生支持 160 多种语言,并强化编码、网络安全和视觉定位能力
  • 开源权重计划于 10 月底上线,Hugging Face 页面预计 10 月 31 日开放

10、Google 发布 Nano Banana 2.1,图像生成与编辑能力升级

Google 发布 Nano Banana 2.1 图像生成与对话式编辑模型,现已在 Gemini API 上线,并陆续接入 Gemini、AI Mode、AI Studio 和 Flow 等产品。

  • 支持 1K、2K、4K 三档输出分辨率和最多 14 张参考图融合
  • 强化视觉质量、提示词遵循、多轮角色一致性和文本渲染
  • 支持 Google 搜索 grounding 和可配置 Thinking 档位

11、谷歌开源 EmbeddingGemma 2,多模态能力扩展到设备端

谷歌 DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频统一映射到同一嵌入空间,重点面向设备端轻量化部署。

  • 总参数量 7.4 亿,纯文本任务仅需加载约 2.7 亿参数
  • 支持 8192 token 上下文,单次可处理约 5.5 分钟音频或 29 张图像
  • 采用 Apache 2.0 许可,权重已在 Hugging Face 和 Kaggle 开放

12、ChatGPT 推出 Meetings 插件,可自动生成会议笔记和后续事项

ChatGPT 上线测试版 Meetings 插件,可在会议过程中自动记录笔记,并结合用户既往协作内容生成个性化摘要和后续步骤。

  • 会议笔记和摘要可保存到 ChatGPT Space,并支持私密或团队共享
  • 会后可继续让 ChatGPT 更新项目计划或起草跟进内容
  • 目前面向 Pro 和 Business 用户,在 macOS 版 ChatGPT 桌面应用中使用

声明:本内容由AI生成,可能包含不准确或推测性信息,请读者自行甄别并谨慎参考。

欢迎点赞收藏

持续关注每日AI前沿动态
- 立即扫码 -
更多资讯,
点击下方卡片关注赛凡智云协作平台
▲ 赛凡云盒,一款超好用的企业私有云盘

相关学习资料