ARTICLE · 1138359
AI日报-2026年10月08日
一、前沿模型与实验室
Claude Haiku 5.5发布:模型支持可调推理力度;提示长度不超过10万token时,每百万输入/输出token为0.10/0.50美元,超过门槛为0.50/2.50美元;已上线Claude Platform及AWS、Google Cloud、Azure,扩大低成本、高频任务的模型选择。
Mistral Large 4开放预览:ML4为1T总参数、49B激活参数的原生多模态模型,预览API已在Mistral Studio开放;权重计划10月底发布,开发者现可试用API,权重仍待发布。
Reflection公布Beam:稀疏MoE模型为501B总参数、23B激活参数,使用23.8万亿token预训练;当前向少量用户开放,计划本月以Apache 2.0发布权重及运行、评估和微调栈。
Perplexity更新多模态决策模型:开放权重模型pplx-decider-v1.1-27b已可用;官方公布API输入价为每百万token 0.02美元,较v1减半,为分类、路由等决策任务降低调用成本。
二、产品、平台与基础设施
GPT-6与Intelligent UI进入ChatGPT:回答可组合图表、表单、按钮及可交互工具;10月7日起向Plus、Pro、Business和Enterprise推出,Free与Go计划次日扩展,ChatGPT开始在对话中直接生成可操作界面。
GLM 5.3上线Amazon Bedrock:Z.ai模型面向符合条件的企业客户正式可用,支持100万token上下文、最高128K输出及显式提示缓存;可通过US与Global跨区域推理配置调用,增加企业云分发渠道。
Nano Banana 2.1正式GA:Gemini API新增1K、2K、4K输出以及1:8、8:1等宽幅比例,并改善文字渲染和多轮一致性;旧模型gemini-3.1-flash-image已标记弃用,当前官方尚未公布关闭日期。
NVIDIA与微软推进Windows本地AI:RTX Spark笔记本开启预订,最高128GB统一内存、1 PFLOPS FP4算力,计划10月16日上市;同场预览DGX Station for Windows,配置748GB内存及最高20 PFLOPS FP4算力,将大模型开发扩展到Windows桌面。
Anthropic下调缓存价格并增加API额度:Sonnet 5.5缓存读取价由每百万token 0.20美元降至0.10美元;Max两档新增每月100/200美元API额度,Team为团队合计最高500美元,额度本周陆续推出,扩大订阅用户开发API应用的入口。
ChatGPT公布青少年升学规划工具:College Planner将整合申请要求、截止日期、任务和助学金步骤,首批面向美国10—12年级学生,仍属即将推出;配套学习卡片、测验及iOS多页笔记拍摄功能,扩展教育场景。
三、研究、开源与评测
OpenAI公开数学研究成果库:官方GitHub目录包含722篇手稿、372个结果族,并提供部分Lean形式化证明与10份推理摘要;平均每项结果使用约3小时ChatGPT Pro思考等效算力,仍有结果待验证,不能等同于722个已确认独立突破。
NVIDIA发布Nemotron竞赛系统与训练资源:官方披露IOI 2026系统得分535.4/600、IMO系统得分30/42,并开放检查点、数据及推理流程;IOI为非官方测试,IMO证明由官方评分员评阅,成绩体现专项微调与推理系统的组合效果。
EmbeddingGemma 2支持端侧多模态检索:740M参数、Apache 2.0许可模型统一文本、代码、图像、视频和音频嵌入,支持8K上下文;官方报告完整多模态量化权重约需567MB活动内存,提供更轻量的离线搜索与RAG组件。
Perplexity发布late-interaction检索模型:pplx-embed-v2-late两款模型权重已在Hugging Face公开,可检索文本、图像和页面;不同尺寸模型共享嵌入空间并支持跨模型查询,为索引端与查询端采用不同规模模型提供基础。
Liquid AI开放端侧决策模型:发布d1-3B及实验性d1-omni-600M,通过单次前向计算输出决策;官方报告d1-3B在Jetson AGX Thor单问耗时16毫秒,为端侧分类和多模态路由提供生成模型之外的实现方式。
Ironclad合作将专业工作流纳入模型评测:11项任务中,GPT-6 Astra平均评分55.0%,GPT-5.6 Sol为41.6%;估算单次耗时由37.0降至19.2分钟,两者推理力度不同,结果属于受控研究评测,提供了工作流级能力证据。
Falcon推出阿拉伯语OCR模型:270M参数Falcon-OCR-Arabic适配阿拉伯语文档;在TII自建11,974样本评测中,文本准确率81.87%、表格TEDS为59.95%,补充面向复杂文字与表格的专用文档识别能力。
四、政策与治理
- OpenAI公布文本溯源部署安排
:全球API客户可对部分模型主动启用textGrain水印,欧盟适用的ChatGPT与Codex文本计划未来数周加入水印,检测器初期需申请;官方强调编辑会削弱检出能力,溯源信号仍有技术限制。
五、资本、产业与采用
Google与Constellation签署长期电力合作:20年协议支持新增890MW核电容量,另有15年协议覆盖现有2,700MW,新增投资超过43亿美元;首批增容预计2028年交付,为AI与云基础设施增长配置长期电力供给。
OpenAI扩大Atlassian合作:GPT-6系列模型将为Atlassian平台及Rovo中的agent提供能力,结合Teamwork Graph企业上下文;Atlassian已有超过3,000名开发者使用Codex,企业系统成为模型落地的重要入口。
Vinci完成2.5亿美元B轮融资:公司确认估值15亿美元,融资由Advent、Temasek和Xora Innovation领投;资金用于算力、人才及物理仿真产品,推动AI在芯片与硬件工程中的应用。
Nous Research融资:据TechCrunch,融资9,000万美元、估值15亿美元,扩展企业agent业务。
AI线索
能力与部署路径同步分化:从上述发布可观察到,大型模型以API预览和后续权重开放进入市场,小型决策模型、轻量嵌入与本地硬件则扩展即时部署路径。
agent开始改变交互与评测单位:Intelligent UI把回答变为可操作界面;Atlassian与Ironclad合作把企业上下文和完整工作流纳入模型应用与评测。
基础设施投入延伸到能源:长期电力协议与工程仿真融资并行,说明AI扩张的投入正在覆盖电力供给、芯片设计和软件能力。