夜雨聆风学习资料网

ARTICLE · 1142369

AI日报10.8|Claude推出“最便宜”模型,GPT上线交互界面

AI日报10.8|Claude推出“最便宜”模型,GPT上线交互界面

10月8日,AI行业发生了哪些重要的事?

Anthropic发布Claude Haiku 5.5, “最快、最便宜、能力最强”

10月8日,腾讯新闻、澎湃新闻等报道,Anthropic正式发布Claude Haiku 5.5, 这是Claude 5.5系列第三款模型, 至此5.5系列三款模型全部到位: Opus 5.5负责复杂推理与长期任务, Sonnet 5.5面向日常办公与高频开发, Haiku 5.5则补齐高吞吐、低成本场景。

Anthropic将Haiku 5.5定位为目前最快、最便宜、能力最强的Haiku系列模型, 平均运行成本较Haiku 4.5下降约75%。

对于提示词不超过10万Token的请求, API价格下降90%, 输入价格为每百万Token 0.10美元、输出价格为0.50美元; 超过10万Token的请求, 输入和输出价格分别为0.50美元和2.50美元, 较上一代下降50%。

在性能方面, Haiku 5.5的电脑操作测试OSWorld 2.1离线子集成绩从15.7%提升至72.4%, 智能体编程测试Terminal-Bench 4.0从0%提升至39.2%, 知识工作测试GDPval-AA v2.1达到1620分, AA-Briefcase v1.1达到1578分。

Haiku 5.5是Haiku系列中首个支持可调节"effort"推理强度设置的模型, 提供Low、Med、High、Xhigh、Max五档, 用户可根据任务在成本与智能程度之间灵活选择。

Anthropic同步将Sonnet 5.5的缓存读取价格下调50%至0.10美元/百万Token, 在多数智能体任务中的运行成本可再降约20%。

Claude Max和Team订阅用户本周起将获得每月API额度, Max 5x为100美元, Max 20x为200美元, Team最高500美元, 可用于任意可用模型。

OpenAI全面上线GPT-6,推出智能交互界面

10月8日, 腾讯新闻、新浪财经等报道,OpenAI在ChatGPT的聊天界面中面向全部用户层级推送GPT-6, 同时带来名为Intelligent UI的新能力。

按照公布的时间表, Plus、Pro、Business与Enterprise自10月7日起由GPT-6 Sol驱动, Free与Go在10月8日切换到GPT-6 Luna, 企业版是否可用取决于工作区管理员的设置。

Intelligent UI让回答不再只有文字, 模型会依据问题混合使用文本、视觉元素与交互组件, 回复中可以出现图形、可点击的按钮、表单、图表, 以及完整的可交互体验。

官方把典型场景归为三类: 日常问题更直观(例如把烤肉的时间安排与食谱并排呈现); 复杂主题更容易理解(例如用交互式图解讲解中心极限定理); 还可以直接生成小工具(例如账单分账器、退休储蓄计算器, 甚至是能在对话里玩起来的复古游戏)。

实现上, 这套界面基于一套原生可流式组件库和相应的编译器, 界面会随模型生成逐步呈现, 不必等待整段回答结束。

GPT-6能够在继续思考的同时开始输出回答。内部评测显示, GPT-6 Extra High在高价值日常智能体任务上开始回答的时间与GPT-5.6 Medium相当, 总得分高于GPT-5.6 Extra High; 在网页搜索场景, GPT-6 Instant平均提前44%开始作答。

GPT-6在多轮越狱测试中的防御成功率均高于GPT-5.6 Sol, 指令层级提示词注入测试防护率分别达到99.99%和99.79%, 间接提示词注入测试分别为97.13%和95.80%。

Anthropic秘密递交招股书, “史上最大IPO”也被称为“最荒谬IPO”

10月8日, 网易、科创板日报报道, Anthropic已秘密向美国SEC递交S-1招股书, 计划最快11月中旬启动IPO, 争取在11月26日感恩节前挂牌, 最早可能在11月9日当周开始路演。市场讨论的潜在上市估值已超2万亿美元, 有望成为全球史上最大IPO。

据外媒披露的招股书, 2025年Anthropic营收近46亿美元, 同比增长12倍; 全年净亏损约420亿美元, 其中约340亿是非现金会计费用(融资估值上涨带来的账面增值), 实际经营亏损80多亿美元。Anthropic在计算和基础设施方面支出73.3亿美元, 达到上年的约三倍, 占全年126.5亿美元经营费用的一半以上。

更受关注的是未来账单: Anthropic计划未来数年将在云服务、算力和基础设施方面的合同义务合计约5180亿美元, 其中80%不可撤销。

客户结构方面, 2025年Anthropic近四分之一的收入来自两个客户, 不少大型客户没有签订长期锁定合同, 可能减少支出或停止采购。

独立金融研究机构New Constructs在最新报告中称, Anthropic即将进行的IPO是"2026年最荒谬的IPO", 为了达到预期的估值, Anthropic的盈利需要达到英伟达上一年度利润的两倍(英伟达过去四个季度的净利润超过1900亿美元)。

Anthropic还表示, 公司已向一小批合作伙伴展示了其IPO招股说明书, 上市的目标估值约为2万亿美元, 2025年公司营收同比增长12倍, 接近46亿美元; 运营亏损则扩大超过一倍, 超过80亿美元。

AI基建融资潮升温:博通、甲骨文、SpaceX密集洽谈数百亿美元芯片融资

10月8日,环球网、华尔街见闻综合报道,随着AI数据中心和算力基础设施投入持续攀升,科技企业正越来越多地借助华尔街金融机构为AI芯片和算力建设融资。博通、甲骨文和SpaceX近期均在洽谈规模达数百亿美元的融资交易。

博通正在为与OpenAI共同开发的定制AI芯片项目Nexus安排超过500亿美元融资,Apollo Global Management和黑石集团均在洽谈参与。该项目的首代和第二代芯片代号分别为Jalapeño和Serrano,相关融资仍处于早期讨论阶段,最终规模和结构可能发生变化。

甲骨文则正在与Apollo和高盛商谈大型AI芯片采购融资。潜在方案之一是由私人投资者出资设立表外实体购买芯片,再将芯片租赁给甲骨文使用,以降低相关资产和债务对甲骨文资产负债表的影响。

SpaceX也正在寻求约400亿美元融资,以采购英伟达AI芯片。Reuters称,该融资计划可能包括约100亿美元银行贷款和300亿美元投资级债务,Apollo预计牵头交易并协助向投资者分销债务,PIMCO等机构也参与相关讨论,交易预计可能于2027年完成。

与此同时,博通此前还在推进另一笔约600亿美元的AI芯片融资,受益方包括Anthropic等企业。其中约420亿美元为Class A优先担保融资,黑石牵头的Class B次级债务规模约180亿美元,黑石旗下基金计划出资90亿美元。

这些交易显示,AI基础设施建设正在从传统的企业资本开支和公开债券融资,进一步向私募信贷、资产融资和表外融资等金融结构延伸。随着AI芯片、服务器和数据中心建设成本持续上升,华尔街金融机构正在成为支撑AI基础设施扩张的重要资金来源。

微软发布与英伟达合作的“最强Surface笔记本”

10月8日, 21财经/新浪财经报道, 微软在旧金山举行发布活动, 正式宣布将于10月16日发售与英伟达合作开发的Surface Laptop Ultra笔记本电脑, 起售价2599.99美元(中国地区售价人民币21988元起)。

英伟达创始人兼CEO黄仁勋也现身发布会, 与微软董事长兼CEO萨蒂亚·纳德拉为新产品站台。

这款被微软称为迄今最强的Surface笔记本, 采用英伟达RTX Spark芯片, 最高配备128GB统一内存, 微软称高内存配置可支持在本地运行超过1200亿参数的AI模型。

RTX Spark采用台积电3纳米工艺, 集成基于Blackwell架构的RTX GPU, CPU部分则由英伟达与联发科联合定制, 顶配可选20核Grace CPU、6144核Blackwell GPU和128GB统一内存, FP4理论AI算力最高达1 PFLOPS。

微软同时强化了Windows的智能体能力, 经用户授权, Copilot可读取电脑上的相关文件和近期活动, 并在系统内代为整理文件、排查故障、执行工作流。基于英伟达芯片的支持, Windows将按任务在本地模型与云端模型之间进行调度, 这套本地与云端配合的路线被称为”混合智能"。

安全层面, Microsoft Execution Containers(MXC)在Windows 11上正式可用, 开发者可规定智能体能访问哪些文件、连接哪些网络, 并由系统在运行时执行这些限制。

微软还推出AI代理产品Microsoft Scout, 定位"始终在线的个人代理", 属于微软新设立的"自动驾驶仪(Autopilots)"代理类别, 可在无需每次提示的情况下自主执行任务, 深度集成于微软365应用生态, 可接入Teams、Outlook、OneDrive和SharePoint。

GitHub: 每3个Pull Request中就有1个涉及AI智能体, 两年内多数推送代码可能由智能体编写

10月8日, GitHub官方博客报道, GitHub最新数据显示, 目前平台上每三个Pull Request中就有一个涉及AI智能体, 而一年前这一比例还不到十分之一。

若趋势延续, 两年内大多数推送代码可能由智能体编写, 且其中很多可能永远不会被人完整阅读。GitHub主张, 开发工具应承担更多密钥与凭据保护工作, 以跟上代码产出的速度。

智能体在代码生成方面进展迅速, 来自OpenAI的Codex、Anthropic的Claude Code、Google的Jules等已经成为主流开发工作流中的常见工具, 智能体可以自动修复bug、生成单元测试、撰写代码审查意见, 并能在一个工作流中同时操作多个开发工具。

然而, 智能体生成的代码数量急剧增加也带来新挑战: 越来越多的代码实际上可能无人完整审阅, 引入安全漏洞或低质量代码的风险同步上升。

GitHub还介绍, 平台上超过33%的Pull Request涉及AI智能体参与的代码, 这些智能体通常来自GitHub Copilot、Anthropic Claude、OpenAI Codex、Cursor等工具。

在企业用户中, AI智能体的使用率更高, 一些大型企业报告显示, 他们的Pull Request中超过一半已经涉及AI生成代码。对开发者而言, 智能体代码已从"补充"变为"主流"; 对安全团队而言, 智能体生成代码的可信度与审阅机制成为新关注点。

谷歌SynthID水印检测器向公众开放, 已覆盖1800亿+条AI生成内容

10月7日, The Decoder报道, 谷歌宣布其AI水印检测工具SynthID向公众开放, 任何人可在新网站上检测图片、视频或音频是否由谷歌AI或OpenAI、英伟达等合作伙伴生成。

目前已有超1800亿条内容携带该SynthID水印, 覆盖了谷歌搜索、Gemini、Veo、Imagen、Lyria等谷歌系AI产品, 以及英伟达Picasso、Adobe Firefly等合作伙伴的产品。

SynthID技术由谷歌DeepMind于2023年首次公开, 通过在AI生成内容中嵌入人类不可见但机器可识别的水印信号实现内容溯源。该工具仅能识别带SynthID标记的内容, 无法检测一般的AI生成媒体, 这意味着未使用SynthID技术生成的AI内容仍无法被该工具识别。

在欧盟AI法案生效的背景下, 文本水印成为合规的关键工具。OpenAI于10月5日宣布, 将在欧盟地区默认对ChatGPT生成的文本自动添加水印(textGrain技术), 其他地区提供该功能但默认关闭, 此举旨在遵守8月生效的欧盟AI法案对AI生成内容可检测标记的要求。

报道指出, 包括SynthID、C2PA在内的现有方案都易被具备基础技能者规避, 例如通过截图、裁剪、重新编码等操作可削弱水印的检测能力。

OpenAI 722篇数学手稿再引学界争议, 菲尔兹奖得主集体发声担忧

10月7日-8日, AITOP/澎湃新闻/机器之心报道, OpenAI一次性公开722份数学手稿, 涵盖372个成果族, 17个数学领域, 准黎曼猜想、Hilbert第十个问题、Mahler猜想、Kaplansky相关猜想等重要问题上均有进展, 部分成果附有Lean形式化证明。

OpenAI表示, 平均每项成果消耗的算力约相当于ChatGPT Pro连续思考3小时, 评估中向模型提出了4000个数学问题。

AITOP 10月8日早报披露, 包括25位菲尔兹奖得主在内的数学界人士警告, 大规模生产数学证明可能破坏研究生态。Gary Marcus公开发文炮轰OpenAI的数学证明报告: "没写过程、没写失败率, 啥关键信息都没有”。

学界担忧的另一个问题是, 这些手稿虽然部分附有Lean形式化证明, 但数学家仍然需要逐行验证; 部分手稿虽然有Lean证明, 也并不意味着其内容完全正确——Lean只是形式化验证工具, 形式化证明是否忠实对应猜想的原始表述, 仍需要专家逐一确认。

有数学家指出, OpenAI此次发布的"准黎曼猜想"证明, 对zeta函数和所有狄利克雷L函数同时成立, 这是一个重大突破, 但需要在数学界进行全面复审才能确认。

OpenAI则表示, 这只是其用AI推进数学发现系列工作的一部分, 未来还会继续发布更多数学手稿, 同时也在探索通过学术社群托管的发布方案。OpenAI成立了一个名为AGMAI的精英数学家独立咨询小组, 为发布提供建议。

封面图:AI生成

本文由AI整理,经人工审核

-END-

相关学习资料