ARTICLE · 1137606
AI技术突破与应用 | 10-08
01.OpenAI一次发布722篇数学手稿,含Hodge猜想特例
🔍 核心看点
• 北京时间10月7日晨,OpenAI在GitHub一次性公开由一款未发布的内部前沿模型产出的722篇数学手稿,归入372个"结果族",覆盖理论计算机科学、数论、几何与数学物理等17个领域,多数结果附Lean形式化证明可逐行机检。• 评估中模型被提出约4,000个数学问题,平均每个结果耗费约等于ChatGPT Pro推理3小时的算力,成果涉及准黎曼假设、希尔伯特第十问题、Mahler猜想与CM阿贝尔簇上的霍奇猜想。趋势解读:争议不在题目对不对,而在治理:机检只验证证明、不验证论文,发布载体又由AI公司自己掌握。当"可复现"变成企业的权限,独立验证就必须先解决"谁来托管证据"。
02.谷歌发布Nano Banana 2.1,出图价格腰斩
🔍 核心看点
• 谷歌DeepMind于10月6日发布图像模型Nano Banana 2.1并全面开放,取代基于Gemini 3.1 Flash Image的上一代,改以Gemini 3.6 Flash为基座,模型ID为gemini-nano-banana-2.1,旧版将于10月29日下线。• 新版支持1K/2K/4K输出与最高8:1的宽高比,单次最多14张参考图(4个人物+10个物体)的一致性保持,并改善遮罩局部编辑与文字渲染。趋势解读:把高价Pro档的能力压到Flash档价格,是典型的"用上一代前沿做这一代廉价";真正的变化不在画质而在输入涨价——参考图越多,省下的出图钱越会被吃回去。
03.谷歌开源EmbeddingGemma 2:7.4亿参数端侧多模态嵌入
🔍 核心看点
• 谷歌DeepMind发布EmbeddingGemma 2,一个740M参数的开源多模态嵌入模型,把文本、代码、图像、视频与音频映射进同一个768维空间,基于Gemma 4架构,改用Apache 2.0许可并取消下载审核。• 模块化设计使纯文本与代码只需270M参数、文本+视觉440M、文本+音频570M,按需加载;上下文窗口8,192 token,单次可容纳5.5分钟音频、29张图片或58帧视频,量化后在Pixel 11 Pro上全模态约567MB内存。趋势解读:把多模态检索整套搬到端侧,真正的杠杆是许可与体积:取消下载审核意味着构建服务器可无人值守拉取权重,而嵌入层恰恰是RAG、推荐与搜索最需要本地化的那一层。
04.智谱GLM-5.3登陆亚马逊Bedrock,按调用量分成
🔍 核心看点
• 亚马逊云科技宣布其大模型平台Amazon Bedrock接入智谱GLM-5.3,符合条件的企业客户可通过托管API直接调用,AWS基于模型调用量与智谱进行收入分成。• GLM-5.3为753B参数的MoE开放权重模型,面向编码与长程智能体任务,支持跨区域推理与Prompt Cache;智谱披露其在CyberGym安全基准得到84.5分,并将年末ARR目标由24亿美元上调至30亿美元。国内方面,阿里云百炼已上架并签署类似分成协议,华为云亦已上架。趋势解读:国产开源模型正把"模型出海"升级为"渠道与收入出海";但开放权重本身是双刃——企业既可付费调用也可自部署,分成模式的天花板取决于海外合规与供应链信任。
05.TwelveLabs发布Pegasus 1.6:用第一人称视频训练机器人
🔍 核心看点
• TwelveLabs发布视频理解模型Pegasus 1.6,首个支持自我中心(egocentric)视角视频的版本,用于把人的手部动作、工具使用与操作流程转成可供人形与工业机器人直接训练的数据集。• 模型上下文扩展至261,120 token,约合两小时视频,并支持视频片段检索、动作分段与流程问答;官方同时列出局限,例如超长视频的时序漂移与细粒度动作边界不稳。• 定价为视频输入每小时1.75美元;公司同时披露人力标注的参照成本:每1小时视频通常需要70至155小时人工标注,以此论证自动化替代空间。趋势解读:具身智能的数据瓶颈正在"去采集化"——与其自建遥操作台采数据,不如把已有的第一人称视频变成可训练样本;这条路线一旦跑通,机器人的数据成本会从人力预算变成云计算账单。
06.Meta、沃尔玛与Stripe发布个人智能体协议
🔍 核心看点
• Sierra于10月6日联合Meta、沃尔玛、Stripe以及Genesys、Shopify、Instinct、Rocket等发布Personal Agent Protocol,一套基于OAuth的开放标准,用于让商家识别来访的是人还是代表人的智能体,并允许顾客自行决定授予只读还是可写权限;v0.1规范预计10月内发布,支付被列为后续扩展而非首发内容。• Decagon同期推出PACT(基于A2A协议与OAuth 2.0),让商家验证智能体代表谁、客户授权了什么,并宣布加入该工作组。趋势解读:智能体商务的标准之争先于交易量到来,而两家最大模型厂商缺席——入口之争的下半场是"谁替用户签名",不是"谁更会聊天";缺少支付环节的v0.1也说明瓶颈在授权与结算。
07.SAP让"自主企业"正式商用,Joule接入A2A
🔍 核心看点
• SAP在SAP Connect上把5月Sapphire提出的"自主企业"架构正式转为可用产品:Joule Work与Joule Desktop本月起开放,前者把AI助手带入客户工作流,可在SAP与非SAP应用之间执行任务,并通过Agent2Agent(A2A)协议连接第三方AI与智能体,客户可自行设定自主程度。• 早期采用者Maschinenfabrik Reinhausen称,原本在S/4HANA环境中需近一小时的工作,现通过自然语言数秒可得。趋势解读:企业软件的竞争点从"有没有智能体"转向"能不能跨系统把流程走完";A2A被SAP这样的流程型企业采纳,意味着协议兼容性比单点模型能力更早成为采购门槛。
08.AI智能体自主设计的FPGA推理加速器OpenTPU开源
🔍 核心看点
• 开源项目OpenTPU公布一款由AI智能体自主设计的FPGA推理加速器,硬件平台为Xilinx Kintex-7,可运行Qwen3、Gemma 4、Phi-4-mini等十款现代模型,实测达到峰值DRAM带宽的82%至94%。• 项目同时公开RTL代码,有工程师审查后指出浮点运算部分存在不正确之处,这被视为"AI设计硬件"从演示走向可用仍需人工验证的直接证据。社区讨论认为,能运行SOTA模型的AI设计加速器在去年12月起已具备可行性,下一步是给设计者本身配备足够内存以实现自举。趋势解读:意义不在性能数字,而在循环闭合:当AI能设计运行AI的芯片,硬件迭代的瓶颈会从设计人力转向验证人力;公开RTL这一步,也让"可审计"成为这类产出的默认门槛。
09.Anthropic把Claude装进谷歌办公套件,支持反向编辑
🔍 核心看点
• Anthropic于10月7日把 Claude for Google Workspace 推到公开测试,付费版均可安装。侧边栏插件让 Claude 读取打开的 Docs、Sheets、Slides 并就地改稿,默认改前询问逐条出审批卡,也可切"全部接受"。• Sheets 能写公式、建透视表与原生图表,把选区拉进 Python 算完写回;Slides 按现有版式生成新页,并自查重叠与越界。同步上线三个连接器(beta),可从 Claude 侧反向创建与编辑谷歌文件;合规 API 等企业管控同步覆盖。趋势解读:Claude 补齐 Word/Excel/PPT 后再补谷歌三件套,AI 工作层战场从聊天窗移进文件;而微软 Copilot 部分能力正由 Anthropic 模型驱动,供应商与对手两个身份成立。
10.GitHub重建Git底层:9月智能体产生73.8亿次提交
🔍 核心看点
• GitHub 工程博客披露正在重建 Git 存储架构,以支撑智能体规模开发。现状是每个仓库在五台文件服务器各存一份全量副本,每次写入都要法定人数确认,读扩容反而拖慢推送。新架构把权威数据放进 Azure Blob 存储、读写分离,压实与垃圾回收迁到独立后台,内部基准写入吞吐最高提升 35 倍。• 规模数据:8 月 Git 事件从上年同期 2182 亿升至 4733 亿次/月,9 月提交 73.8 亿次为去年同期 5 倍多,推送增 4.9 倍至 33.5 亿次/月。趋势解读:当"提交"从人的动作变成智能体的循环,版本控制第一次被按机器吞吐量重新设计;这类底层改造先于任何产品更新发生,却决定谁能承载下一阶段的开发量。
每日金句
「割之弥细,所失弥少,割之又割,以至于不可割,则与圆周合体而无所失矣。」——刘徽《九章算术注·方田》分割得越细,误差就越小;不断地分割下去,直到无法再分,多边形就与圆完全重合、毫无误差了。这是公元三世纪刘徽为推算圆周率所创“割圆术”的核心表述——从圆内接正六边形出发,逐次倍增边数逼近圆周,最终求得徽率3.1416。这句话是中国古代极限思想的源头:真理不在一步之内,而在步步逼近、层层细验的过程之中——每一步都可复核,误差才可收束到零。
关注「机械姬安娜」,AI 圈的新闻,我审完再发。