ARTICLE · 1116810
每日AI新闻速览|2026年10月2日
每日精选全球 AI 领域最值得关注的动态,中国 5 条、国际 5 条,每条 200 字说清来龙去脉。
🇨🇳 国内篇
一、DeepSeek 开源 Harness v0.2 桌面端,本地智能体面向全球公测
10月2日,DeepSeek 宣布智能体运行框架 Harness 进入全球公开预览并开源,提供 macOS 与 Windows 桌面安装包,也可用一条命令启动本地 Web 界面。框架基于“万物皆插件”架构,内置文件整理、数据分析、文档起草、代码修改与测试等能力,另配定时任务、插件管理与执行轨迹查看,还可用对话直接生成插件。项目以 MIT 协议开源,模型适配可替换,调用需 DeepSeek 账号或 API Key。继 9 月下旬客户端提前流出之后,此次是正式面市,运行框架正成为模型之后的新竞争层。
来源:DeepSeek 官方页面、Hacker News、掘金
二、月之暗面 Kimi K3.1 预告曝光,100 万 token 上下文分三档推理
10月2日,多名开发者发现月之暗面 API 平台后台的模型注册表中出现“kimi-k3-1”标识,并可通过接口探测与调用;官方开放平台同期挂出 K3.1 预告,标注支持 100 万 token 上下文窗口,提供 Low、High、Max 三档推理强度,由用户按任务复杂度选择。业内预计该版本将于 10 月正式发布。上一代 Kimi K3 拥有 2.8 万亿总参数、1040 亿激活参数,今年 7 月发布并开放权重,10 月 1 日刚完成与 OpenAI 编程工具 Codex 企业通道的对接。长文本与可选推理档位,正成为国产开源模型争夺开发者的标配。
来源:IT之家、ZAKER、网易科技
三、字节个人助理应用「小豆」浮出水面,Spell 项目加速产品化
10月2日,多家媒体报道字节跳动即将推出独立的个人助理应用,内部或已定名“小豆”,牵头人是主管豆包对话与搜索产品线的李福祥,今年 4 月起在豆包内部内测的代号 Spell 项目转为端侧能力供给方。此前字节已把飞书产品团队整建制并入豆包,重心从大众消费端延伸至办公与生产力场景。同期腾讯在元宝、Handy Bot 等多条线上布局,海外 Meta 的 Muse 也在预热。个人智能体被视为对话机器人之后的新一代系统级入口,一旦用户习惯把复合需求直接交给智能体,搜索框、电商与出行应用都可能退化为底层接口。
来源:人人都是产品经理、网易科技、ZAKER
四、银河通用人形机器人 ET1 开卖,7.9 万元起售
10月2日,银河通用公布消费级人形机器人“银河星仔 ET1”售价:基础版 7.9 万元,具备 26 个自由度与完整人形形态、运动及自然语言交互能力;专业版 13.9 万元,搭载 40 TOPS 计算模块;旗舰版 17.9 万元,搭载 100 TOPS 计算模块并开放二次开发。该机器人由自研 AstraBrain-WBC 全身运动控制基础模型驱动,公司称已积累百万小时量级人类运动数据,无需动作捕捉或示范视频,看一遍即可复刻舞蹈等动作,本体采用宇树电机的运动方案。7.9 万元的起售价填补了消费级与专业级之间的价格空档。
来源:量子位、新浪财经、AGI Hunt
五、小米 MiMo-V2.6-Pro 登陆 Agent Arena,列开源模型第五
10月2日,评测平台 Arena 公布智能体任务榜单,小米 MiMo-V2.6-Pro 在 8100 余个真实会话中净提升 3.17%,位列开源模型第 5,较上一代 MiMo-V2.5-Pro 的第 13 位大幅前移,Flash 版列第 9;在任务确认成功率子项上净提升 7.35%,居开源模型第 2。MiMo-V2.6 系列于 9 月下旬发布,Pro 为全模态开源模型,在 Artificial Analysis 智能指数上取得 46 分,是当时得分最高的开源模型。国产开源模型正从跑分转向真实任务完成率的较量。
来源:Arena、AI 资讯日报、Artificial Analysis
🌍 国际篇
六、谷歌 Gemini Live 上线「引领视界」,实时描述镜头画面
10月2日消息,谷歌为 Gemini Live 加入面向无障碍场景的实时视觉能力 Guided Vision,中文名“引领视界”。用户共享摄像头画面后,Gemini 会持续用语音描述环境、朗读细小文字、帮助定位物品,并在取景不佳时提示“向右缓慢平移”“向下倾斜”等调整动作,用户可用口语追问细节。该功能与无障碍机构 Aira 合作开发,使用数万小时视觉解说数据,逾 1000 名测试者参与打磨,已在 Android 9 及以上、支持 Gemini Live 的地区推送。谷歌说明,它不是医疗设备,也不能替代盲杖,不适用于导航与避障。
来源:谷歌官方博客、The Verge、IT时代网
七、ChatGPT 上线虚拟试衣,购物能力接入收藏夹
10月1日,OpenAI 为 ChatGPT 推出购物新功能:用户上传个人照片即可虚拟试穿服装与配饰,查看上身效果,并把喜欢的商品存入 Favorites 收藏库,方便后续比较与复购。此前 ChatGPT 已支持商品检索与站内结账,此次补上“试穿”环节,把导购问答推进到决策与收藏。虚拟试衣依赖图像生成与人体建模能力,适配效果与隐私处理最受关注,OpenAI 暂未公布支持的品类与地区。对零售商而言,AI 正从流量入口变成交易前端的决策工具。
来源:TechCrunch、OpenAI
八、微软发布首款流式转录模型与两款语音合成模型
10月2日消息,微软 AI 在 Microsoft Foundry 上线 MAI-Transcribe-2-Streaming,这是其首个流式语音转写模型,支持 60 种语言与自动语言检测,收到音频后百余毫秒即输出初步假设并随上下文修正,最终词错误率 2.5%、0.13 秒定稿,官方称其转录准确率在第三方流式榜单列第一。同步推出的 MAI-Voice-2.1 与 Flash 版支持 23 种语言,同一音色可跨语言保持身份,Flash 端到端延迟 150 毫秒。转录按每小时音频 0.54 美元计价至年底,语音合成每百万字符 15 至 22 美元。
来源:微软官方博客、Unite.AI、环球网
九、Anthropic 为 Claude Code 开放 Mods 插件机制
10月2日消息,Anthropic 为 Claude Code 引入 Mods 修改模块机制,开发者可用几行 TypeScript 编写函数钩子,定制智能体的界面与运行逻辑、替换自有功能;用户也可让 Claude Code 自己编写并安装 Mods,并在当前会话中热加载。DeepSeek Harness 团队负责人崔添翼随后评价称,两者在插件化方向上“殊途同归”,但作用范围不同:Claude Code 的钩子运行在主进程内,Harness 的插件体系覆盖面更广。编码智能体正从封闭产品转向可被开发者改造的平台。
来源:Anthropic、新浪财经、Claude Devs
十、亚马逊开源 2B 决策模型 Strands Decider,单次判断约 106 毫秒
10月1日,亚马逊 AWS 开源决策模型 Strands Decider 2B。该模型以阿里 Qwen3.5-2B 为底座,去掉文本生成头,改接约百万参数的打分模块,输入问题与候选项后直接返回选择、概率或评分及置信度,不生成文字。单次判断中位延迟约 106 毫秒,基准准确率约 72%,用于智能体的工具选择与路由。权重、训练代码与数据配方一并公开,开发者可在自有硬件上本地部署;同日 Cloudflare 也开源了同类决策模型 Clef。
来源:AWS Strands Labs、VentureBeat、TechCrunch
本期编辑:WorkBuddy|素材采集时间:2026-10-01 22:00–2026-10-02 22:00
声明:本内容基于公开信息整理,仅供学习参考,不构成任何投资建议。