ARTICLE · 1076173
AI日报|阿里云栖大会原生智能体电脑曝光 下一代PC浪潮已来
导 语
9月22日至24日,云栖大会把智能体从云端搬到了桌面与身上:阿里云首款AI智能体电脑Qwen Book首次亮相,千问AI眼镜N1系列与AI耳夹式耳机定档10月13日现货发售;腾讯混元发布图像模型Hy Image3.5 preview,把2K图像生成价格压到每张0.15元。海外市场,谷歌把带视频形象的Gemini 3.8 Live with Live Avatar推向企业客户,Meta则用两周时间为Muse拼齐Stripe、Shop Pay与PayPal,让智能体第一次跑通从选品到支付的完整链路。开源侧,苹果开源LensVLM-9B,英伟达补齐流式说话人分离能力。当智能体开始替你下单付款,你愿意把钱包的权限交给它吗?
国内动态
阿里云首款AI智能体电脑Qwen Book亮相云栖大会:搭载全局AI按键与Skill键盘阵列
平台:每日经济新闻 / 杭州日报 | 日期:2026-09-23

9月23日,2026杭州云栖大会上,阿里云旗下首款AI智能体电脑Qwen Book首次公开亮相。产品基于"OS as Harness"理念开发,以千问端云模型为核心底座,把操作系统、应用、云服务与硬件能力融合,统一组织交互入口、运行时环境、个人持续上下文与软硬件操控能力,构建智能体可理解、可记忆、可持续运行且可治理的计算环境。
硬件层面,Qwen Book设有全局AI按键与Skill键盘阵列,一键即可唤起智能体执行任务;独立状态副屏AI Island用于显示任务进展;磁吸键盘兼顾办公输入与手写创作,另配一支带语音识别功能的手写笔,按下笔端即可召唤智能体安排任务,产品提供7×24小时执行重度任务的操作空间。
以修改PPT为例,用户按下触控笔说出修改要求,Agent会结合当天沟通内容与长期上下文找到相关页面和材料、调用合适工具完成修改并征询意见;用户离开电脑后仍可用手机继续确认,切换设备后任务连续推进。
生态方面,Qwen Book开放系统接口与能力接入,已与高通、英特尔、罗技、绿联等企业产品完成适配,并打通支付宝、千问输入法等阿里系应用。阿里云同时宣布Qwen Book与开源Linux桌面项目Omarchy合作,共同探索面向Agent的新一代桌面操作系统。
阿里发布千问AI眼镜N1、N1 Pro与AI耳夹式耳机:10月13日现货发售
平台:驱动中国 / 广州日报大洋网 / 腾讯新闻 | 日期:2026-09-22
9月22日云栖大会上,阿里集中展示新一代全系列千问AI硬件,包括千问AI眼镜N1、N1 Pro及千问AI耳夹式耳机,三款新品当天同步开启线上预约,并将于10月13日现货发售。
N1系列搭载5000万像素传感器,支持第一视角拍摄与防抖,整机采用多芯片协同方案以控制功耗;N1 Pro在标准版基础上增加眼动追踪与虹膜支付,用户看向展品并提问时,AI可借助视线信息判断用户所指对象,并内置高精度传感组件持续监测心率、血氧、体温等体征数据,采用可更换镜腿电池设计以解决穿戴设备续航短板。
千问AI耳夹式耳机采用开放式佩戴结构,结合Bose调音与AI助理能力,支持面对面翻译、AI听记与语音办事。同日,曹操出行宣布与千问AI眼镜合作推出AI打车服务,实现免手持近眼交互:曹操出行MCP Server在千问开放平台注册为插件开放完整出行能力,交互策略由千问AI眼镜Skill承载。
用户佩戴眼镜说出目的地后,系统自动识别起止地点、规划路线并完成预估,行程中可通过语音修改终点、确认接驾车型,接驾车辆信息与行程进度以可视化卡片形式呈现在眼前。千问AI硬件总经理宋刚表示,穿戴硬件可在获取用户授权的前提下,通过第一视角感知和语音交互构建以个人为中心的多终端上下文。
腾讯混元发布Hy Image3.5 preview:2K图像0.15元/张,综合表现较3.0提升30%
平台:智东西 / 腾讯云开发者社区 | 日期:2026-09-22
9月22日,腾讯混元正式发布新一代图像生成模型Hy Image3.5 preview,支持文生图、图生图与多轮对话创作,单次最多可上传5张参考图,最高输出2K分辨率图像,重点提升语言与视觉理解、文本渲染与布局、真实感与风格表现以及编辑一致性。
在内部数百名专业设计师参与的GSB盲测中,Hy Image3.5 preview相比Hy Image3.0综合表现提升30%,与字节Seedream 5.0 Pro表现相当,略高于Nano-Banana Pro与Qwen-Image-3.0 Pro。
价格方面,模型已上线腾讯云TokenHub,2K图像API定价0.15元/张、国际版0.024美元/张,仅对最终输出图片收费,在13款主流生图模型的公开定价对比中单张成本最低。灰度期间,元宝App生图请求量提升超50%,人像修图场景请求量提升100%,海报与logo等工作型需求上升80%。
模型已同步接入元宝、AI知识管家ima、专业影视智能平台WorkRally、剧集与游戏内容制作工具OnSolo、创意智能体Miora以及办公智能体工作台WorkBuddy,其中WorkBuddy已将其作为默认生图模型。
腾讯WorkBuddy企业版办公套件化升级,并披露零跑汽车落地提效约90%
平台:国际金融报 / 腾讯新闻 | 日期:2026-09-23
腾讯宣布WorkBuddy企业版完成办公套件化升级,腾讯文档、腾讯乐享、腾讯网盘、安全与效能运营平台以及腾讯AI设计智能体Ardot首批接入,实现一个订阅、一个Agent底座、一个管理后台。
落地方面,9月23日腾讯宣布与零跑汽车达成合作,WorkBuddy已在整车研发、智能驾驶、车联网、采购与供应链、审计等场景深度落地,按传统模式累计需1700多人天的工作量,采用AI开发模式后压缩至177人天,平均提效约90%。
公开披露的合作案例已覆盖金融、政务、教育、医药、消费、汽车等多个领域,其中包括与上海家化、蒙牛等企业覆盖多部门的全员AI项目。
华为云Agentic Cloud峰会:联合金山办公等伙伴发布三大生态联合解决方案
平台:中国经济新闻网 | 日期:2026-09-24
华为云在Agentic Cloud峰会期间联合生态伙伴面向细分场景发布三大联合解决方案,金山办公、滴普科技、深演智能、钛动科技作为标杆企业,围绕办公协同、企业经营决策与智能营销与华为云携手落地。
办公方向,华为云与金山办公基于WPS Comate与华为云AgentArts打造智慧办公解决方案:WPS Comate通过"三通两管"打通企业文档、业务系统与模型调度,理解数据关联、组织权限与业务规则;AgentArts提供企业级智能体开发运营底座,沙箱环境支持高并发与弹性伸缩,并通过内核级隔离、权限管控和行为审计保障智能体访问企业文档与业务系统时安全可控。
效果上,合同审核周期从三周压缩到1至2天,商务侧单份合同审核时间从1.5小时降至3分钟,校验准确率达到98.02%。经营决策与智能营销方向则分别由滴普科技、深演智能与钛动科技承接,目标是把企业经营指标与营销投放链路交由智能体承接分析。
星驿支付"鲁班"智能体上线36项以上经营技能,已接入数十万家商户
平台:人民网福建频道 | 日期:2026-09-24
在2026云栖大会"金融智能体实战峰会"上,服务境内外超600万活跃商户的星驿支付披露,其"鲁班"智能体通过星驿付与慧徕店部署仅需约10秒,之后商户可像与微信好友聊天一样用语音发出经营指令。
目前"鲁班"已上线36项以上经营技能,覆盖从开店到打烊的多个环节,自今年5月底发布以来保持约三天一版迭代,已接入数十万家商户。
以中秋营销为例,商户不必分别寻找数据分析、营销策划与内容制作工具:"鲁班"先梳理历史收入与可用资金,再结合地图与生活服务平台的生态数据寻找消费热点,随后生成文案、视频和海报并给出发布排班,活动结束后还能核算投入产出。
连接摄像头、扫地设备与智能音箱等IoT设备后,它还获得感知门店、连接设备和执行任务的能力。同期,速卖通把潜力市场智能经营Agent全面上线,以AI托管200多个潜力国家地区。
海外动态
谷歌Gemini 3.8 Live with Live Avatar面向企业正式开放:支持97种语言唇形同步
平台:Google Cloud官方 / Unite.AI | 日期:2026-09-24
9月24日,谷歌宣布Gemini 3.8 Live with Live Avatar在Gemini Enterprise中正式面向企业客户可用,该能力此前已在Google Cloud Next 2026上完成预览展示。它在原生语音到语音的实时对话模型之上叠加视觉交互层,生成带同步唇形与表情的视频虚拟形象,覆盖网页、移动端与实体交互终端。
功能上支持自然打断恢复而不会丢失对话上下文或中断后台事务,并可在持续对话的同时在后台异步执行工具调用与API请求;视觉侧可并行处理实时摄像头画面与屏幕共享,语言侧支持97种语言的自动识别与切换,且切换过程中唇形与表情会自动适配。
部署提供美国与欧盟双区域端点、预置吞吐与企业合规治理,自定义虚拟形象需经企业白名单与验证流程,所有生成的音频与视频流均嵌入SynthID隐形水印。
客户方面,Cox Automotive在旗下Autotrader平台构建了可实时高亮屏幕内容、引导消费者完成车辆搜索、对比与下单流程的购车AI助手;印度Equal AI表示其平台基于Gemini 3.8 Live每日处理超过百万次实时通话,覆盖九种印度语言。
谷歌同时提示,Live Avatar目前只能维持数分钟交互,并存在幻觉或超时可能;面向高复杂度推理的Gemini 3.8 Live Extended Thinking仍处于私密预览阶段。
Meta用两周时间为Muse拼齐代理商务链路:Stripe、Shop Pay、PayPal陆续接入
平台:Forkast | 日期:2026-09-23
Meta在9月两周内为其个人智能体Muse搭建起从商户发现到支付完成的完整链路。9月8日Muse上线时即内置Stripe的Link钱包,覆盖超过一百万接受Link的商户;对未接入的商户,Link会生成一张限定于该笔已批准购买的虚拟单次卡,Muse也成为首个纳入Link购买保护的智能体。
9月21日,Shopify与Meta宣布深度合作,Shop Pay结账在全部Shopify商店开启,Meta同时成为Shopify代理店面中的一个AI渠道。次日PayPal确认全球支付接入,由Mastercard的Agent Pay平台提供安全支付通道,Expedia与Instacart分别覆盖旅行与生鲜场景。
技术架构上,每个Muse用户拥有独立的Muse安全虚拟机——一台带独立浏览器的云端隔离Linux环境,另有Sentinel智能体在系统层面与之隔离运行,Muse的任何联网请求都需经Sentinel批准,涉及购买等敏感操作前会向用户请求授权;Muse无法读取密码与支付明细,凭据存放在它可使用但不能读取的保险库中,每一步操作都生成用户可查阅的审计轨迹。
Meta计划在今年晚些时候推出Muse机密虚拟机,以仅由用户持有的密钥加密整台虚拟机。亚马逊已阻止Muse在其站点购物。
AMD锐龙AI Max系列搭配Perplexity,推出可携带的智能体PC方案
平台:My AI Guide | 日期:2026-09-24
AMD发布锐龙AI Max系列处理器,与Perplexity配合在Windows上运行可携带的智能体,为硬件买家提供开箱即用的智能体PC配置。
该方案把本地高带宽统一内存与云端模型能力结合,使智能体的推理与工具调用可以在笔记本形态下完成,面向需要在移动场景演示或离线处理任务的用户。
同期AMD还在Replicate与Hugging Face侧补充了推理端点与开放权重模型供给,供开发者在采购前先行验证上下文窗口与推理成本。
YouTube在Made on YouTube发布Gemini对话式剪辑与一整套Studio AI工具
平台:Google官方博客 / The Decoder | 日期:2026-09-24
YouTube在年度Made on YouTube活动上发布新一代创作者工具。YouTube Studio新增Insights与Research目标页,帮助创作者理解历史表现并发现异常高播放视频;草稿可用新反馈功能获得关于节奏、结构与叙事的个性化建议,并可生成匹配频道风格的缩略图,动态缩略图会向不同受众群体推荐三张备选中最合适的一张。
即将上线的视频A/B测试支持最多三个剪辑版本对比,用于判断哪个开场钩子表现最好;Ask Studio还可在后台复查旧视频并建议刷新缩略图。
编辑侧,Gemini以对话式剪辑伙伴形态进入Shorts与YouTube Create,可从建议提示或自定义指令出发生成初稿,并通过持续对话重排画面、裁剪片段、按节拍对齐音乐,创作者可随时在AI辅助与手动时间线之间切换。平台同时测试可选AI评论审核,该功能会随时间学习创作者的审核风格;数十亿频道可开通自动换脸检测并通过相似度工具管理视觉形象,今年晚些时候将把说话人声纹检测与面部检测结合。直播侧同步推出英语到西班牙语的实时自动配音。
法国巴黎银行与谷歌云签五年Agentic AI合作:首批用于企业信贷备忘录准备
平台:Unite.AI | 日期:2026-09-24
法国巴黎银行与谷歌云宣布为期五年的合作,扩展该行对Google Cloud AI优化基础设施、Gemini模型与Gemini Enterprise的使用,首批智能体用例落在企业与机构银行部门,用于公司信贷备忘录准备,后续计划扩展至该部门的销售、交易、研究与结构化业务。
Gemini模型还将接入该行内部生成式AI助手LLM@CIB,官方称该助手目前已向超过6.5万名员工开放。治理方面,方案纳入银行既有的安全与数据治理要求,确定哪些类型数据与工作负载可在公有云环境处理,部分类别的数据不会存放在公有云环境;每个智能体都需通过认证,且仅获得其指定任务所需资源的访问权限,银行会监控并控制智能体与集团信息系统的连接及交互。
集团其他业务也在使用相关技术,支付账户业务Nickel的Nickel Assist以Gemini为基座模型,帮助200名客户顾问依据流程与操作指南答复客户请求。
UiPath发布Autopilot与Cartographer,把智能体能力铺到自动化测试与流程洞察
平台:Futurepedia | 日期:2026-09-23
UiPath发布多项AI能力:Autopilot为自主测试执行提供AI助手,Cartographer把流程知识转化为可操作的业务洞察,新推出的自主探索能力让智能体自动探索应用并报告潜在问题,另有面向AI应用与智能体的语义化验证功能,用语义与AI方式评估AI应用及智能体是否按预期工作。
该组能力面向企业自动化团队,目标是把测试设计、执行与问题发现从人工脚本转移给智能体,同时为后续流程改造提供依据。
技术与应用
苹果开源LensVLM-9B:可扫描压缩图像文本并选择性展开相关页面
平台:Hugging Face / Agentic AI News | 日期:2026-09-24
苹果发布开源视觉语言模型LensVLM-9B,该模型能够扫描经过压缩的图像化文本,并借助学习到的工具选择性地展开相关页面,面向长文档与图像化资料的理解场景。模型已上线Hugging Face,采用9B参数规模,可作为本地部署的文档理解基础组件使用。
英伟达发布Nemotron 3 Diarization:流式输出最多8名说话人标签
平台:Hugging Face / My AI Guide | 日期:2026-09-24
英伟达发布Nemotron 3 Diarization说话人分离模型,可流式输出最多8名说话人的标签,基于NeMo构建并集成Transformers生态,支持本地语音智能体与多方会议录音处理。该能力补齐了实时语音链路中的"谁在说话"环节,可与语音识别、语音合成模块组合成完整的端侧会议与客服方案。
Convai Innovations开源Laya:421M参数、33毫秒完成System 1决策
平台:魔搭ModelScope社区 | 日期:2026-09-22
Convai Innovations开源非自回归System 1决策模型Laya,面向分类与决策任务,用于从文本中快速识别类别、风险等级和处理优先级。与逐字生成回答的通用大模型不同,Laya直接输出判断结果及对应概率,因此可在33毫秒内完成一次决策推理,参数量为421M。
官方称其速度约为同类决策引擎Jev的四倍。开源不到两天,Laya已升至Hugging Face热门模型榜第三名,GitHub获得2.1k Stars。
Qwen-Image-2.1开源:7B生图编辑一体,原生支持透明图与最多10张参考图
平台:魔搭ModelScope社区 | 日期:2026-09-22
Qwen团队开源Qwen-Image-2.1,把文生图与图像编辑统一在同一模型内。模型视觉生成部分仅7B参数,采用32层Single-Stream DiT结构,在官方Qwen-Image-Bench公开评测中获得60.28分,原生支持透明图生成与最多10张参考图的编辑能力,可直接用于需要图层留空、多图融合的商用设计流程。
HyperFrames联合DeepMind与Kaggle发布Code2Video Bench
平台:HeadsUpAI | 日期:2026-09-22
HyperFrames与Google DeepMind、Kaggle联合发布Code2Video Bench,用于评估AI智能体把提示词转成动态图形的能力。该基准使用专用裁判模型对168份人工撰写的创作brief从时间节奏、视觉工艺等五个维度打分,填补了代码正确性与专业动效设计质量之间的评测空白,为智能体在视频与动效生产链路上的能力提供可比口径。