乐于分享
好东西不私藏

AI科技圈综述:长上下文普及、端侧智能升维与数据权属厘清(2026年8月27日)

AI科技圈综述:长上下文普及、端侧智能升维与数据权属厘清(2026年8月27日)

一、长上下文窗口成为基座模型标配

【新闻】8月26日,阿里巴巴 Qwen 团队发布 Qwen3.8-Flash-Next,以开源权重预览将支撑 Qwen4 的架构:总参数 125B、每 token 仅激活 6B,原生上下文长度 262,144 token 并可进一步扩展。同日 IBM 发布企业级开源模型 Granite 4.2(覆盖 3B、8B、30B),全系采用 Apache 2.0 协议,旗舰 30B 内置原生思维链并支持 512K 超长上下文窗口。Google Gemini 3.7 Flash 已正式 GA,具备 1,048,576 token 输入上限。NVIDIA 本地模型线(DeepSeek-V4-Flash、Nemotron 3.5 Lightning)亦普遍配备百万级上下文。

【专业分析】上下文长度正从差异化卖点退变为入场门槛。百万级窗口使整本合同框架、全年技术支持工单或整套技术文档可纳入单一上下文,直接改变了检索增强生成(RAG)的范式:Mistral Agentic Search 等长文档迭代检索层不再依赖固定 top-k 切块,而是让模型自行搜索、检视、导航并核验长文档。但长上下文同时放大 KV 缓存的显存与成本压力,并对注意力在超长序列中的退化提出新的工程约束,厂商多在上下文长度与每 token 成本之间做显式权衡。

二、端侧智能体迈入常驻运行

【新闻】Liquid AI 于 8 月初发布 LFM2.5-2.6B,一款 26.9 亿参数的开放权重模型,集成 128K 上下文与原生函数调用,内存占用低于 2.5GB,在 Apple M5 Max 上解码速率约 220 token/秒,可在手机、笔记本电脑、树莓派等设备上运行完整多步智能体工作流。苹果 8 月 26 日发布搭载 M6 与 M5 Pro/Max/Ultra 的新款 Mac mini 与 Mac Studio,M6 为苹果首款 2 纳米芯片,AI 性能最高达 M4 版的 4 倍。英伟达推出 Jetson Orin Nano 2,同尺寸下推理性能约翻倍、同性能 15W 模式功耗降低约四成。Exo 宣布与苹果合作基于 Thunderbolt 5 的低延迟 RDMA,多台互联 Mac 可以 API 速度运行 Kimi K3、GLM-5.3 等大模型。

【专业分析】端侧化的核心价值在于数据不出设备、边际推理成本趋近于零,契合 GDPR 与涉密、医疗、国防等强监管场景,也使高频工具调用与文档处理在经济上可行。但 LFM2.5-2.6B 的模型卡明确将其定位为隐私敏感型自动化层,不建议用于专业编程或知识密集型任务;手机端约 30 token/秒的速率也限制了复杂交互。端侧智能体是云优先智能体的互补而非替代,部署时应按数据主权与任务复杂度分层。

三、开源权重密集上新且转向可治理

【新闻】Qwen3.8-Flash-Next 以开源权重预览下一代架构,被视为迈向终极成本效率的一步。IBM Granite 4.2 全系 Apache 2.0,并对企业合规性做深度数据清洗与治理验证,原生支持工具调用。SandboxAQ 于 8 月 26 日开源 Switch,将基于不同框架构建的 AI 代理接入员工已在使用的 Slack、Microsoft Teams 或 Discord 频道,把聊天频道转变为人与代理共享同一上下文、资源与历史的协同"房间",代码免费公开。

【专业分析】开放权重的竞争焦点已从"能否在本地跑起来"转向"是否可治理、可编排"。企业级开源模型把合规数据清洗、原生工具调用、思维链机制作为卖点,反映出采购方对可审计、可验收的要求上升。但需注意许可差异:Granite 4.2 为宽松 Apache 2.0,而 Qwen3.8-Max 等采用带营收门槛的自定义许可,部分海外模型(如 MiniMax H3)明令排除美欧商用。商用前须逐一审视许可条款与营收阈值,避免合规误判。

四、自研推理芯片规模化挑战英伟达

【新闻】OpenAI 于 8 月 25 日公布首款自研推理芯片 Jalapeño 的性能数据:在 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T 等负载上,报告每瓦工作量达对比系统的 1.5–1.9 倍、端到端延迟降低 1.7–3.6 倍,由 Broadcom 协助开发。AMD 推出 Helios 机架级平台(72 块 MI455X 加速器搭配 EPYC CPU 与 AMD 组网),称在特定负载上每美元推理 token 较 Vera Rubin NVL72 高约 30%;Meta 计划大规模部署 AMD 方案,OpenAI 预计 2026 年底上线 Helios。专用芯片初创 Etched 估值约 210 亿美元,称以 44 天完成推理负载落地。

【专业分析】推理成本与响应延迟已成为算力竞争的主战场,自研芯片叠加机架级系统正从"实验"走向"规模化部署"。但英伟达的 CUDA 软件生态、组网能力与多年开发者积累仍是切换壁垒,Bloomberg Intelligence 仍预测其保留至少七成训练市场份额。AMD 2026 年股价涨幅约 125%、估值溢价已隐含高预期,投资者应区分厂商标称上限与普适均值,以自行复测结果为准。

五、具身智能竞争重心转向数据基建

【新闻】Figure 发布 Index:号称迄今最大、最多样的机器人数据集,含 1600 万条机器人视频,并推出用户录制日常任务获取报酬的计划。Skild 发布基础模型 S1,看一段视频、无需微调即可执行预训练未见过、最长约 10 分钟的新任务。国内方面,觅蜂科技完成数亿元融资,核心用途为建设无本体数据采集硬件 MEgo 系列的量产,推动千万小时级物理交互数据产能落地;西湖机器人半年内完成四轮共 5 亿元融资,投向人形机器人全身统一大模型。

【专业分析】具身赛道资本逻辑已从"拼本体硬件"切换到"大脑+数据"双核心,高质量物理交互数据成为稀缺资源,数据焦虑推动资金涌向此前受冷落的数据采集、治理与评测环节。但行业现状是:人形机器人订单仍以科研与示范采购为主,大规模市场化付费场景尚未成型,评价标准已从运动参数转向任务完成率、人工干预率与长时运行稳定性。后续资金会向实际交付能力更强的企业聚拢,纯炫技路线估值承压。

六、数据权属诉讼与执法并行升温

【新闻】欧盟《人工智能法案》自 8 月 2 日起主要规则适用,透明度义务(交互式 AI 须披露身份、生成内容须附机器可读标识)即时生效,高风险系统义务延至 2027 年 12 月 2 日与 2028 年 8 月 2 日;法国 CNIL 已向 14 家使用信贷评分算法的金融机构发出技术文档质询,三家延期请求被拒。中国方面,网信办自 7 月 15 日伴侣 AI 新规生效三周内开出 12 张罚单、合计约 420 万元;wikiHow 起诉 OpenAI 未经许可抓取超 1.1 万篇文章训练 GPT,主张至少 1200 项版权;阿拉巴马州就 Hugging Face 黑客事件传唤 OpenAI。最高人民法院披露,2025 年全国法院审结涉数据权属及交易纠纷 908 件,同比增长 25.6%。

【专业分析】全球 AI 治理已分化为"三速":欧盟主动执法、中国垂直精准罚款、美国联邦层面搁浅而 14 个州各自立法。跨境经营企业无法用一份合规文件覆盖所有市场,须按业务所在地与风险等级分别确定备案、评估、披露与证据留存安排。训练数据的合法来源、授权依据与清洗过程从原则性承诺转向可追溯管理,生成内容标识与过程记录(提示词日志、版本文件、时间戳)将成为权利归属与责任划分的关键证据。

综合研判

【综合研判】本日主线可概括为"能力下沉、治理上浮"。能力侧,长上下文、端侧常驻智能体与开放权重可治理化三者叠加,把前沿能力从云端数据中心下沉到消费级硬件与企业内网,推理成本与延迟的下降正在打开高频、隐私敏感场景的实用空间;算力侧,自研推理芯片与机架级系统的规模化,标志竞争从训练扩展转向推理效率,英伟达的护城河仍在软件生态而非单点性能。治理侧,欧盟执法、中国罚款与数据权属诉讼同步升温,合规从政策研究真正转入产品与业务流程,成为模型采购、部署与退出的常态化约束。对工程与采购的启示:其一,长上下文与 RAG 须重新设计,避免盲目堆长度而忽视 KV 成本;其二,端侧智能体应按数据主权分层部署,不以其替代云端高密度推理;其三,开源选型须把许可条款与营收门槛纳入尽调;其四,跨境 AI 产品需建立分市场合规清单,将备案、标识与过程留痕前置到上线前。