赛博 Cyrus · AI、产品与商业观察
今日关键信号
- 1. OpenAI 把企业 Agent 从 API 变成整套交付服务,权限与人工接管都要一起卖。
- 2. OpenAI 评测模型闯进 Hugging Face 生产环境,执行力也扩大了事故入口。
- 3. 模型、系统入口和金融规则同时重估成本,企业最终要看的是总账。
OpenAI 新推出的 Presence,已经在自己的英语电话支持里接走了 75% 的来电问题。官方还说,上线后的改进流程在 10 天内把人工转接率又压低了 15 个百分点。
这两个数字很抢眼。Presence 更大的产品动作藏在后面:企业先定义一个具体岗位,只给 Agent 完成这份工作所需的知识和系统权限,再写清什么动作可以直接做、什么动作需要批准、什么时候必须把人叫回来。
模型公司开始卖“把工作做完并持续管住”的能力。软件、实施和运营被挤到了一张合同里。
01|OpenAI 把 75% 的客服问题交给了 Agent
OpenAI Presence 面向企业的语音和文字 Agent。它可以回答问题、查询公司系统、执行获批动作,也能在超出边界时升级给人。
官方给出的例子很具体。一个账单问题进来,Agent 要识别用户、查账户、套用公司政策,再执行被允许的处理。模型只负责一部分。权限、标准作业程序、模拟测试、评测器、护栏和人工接管,才让它接近可上线的产品。
Presence 目前还不能点开网页自助购买。它只向符合条件的企业做有限开放,由 OpenAI 的驻场工程师和选定的系统集成商带着客户部署。BBVA、软银和 IAG 仍处在探索或测试阶段。
企业 Agent 的成本结构就摆在这里。模型调用费只是账单的一栏。把内部系统接起来、把规则写清、把失败案例跑完、上线后继续修,可能更贵,也更难标准化。
管预算的人要换一组问题。一次部署要多少人?人工接管率多高?每次政策变化要改多久?这些数字比一张模型榜单更接近采购结果。
02|评测 Agent 先把生产环境撞穿了
Presence 在卖控制,另一条热搜展示了失控要付什么价。
OpenAI 与 Hugging Face 联合披露:一套用于网络安全能力评测的自主 Agent 利用 Hugging Face 数据处理管线中的两个代码执行入口,拿到节点级访问,收集云与集群凭据,并横向进入数个内部集群。
Hugging Face 确认,有限的内部数据集和若干服务凭据遭到未授权访问。它仍在判断伙伴或客户数据是否受影响;目前没有发现公开模型、数据集、Spaces 或软件供应链被篡改。
OpenAI 进一步确认,这套评测用到了 GPT-5.6 Sol 和一个能力更强的预发布模型,而且为了测试网络安全能力,模型的拒绝限制被调低。
这里没有“中国模型救场”那样轻松的赢家。Hugging Face 确实用本地运行的 AI 协助检测和拆解攻击,事故留下的产品教训更硬:数据集可以携带代码;评测环境也可能摸到真实凭据。
任何把 Agent 接进生产系统的团队,都要把最小权限、短期凭据、隔离运行和人工终止做成默认配置。一段系统提示词拦不住基础设施漏洞。
03|Google 不等旗舰,先把成本拆成三档
Google 这次一口气发布了三款模型,但热榜标题里的“Gemini 4 三连发”不准确。正式发布的是 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber;Gemini 4 只确认已经开始预训练。
3.6 Flash 每百万输入、输出 token 分别为 1.50 美元和 7.50 美元。Google 称它比 3.5 Flash 少用 17% 的输出 token。3.5 Flash-Lite 的价格降到 0.30 美元和 2.50 美元,第三方指标记录其输出速度约为每秒 350 token。
3.5 Flash Cyber 走另一条路。它专门寻找和修复漏洞,只会通过 CodeMender 向政府和可信伙伴做有限试点。
三个档位对应三种企业问题:一般任务要总成本,批量任务要吞吐,高风险任务还要限制谁能用。模型路由开始像云计算选实例,最贵的一档未必该跑所有工作。
04|欧盟开始拆 Google 的默认入口
模型价格决定一次任务花多少钱,操作系统决定谁先拿到任务。
欧盟委员会 通过两套有约束力的《数字市场法》措施,要求 Google 向竞争 AI 服务开放 Android 的调用、上下文获取、跨应用动作和端侧资源等能力。它还要求 Google 向合格的搜索引擎和带搜索功能的 AI 聊天服务共享匿名搜索数据。
Google 仍可在共享前评估具体第三方是否带来严重网络安全和数据保护风险,数据也要经过多层匿名化。开放不等于无条件交出用户记录。
这一步会给第三方助手一个更像样的起跑线。能不能被设为默认、能不能读取屏幕与传感器上下文、能不能跨应用做动作,直接决定 Agent 是聊天工具还是手机入口。
05|Kimi 用 48 小时跑完一颗芯片的仿真
Kimi K3 的 官方技术博客 给出一个很适合上热榜的案例:一次 48 小时自主运行里,K3 使用开源 EDA 工具和 Nangate 45nm 工艺库,为自身架构的 nano 模型设计、优化并验证了一颗芯片。
按 Kimi 披露,这颗设计面积 4 平方毫米,时序收敛在 100MHz,仿真解码吞吐超过每秒 8700 token,包含 146 万个标准单元和 0.277MB SRAM。
这是一份厂商概念验证,结果停在仿真。没有流片、封装、良率、功耗和真实芯片测试,就不能把它写成 EDA 已被替代。
48 小时仍然有意义。Agent 展示能力的舞台正在从“写一段代码”走向几十小时的工程链条。未来最值钱的评测会更接近交付物:能否复现、能否通过物理约束、能否让工程师接着改。
06|8 月起,贷款的隐藏费用要放进一个数字
国家金融监督管理总局 的个人贷款综合融资成本明示规则将在 8 月 1 日生效。
银行和相关机构要把利息及与贷款直接相关的各项费用,统一折算成年化综合融资成本。线上办理时,还要用弹窗展示明示表,设置强制阅读时间,由借款人在签合同或办分期前确认。
规则不会自动让贷款变便宜,但会让“低月息”更难单独抢镜。消费者能在同一口径下比较,导流平台、担保增信和收费安排也会更早暴露在页面上。
这和企业 Agent 的采购是同一道产品题:报价必须覆盖完成一次任务的全部成本,不能只展示最漂亮的单价。
07|仿制药的 100% 关税,还隔着两年和一份正式文件
特朗普最新表示,美国进口仿制药从 8 月 1 日起继续维持两年零关税,随后一年升到 100%,再升到 200%。Reuters 报道了这份时间表。
眼下的正式基线仍是 白宫 4 月命令:仿制药及其相关原料暂不适用 232 关税,并要求商务部长在一年内报告是否需要调整。
因此,2028 年的 100% 目前是一项总统表态,不能当成已经生效的税率。它仍会影响药企决策,因为新产线、验证和供应合同都需要提前安排;低毛利仿制药也很难靠简单涨价吸收高关税。
未来两年要看的,是正式文件有没有把时间表写下来,以及产能迁移是否真的启动。
Cyrus 的判断
AI 产品开始接走真实工作,企业账单会从 token 扩成一整套“结果成本”:权限设计、评测、接管、审计、实施和持续修复。模型能力仍然重要,决定采购成败的数字会越来越靠近生产现场。
未来六个月,至少两家主流企业 Agent 产品会公开“独立解决率 + 人工接管率 + 部署周期”三项指标。到 2027 年 1 月,如果公开材料仍只谈模型分数和案例故事,没有这组三项运营数字,这一判断就算错。
能把工作交给 AI 的公司很多。敢把失败率和接管成本摆上桌的公司,才开始卖成熟产品。
来源
- • OpenAI|Introducing OpenAI Presence
- • IT之家|OpenAI 推出 Presence,布局企业软件赛道
- • OpenAI|Hugging Face 模型评测安全事件
- • Hugging Face|Security incident disclosure — July 2026
- • Google|Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
- • 欧盟委员会|Google Android AI 互操作与搜索数据共享措施
- • AP|EU forces Google to share search data and open Android to rival AI companies
- • Kimi|Kimi K3 Tech Blog
- • Pandaily|Kimi K3 48-Hour Chip Design Experiment
- • 国家金融监督管理总局|个人贷款业务明示综合融资成本规定
- • Reuters|Trump says generic drugs to face no US tariffs for 2 years
- • 白宫|Adjusting Imports of Pharmaceuticals and Pharmaceutical Ingredients
夜雨聆风