ARTICLE · 1113662
个人 AI 助手的胜负手,居然不是模型能力
个人 AI 助手的胜负手,居然不是模型能力9 月 29 日 DevDay 一小时内发布二十多项内容,但最受关注的几项(dots、插件、跨应用配额)都不是模型。 模型正在变成入场券:GPT-6 Sol 上线 9 月 22 日,一周后就有 GPT-6.1 Sol,价格约为 Astra 的五分之一——能力会被追平,成本下降更快。 一家第三方评测按价格、欧洲可用性、审批机制、密码处理、过往记录五项打分:Muse 3.6、Grok Bot 3.4、dots 3.2——没有一项打分是「模型能力」。 真正的胜负手是三件事:入口与分发、信任的默认设置、连续性与成本。 
过去两年,我们讨论 AI 助手时的默认姿势是比模型:谁跑分高、谁上下文长、谁推理强。 但 9 月 29 日那场 DevDay,值得回味的恰恰是另一件事——一小时内发布二十多项内容,最可能决定胜负的那几项,没有一项是模型。 常驻智能体 dots、能装进侧边栏的插件、跨 18 家合作产品通用的登录与配额、跑在 AWS 里的托管智能体……这些动作指向的是入口、身份、分发和成本。 一个有点反常识的判断正在形成:在个人 AI 助手这场竞赛里,模型能力是入场券,不是护城河。
最直接的信号来自价格和时间。 GPT-6 Sol 在 9 月 22 日上线,一周之后的 DevDay 上就迎来了 GPT-6.1 Sol——官方称其智能水平接近 Astra,而输入与输出 token 定价约为 Astra 的五分之一。 这不是一次常规升级,它说明两件事: 第一,能力差距的窗口期在急剧缩短。一家发布新模型,对手跟进的周期已经以周计。 第二,成本下降的速度快过能力提升的速度。当价格降到五分之一,「能不能一直开着它」就不再是技术限制,而变成产品选择。 对普通用户来说,这意味着:未来两年你换 AI 助手的理由,很可能不是「那个更聪明」,而是「那个更便宜、更顺手、更让我放心」。 先看一个容易被忽略的数字。 据公开报道,Meta 的 Muse 在上榜美国应用商店后,超过 95% 的用户同时也是 Facebook 用户,63% 同时是 Instagram 用户。它还能直接嵌进 WhatsApp 对话里。 Meta 不需要去找用户,用户本来就在它的应用里。这是其他公司花多少钱都买不到的东西。 OpenAI 的应对是同一逻辑的另一面:官方称 ChatGPT 周活跃用户已达 12 亿、接入企业 250 万家。DevDay 上把插件做成「侧边栏里的完整应用」(演示名包括 Canva、Figma、Shopify),并推出跨 18 家合作产品的「Sign in with ChatGPT」——让你的套餐额度跟着你走到 Devin、Notion、Vercel 等其他工具里。 亚马逊更进一步:推出由 OpenAI 驱动的 Bedrock 托管智能体,让这些智能体直接跑在 AWS 里。 这些动作的共同点是:它们都在把 AI 塞进用户已有的路径里,而不是说服用户打开一个新 App。 模型决定它能否回答问题,入口决定用户会不会想起它。 一家第三方评测机构在 2026 年的智能体汇总中,给十二款产品按五项打分(满分 5 分):价格、欧洲可用性、审批机制、密码处理、过往记录。 结果是:Muse 3.6,Grok Bot 3.4,dots 3.2,Claude 与 Alexa+ 同为 3.8。 请注意这五项里,没有一项是模型能力。决定综合排名的,是「贵不贵」「能不能用」「关键动作要不要我点头」「我的密码怎么存」「你以前出过什么事」。 (这是该机构基于公开信息的主观判断,且带有欧洲视角,仅作参考。) 这与产品动作互相印证:Muse 把执行环境放在隔离的虚拟机里,强调看不到你的真实密码与支付信息;dots 则默认关闭,企业版本需要管理员主动开启,要操作本地设备必须获得授权。 一边是把安全做成默认可用的体验,一边是把安全做成默认收紧的开关——两条路线都能成立,但用户会用脚投票。 而公开报道里的几次事件提醒我们这道坎有多现实:Muse 曾因未表明身份被 Amazon 拦截,并有用户反映未经询问分享住址;早期的 Instinct 出现过邮件未确认即发送、授权断开后数据副本残留等问题。 模型可以被追平,一次信任事故留下的印象很难被抹掉。 第三个胜负手,是「它能不能一直在」。 dots 最值得注意的细节不是它会干活,而是连续性:一个在 ChatGPT 里开始的项目,可以在 Slack 对话里接着往下做,不需要重新交代背景。这解决的是 AI 助手最大的隐痛——每次都要从头讲一遍。 另一个方向是成本能否支撑「一直开着」。DevDay 上 Codex 全面转向云端运行,意味着你的电脑不再需要保持唤醒状态等待长任务结束;可复用的开发环境让任务可以立刻启动。 连续性决定你愿不愿意每天用它,成本决定你能不能一直让它开着。这两件事,模型跑分表里都不写。 如果是选产品,建议把判断顺序倒过来: 先看入口:它能不能出现在你已经每天打开的地方?需要你额外打开一个 App 的产品,使用频率会持续衰减。 再看默认设置:关键动作要不要你确认?凭证怎么存?出问题有没有公开说明? 最后才看模型:只要能力在同一梯队,它对日常体验的影响,通常小于上面两项。 如果是做产品,值得警惕一个误区:把资源全押在「模型更强」上。更稳的组合是三件事——把 AI 放进用户已有的路径、把安全做成看得见的默认、把成本降到「可以一直开着」。 国内的情形也类似:模型供给越来越充足之后,竞争会快速转向入口、合规与用户习惯。
两年之后回看这段时期,人们大概率不会记得某一代模型的跑分。 会被记住的是:谁先把 AI 放进了人们本来就待着的地方,谁先把安全做成了默认,谁先把价格降到了可以随时开着的程度。 模型是入场券——没有它你上不了桌,但只有它,你也赢不了。 真正决定胜负的,是那些不那么性感的东西:入口、信任、连续性,以及成本。 下一次看到某个 AI 助手宣称「我们更强了」,不妨多问一句:然后呢?它出现在哪儿?我能放心吗?我一直开着它要花多少钱?
互动时间:你选 AI 助手时,第一看重的是什么——聪明、便宜、还是放心?评论区聊聊你的排序。 关注我,后续跟进 dots 的实际体验与各家的权限设置实测。
Q1:为什么说模型能力不是个人 AI 助手的胜负手?因为模型能力正在快速趋同且成本下降更快:GPT-6 Sol 于 9 月 22 日上线,一周后 DevDay 即发布 GPT-6.1 Sol,智能水平接近 Astra 而定价约为其五分之一。当能力差距缩小,竞争会转向入口、信任、连续性与成本。 Q2:第三方评测如何给智能体打分?SproutMedia 在 2026 年的汇总中按价格、欧洲可用性、审批机制、密码处理、过往记录五项(满分 5 分)评估,Muse 3.6、Grok Bot 3.4、dots 3.2。五项中不含模型能力,且带有欧洲视角与主观判断,仅作参考。 Q3:什么是「入口」优势?指产品能否出现在用户已有的日常路径中。例如 Muse 可嵌入 WhatsApp,且据公开报道其超 95% 用户同时是 Facebook 用户;OpenAI 则通过插件侧边栏与跨 18 家合作产品的登录配额,把 ChatGPT 变成入口层。 Q4:普通用户该如何选择 AI 助手?建议把判断顺序调整为:先看入口(是否已在你的日常路径里),再看默认安全设置(审批、凭证、事故处理),最后才看模型能力是否在同一梯队。
本文要点(30 秒版)
