基于 Mollick 的三篇 AI 使用指南 [1]-[3],我们可以了解过去一年左右 AI 使用的主要变化,这也是本文的第一部分内容。不过,他的观察视角也比较明显:面向的是能够方便使用”御三家“(OpenAI、Anthropic、Google)的产品,也愿意为高级功能每月支付约20美元的普通用户,而且他们关注的主要也是当前最先进的闭源模型及其产品。
相比之下,对于中国的普通用户来说,使用体验会大为不同。一方面,是御三家的产品会有不同程度的访问和支付门槛;另一方面,过去一年中国本土的模型与AI产品发展迅速,与最先进模型的差距已经明显缩小。如 DeepSeek、千问、Kimi 等模型及相关产品,已经能够满足大量日常乃至专业需求。
另一个颇具特色的现象是,中国有多家厂商发布了性能相当不错的开放权重(open-weight)模型,这形成了和美国主流厂商以闭源模型为主颇为不同的生态。中国模型及产品的使用,是本文第二部分内容。
还有一个较为小众但值得关注的方向:本地模型。很早就有人尝试在手机和个人电脑上部署大语言模型。其中一个核心需求是隐私——如果想用 AI 分析个人的日记或笔记,不是所有人都愿意将这些内容上传到云端。
但由于个人设备的算力和内存极为有限,只能加载明显较小的模型,其能力长期明显逊于云端模型。这种状态下,即使使用本地模型+本地文件搭建起个人知识库,实际体验也往往不尽如人意。
随着小型模型的改进,量化和本地推理技术的进步,这种情况正在改变。Google 今年4月发布的 Gemma 4 系列模型已经能够在个人电脑上达到不错的能力及速度。我们可以期待未来在自己电脑上也能运行更为智能的模型。本地模型正在从一种“可以实现但未必值得使用”的技术方案,变成真正实用的选择。本地模型的使用,是本文的第三部分内容。
1. AI 工具使用的变化
根据 Mollick 的三篇指南,AI 工具使用的变化可总结为下面的表格:
| 2025.06 | 2026.02 | 2026.07 | |
|---|---|---|---|
| AI 的基本形态 | 聊天机器人 / 多模态助手 | 智能体系统开始成熟 | 智能体系统成为工作的核心 |
| 基本交互单位 | 对话(conversation) | 任务(task) | 数小时的工作(hours of work) |
| 人的角色 | 提供 context、对话、修改 | 分配任务、观察、引导 | 委派、检查、纠正、授权 |
| AI 的角色 | 回答、研究、生成内容 | 使用工具完成任务 | 使用“电脑”持续完成复杂工作 |
| 提示词的重要性 | 已明显下降 | 你不仅仅在提示,还在管理 | 更像给人下达工作要求 |
| 深度研究 | 核心高级功能 | 已成为众多工具之一 | 深度研究成为智能体能力的一部分 |
| 文件 | 上传给 AI 作为 context | AI 读写文件 | AI 直接操作大量本地文件 |
| Code | AI 可以生成/执行代码 | coding agent 能独立开发 | Codex/Claude Code 成为通用工作 agent |
| 最大风险 | 幻觉 | 智能体的安全与权限 | permission、prompt injection、真实世界 action |
| Mollick 的核心建议 | 和 AI 一起工作 | 让 AI 去做工作 | 像管理人一样管理 AI |
而透过上述细节,我们可以发现近一年 AI 工具的几个重要变化。
交互模式
用户使用 AI 时,基本交互模式的转变是:多轮对话(Conversation)→ 任务(Task)→ 委派工作(Delegated Work)。
这一转变也蕴含着其他一系列变化:
人的角色:对话者/合作者 → 委派者 → 管理者
AI 自主性:低 → 高
提示词使用:提示词工程(Prompt Engineering)→ 指令(Instruction)→ (像员工一样)管理
随着模型能力提高和智能体系统逐渐成熟,普通用户需要直接关注的技术细节正在减少。相比反复比较具体模型,用户越来越可以把注意力放在手头的任务和需求上。一般来说,简单的问题/任务,主流 AI 产品的免费默认模型已经足够;对于具有一定复杂度的严肃工作,可以考虑委派给自己信任的智能体系统。
提示词的重要性也在下降。在更早的生成式 AI 使用中,用户常常需要仔细调整提示词。其中还伴随着选择合适的模型、提供详细的 context,经过多次追问、修改,得到所期望的结果。由于 prompt 极为重要,那时还流行一个概念是提示词工程(prompt engineering)。
现在,重点不再是你自己要写出精妙的提示词,而是表达清楚自己的需求,并在必要时纠正 AI 给出的结果。值得注意的是,用户仍然需要通过提示词向 AI 表达需求。变化在于,我们越来越不需要掌握一套专门“说给模型听”的提示词技巧,而可以像向一个人交代工作一样,用自然语言说明目标、背景、约束和预期结果。
上述交互模式能够实现,一个重要基础是,决定 AI 实际能力的层次在上移。Mollick 将其描述为:Model → App → Harness。过去,用户的关注点集中在底层模型的性能;现在,对于复杂任务,模型之上的 harness——它能调用什么工具、访问哪些文件、是否拥有终端或浏览器、能够执行哪些操作——越来越能决定实际使用体验。
从”生成“到”完成“
更早的时候,我们通常期望从 AI 那儿拿到一个东西(artifact),比如一个回答、一段代码,或者一个视频,本质上是让 AI 快速生成一个结果(即生成式 AI)。
智能体系统则把重点从“生成什么”进一步推向“完成什么”:用户给出最终目标,AI 自行规划并执行实现目标所需要的一系列步骤。
现在的计算机使用(computer use),使得 AI 有权限去操作鼠标、浏览器、读写文件等,于是 AI 能完成的事情比原来要广泛、深入和完整得多。
对于文件的使用已经有了明显变化。最开始,文件是作为上下文(context)传给 AI,直到现在依然可以如此使用。即上传一个文件,然后对这些文件进行提问。之后,用户可以把多个文件上传到一个工作空间(Workspace),发出一个指令,如:从这些 PDF 文件中提取公司A修改的销售数据,保存到一个 Excel 文件,并以此生成总结。
再后来,用户可以让智能体读取某个本地目录下的文件(此时,该目录成为一个 Workspace),然后发出指令,如 Mollick 把自己的完整书稿 PDF 交给 Codex,让它帮自己检查书中的 reference 问题。
随着 AI 获得更多工具,并被允许访问文件、浏览器乃至其他外部系统,它能够完成的工作越来越多。不过,颇令人警惕的是这种变化带来明显的安全性问题。
AI 的安全性
之前,在多轮对话模式下,我们担心 AI 给出的回复有幻觉,即”一本正经地胡说八道“。
目前人们对于 AI 幻觉的抱怨似乎少了不少。一方面,模型在很多任务上的可靠性确实有所提高;另一方面,人们可能也已经接受了 AI 难免有幻觉这一事实。
不过在传统对话模式下,错误信息通常还需要经过人的判断和操作才能进一步作用于现实,因此中间存在一道人工核查的缓冲。但在智能体系统之下,AI 的自主性和获得的授权高了许多,而它潜在的危害性也高了许多。
比如,如果你让 AI 根据邮件历史记录给自己的老板或客户发送一封邮件,你敢让 AI 自动把邮件发送出去吗?或者如果 AI 有修改本地文件的权限,你敢把重要目录的权限开放给它吗?
前后这两种风险可分别描述为”说错话“与”做错事“,两者的风险机制不同。”说错话“虽然也可能会有严重后果,但在传统对话模式中,AI 输出通常还有人工核查才能进一步作用于现实。而智能体获得执行权限之后,错误判断可能直接转化为错误操作,并作用于现实。
Mollick 对此给出的原则是:对任何发送、支付和删除操作,都应保留人工审批(approval)。
2. 中国的模型及产品
如何选择模型
目前中国模型与最先进模型已经相当接近,但到底处于什么位置、差距有多少很难简单衡量,Arena Leaderboard [4] 是一个很直观的参照。
从整体排名来看,如 Kimi K3、GLM 5.3、Qwen 3.8 这样的模型,排名已经相当靠前。这个榜单反映的是用户偏好,因此不能完全对应到准确性,但通常来说,能帮助判断出一个模型的大致位置。
或者说,模型自身的排名是10还是20,往往说明不了太多问题,但可以看它后面有哪些主流模型。如 Kimi K3 排名第10,它之后有 Opus 5 Max,Gemini 3.1 Pro,ChatGPT 5.6 Sol,那么可粗略认为:在 Arena 所衡量的用户偏好上,K3 与后面这些模型处于相近的竞争区间。
同时,由于中国用户更多处理中文内容,在这一点上,中国模型可能具有一定的优势 [5]。
当前根据这个榜单可以判断,最先进的美国闭源模型在不少复杂任务上仍有优势,但中国模型也已经有相当的竞争力。
对于大量普通用户的日常任务,国内模型或许已经完全“够用”。但到底怎么样才算“足够好用”是很主观的,只能由我们自己去仔细对比才能判断。
开放权重模型
中国模型的一大特点是,出现了一批性能很强的开放权重模型。Nathan Lambert 此前统计的数据显示 [7],在 Hugging Face 上,中国开放权重模型的累计下载量已经超过了美国模型(如 Llama、Gemma、gpt-oss 等)。国内厂商为何如此积极地走开放权重模型这条路,背后涉及商业竞争、开发者生态、后发厂商的市场策略等多种因素,此处暂不展开。
长期以来,人们习惯用“开源模型”和“闭源模型”来区分模型。严格来说,这种说法并不准确。真正的开源,通常还涉及开放训练数据、训练代码、训练过程,而目前的“开源大模型”,多数开放的是模型权重。当然,仅仅开放权重也已经极好了。
开放权重模型常常声称价格低廉,如果看 token 单价,这很可能是真的。但对普通用户来说,最重要的还是完成同一项工作的总成本。在使用智能体时,一个单价便宜的模型完全有可能:消耗更多 token;速度更慢;质量略低,而在长时间、多步骤的智能体任务中,很小的能力差异也可能随着步骤增加而不断累积。因此,比起每百万 token 的价格,完成一个任务的实际成本(cost per task)可能是更有意义的指标。
AI 产品
按 QuestMobile 的数据 [6],截至 2026 年 6 月,中国 AI 原生 App 整体月活已经约 4.99 亿;其中豆包约 3.82 亿、千问约 1.67 亿、DeepSeek 约 1.29 亿,这三个是当前用户量最多的。
可以看到这和前面在 Arena 榜单上看到的先进模型很不一样,这并不很奇怪:让用户做出最终选择的往往不是底层模型,而是产品。响应速度、多模态能力(图片、音频、视频等)、联网搜索、与其他应用的整合(邮件、云服务等),以及用户当前的操作习惯,很多因素都会影响到用户选择。
再一次地,回到了 Mollick 所说的 Model → App → Harness:对于普通用户,决定实际使用体验的越来越不是单独的模型,而是建立在模型之上的整个产品和系统。
3. 本地模型
为何使用本地模型
看前面两部分内容,市面上已经有了许多不同模型和产品可用,那为什么还要考虑本地模型呢?
最核心的考虑还是隐私。一般的工作文档、公开资料,我们可以放心地上传到 ChatGPT 或千问等云端 AI。但对于个人,如果想让 AI 长期阅读自己的日记、笔记之类的内容,不是所有人都愿意将其上传到云端;对于某些公司来说,数据本身就是重要资产,甚至构成其核心壁垒,也不会轻易把数据上传到外部服务。
模型在本地运行时,没有网络也可以使用;没有 token 计费问题。
说起来,也是因为有人在持续发布和改进开放权重模型,才使得在个人设备上运行本地模型成为可能。
从可用到好用
早几年就可以做到:下载模型 → 量化 → llama.cpp → 本地运行 → 接入自己的文档。
问题在于个人设备和服务器的硬件差距太大,尤其是大语言模型对内存/显存需求极高,结果是个人电脑上只能运行非常小的模型。所以常见的结果是:
花了很长时间搭建了一个“纯本地知识库”,或“second brain”,然后发现——有时的确能用个人文档回答问题,但也有很多时候效果比 ChatGPT 差太多,很快就放弃。
但仍然有人持续在做本地模型的改进,Google 在2026年4月发布了 Gemma 4,就我自己的体验而言,是我第一次感觉到,本地模型在速度和能力上都相当不错了。而最近刚刚发布的 Qwen 3.8 可能还会更好。
这些改变的基础包括:量化(quantization)技术,大幅降低了模型占用的显存、内存及存储空间;GGUF 等格式已经形成成熟生态;本地运行工具越来越成熟。
本地运行工具
这样的工具有很多,这里仅仅提三个比较常见的:
Ollama:适合喜欢用命令行/API,把本地模型接入其他程序的人。
LM Studio:更适合希望通过 GUI 下载、管理和运行模型的用户。
llama.cpp:更底层,也是整个本地推理生态的重要基础。
简单总结一下。目前的本地模型,仍然与先进的云端模型有明显差距,如果是完成复杂研究、编程或长时间的智能体任务,云端模型是更合适的选择。但不可否认,本地模型比一年前已经有了很大进步,对能力要求没有那么极端,同时特别看重隐私、成本或控制权的任务,本地模型已是值得考虑的选项。
和本文前面的场景类似,建议仍然是:最核心的问题不再是“哪个模型最强”,而是“对于我手头的任务,哪个模型/产品最合适”。
参考资料
[1] Ethan Mollick, An opinionated guide to which AI to use to do stuff, 2026-07-24. https://www.oneusefulthing.org/p/an-opinionated-guide-to-which-ai-b22
[2] Ethan Mollick, A Guide to Which AI to Use in the Agentic Era, 2026-02-18.https://www.oneusefulthing.org/p/a-guide-to-which-ai-to-use-in-the
[3] Ethan Mollick, Using AI Right Now: A Quick Guide, 2025-06-24.https://www.oneusefulthing.org/p/using-ai-right-now-a-quick-guide
[4] Arena, Leaderboard Overview. https://arena.ai/leaderboard
[5] Arena, Text Arena Chinese. https://arena.ai/leaderboard/text/chinese
[6] QuestMobile, QuestMobile 2026年AI应用市场发展半年报, 2026-07-14. https://www.questmobile.com.cn/research/report/2076954943839809537
[7] Nathan Lambert, Introducing our Artifacts Hub and Adoption Dashboard, 2026-08-03. https://www.interconnects.ai/p/introducing-our-artifacts-hub-and
夜雨聆风