
AI 的使用上,经常能看到两种截然相反的评价:有人说 AI Agents 已经彻底改变了工作方式,一天都离不开;也有人试了两天后评价:“又傻又贵,还不如自己做。”
同样的工具,为什么体验差异会这么大?
很多人第一反应是模型能力的问题。国内的 AI Agents 在复杂工程能力上,确实和 GPT、Claude 还有差距。但我更倾向于认为,模型的重要性并不是决定性的。真正拉开体验差距的,是人与 AI 的协作方式。



这有点像搜索引擎刚普及的时候。有人觉得互联网是知识宝库,有人觉得全是垃圾信息。后来大家才意识到,搜索本身就是一种能力。我记得大学时甚至专门开过学术检索课。
AI 也是如此,只不过它考验的已经不只是某种单一能力,而是协作方式——或者说,如何建立合适的边界感。
01

需求要具体,指令要清晰
很多人第一次用 Agent,会希望它直接完成一个完整任务:“帮我做一个分析项目”“帮我写一篇报告”。
这种期待在人与人协作中都很难成立,更不用说 AI。即使是最强的模型,也往往会在“自由发挥”中跑偏,最后用户不满意,然后得出结论:“AI 不行”。
但 AI 更像一个实习生——有些模型像本科生,有些像研究生,有些甚至接近博士水平。在某些训练充分的场景里,好的模型确实可以一次性给出不错的结果,但这通常建立在任务本身足够清晰的前提下。
如果用户希望结果带有自己的风格或判断,那么“具体需求”就不可避免。
更准确地说,这里真正重要的不是方法,而是“问题本身是否被定义清楚”。在学术语境里,这更接近 idea,而不是 implementation。AI 可以解决方法,但前提是你要说清楚你到底想解决什么。
明确的需求 + 连续的小闭环,会让 AI 更接近真实工作流。一个系统从来不是一次形成的,而是在不断迭代中完成的。AI 在小任务中的表现,往往远比在开放大任务中稳定。
02

每个工作都有自己的上下文
部分人使用 AI 的方式就像每次重头来过:反复介绍项目背景、数据来源、分析逻辑。而 AI 始终停留在“初入职场”的状态。
但用得好的人,会主动经营上下文:维护项目日志、整理规则、沉淀流程。更不用说现在很多桌面级 AI Agents 已经支持 Memory 机制,像Qoder甚至会为每个项目构建 wiki 知识库。
当这些基础设施建立起来之后,AI 面对的就不再是一片空白,而是一个持续生长的工作环境。
03

AI 并非万能,要理解它的边界
有经验的人不会无限信任 AI,而是非常清楚什么时候该停。
写代码时会说:“不要改接口”“不要动其他模块”“只改这个文件”。做分析时会限定范围:“只看这一部分数据”“不要引入额外假设”“结论必须能被数据直接支持”。
这些约束不是在限制 AI,而是在缩小问题空间。边界越清晰,结果越稳定。
同样是用 AI 做 PPT,有的人做出来内容完整、有逻辑、有“人味”;有的人则只是信息堆叠、平铺直叙。差别并不在工具,而在使用者是否在过程中持续“校准”AI。
这也是为什么,学生们在使用AI时要相当谨慎,能力培养不过关,上限也会受限。
04

体验 AI,本质是在培养协作能力
过去人们使用软件,更多是在适应开发者预设的功能边界;而 AI 提供的是一种更开放的可能性——同样的工具,在不同人手里可以变成完全不同的工作流。
但这种“个性化”,本质上是需要试错的。
你会逐渐知道:哪些任务适合交给 AI,哪些必须自己把关;如何拆解问题;如何设计反馈;如何识别 AI 的错误模式。
这个过程,其实也是在慢慢“蒸馏自己”。
最终理想状态不是“会用 AI”,而是拥有一个符合自己思维方式的数字分身,让 AI 替你执行那些已经被你结构化过的思考。
AI
结语

未来真正重要的 AI 能力,可能不再是“会不会用”,也不是“会不会写 Prompt”,而是:
是否能建立一套属于自己的协作系统。
而这个系统的形状,最终取决于用户自己的思维方式和思考深度。
关于工具选择(个人体验)

如果要从 AI Agents 开始体验,我更推荐从桌面级 AI 助手入手,比如 Work 类产品。
我之前比较推荐阿里的 Qoderwork,但后来产品路线发生变化,被整合进“千问办公”体系。从命名就能看出,把Work翻译成办公,它的目标就不是人机协作中的人,而是办公系统。而我个人更偏向 Claude Cowork 蕴含的理念——Work的重点是协作,是成功的作品,这需要人的灵性。
因此目前阶段,我不会再推荐 Qoderwork/千问办公。如果想体验 GPT / Claude 级别模型能力,可以考虑 Qoder 国际版(独立团队,质量相对稳定)。现在的Quest模式也和Work类产品有较大相似性,我已经完成了整体迁移。
如果想要更轻量的选择,我建议 Workbuddy:生态完整、上手简单、成本较低。但它的问题是稳定性一般,任务偶尔中断,长任务执行的结果也不太令人满意。但现在它已经成为我的日常任务的主要执行者,这些任务已经被沉淀,稳定性问题大大降低。包括之前的每日清单、个人知识库、文献监控等。
至于 Codex 等海外产品,这里就不展开推荐了。随着国内 Agent 使用数据逐渐丰富,这一类能力的差距正在快速缩小,未来在 Agent 层面“跟上”是完全有可能的。
最终还是那句话:工具只是入口,真正决定体验的,始终是你如何使用它。

夜雨聆风