ARTICLE · 1143317
AI已经能干这么多,为什么很多人还是用不出结果?
AI已经能干这么多,为什么很多人还是用不出结果?现在的AI,已经能写文章、整理资料、分析表格、生成图片,还能在接通相应工具后写代码、修改文件、制作网页。 可用过的人,也容易遇到另一种情况:答案一大篇,看着挺完整,拿来做事却差一截。 文章有结构,读完没记住什么;代码已经给出,程序仍然跑不起来;视频方案写得漂亮,真正制作时才发现素材和声音根本对不上。 我认为,想把AI用好,得先把“回答了问题”和“完成了工作”分清楚。 你希望它最后交出什么?它需要哪些材料?结果做到哪一步,才算完成? 这几个问题,比收藏多少条提示词更有用。 **先看清楚,你用的AI到底能做到哪一步。** 我把常见的用法,分成三个层次。 第一层,帮你想。解释概念、讨论方案、分析思路、提出问题。 第二层,帮你产出。写成文章、生成图片、整理成表格,或者给出一段代码。 第三层,帮你执行。在支持相应功能的环境里,读取文件、调用工具、运行程序,再根据结果继续修改。 这三个层次需要的条件不同。 比如,你让AI“帮我搭一个网站”。只有文字对话时,它可能交给你网页代码。接通项目文件、运行环境和预览工具之后,它才有条件修改页面、检查显示效果,再继续调整。 OpenAI目前的ChatGPT Work就将文件、工具和工作流程结合起来,支持文档、分析、网站等成果的制作。产品有没有接通这些能力,会影响它最终能交付什么。 所以,判断一个工具能不能帮你干活,要具体看:它能读取什么,能操作什么,最后交出的是说明、文件,还是已经可以使用的成果。 **大家常说的“智能体”,又是什么?** 可以先把它理解成:AI会围绕一个目标,选择工具、执行步骤,再根据反馈决定下一步。 比如整理一批客户资料,先读取文件,发现格式不同,再做清洗,最后输出统一表格。 如果每次都按事先规定的顺序执行,通常可以叫工作流;如果由模型根据情况决定下一步做什么,就更接近智能体。Anthropic在自己的工程文章里,也采用了这个区分。 对普通使用者来说,记住名字还不够。更有用的是知道,这个任务需要自由探索,还是照着固定步骤完成就行。 整理报表、批量改格式,流程越稳定越容易检查。调查一个复杂问题,则可能需要不断补材料、改方向。 **AI到底有没有提高效率,要看完整的一笔账。** 这里有两项研究,很值得放在一起看。 《Generative AI at Work》研究了5172名客服人员。论文2024年修订版显示,使用AI辅助后,每小时解决问题的数量平均提高约15%,不同经验水平的员工,收益并不一样。 另一个结果来自2025年的METR研究。16名有经验的开源开发者,在熟悉的项目里完成246项任务。使用当时的AI工具后,任务完成时间平均增加了19%。 这两项研究的任务、人群和工具都不同,不能直接互相比较,更不能拿2025年的结果替所有后续模型下结论。 我的理解是:AI能否提效,要放回具体工作里测。 初稿生成得快,只是其中一部分。寻找材料、下指令、等待、检查和返工,也都占时间。 假设一篇文章,自己写需要两小时;用AI生成只要几分钟,但后续核对和重写又用了两个小时,这次就很难叫提效。 如果把参考材料、文章结构和检查标准准备好,让修改时间也降下来,效率才真正发生变化。 **同一个AI,为什么有人用得顺,有人总觉得差点意思?** 我会先检查三件事。 第一,目标是不是太空。 “帮我写一篇高质量文章”,里面最关键的“高质量”,没有讲清楚。 面向专业人士,可能需要数据和方法;面向普通读者,需要解释术语和举例;面向已经准备购买的人,需要回答选择和使用的问题。 第二,材料是不是缺了。 你希望AI写出行业判断,却只给了一个标题;希望它模仿你的表达,却没有给任何样稿;希望它修复网站,却没有提供源码和报错。 它缺少的部分,往往只能靠推测补上。推测一多,结果就容易泛。 第三,修改意见是不是太模糊。 “再专业一点”“写得自然一点”“高级一些”,AI能理解方向,却未必知道你具体不满意什么。 换成“第三段只有观点,补一个能核实的例子”“删掉重复解释,把结论提前”“这个按钮在手机上被挤出屏幕,调整布局”,下一轮修改就有了明确目标。 **给AI安排工作,我建议把这四样东西说清楚。** | 要说清楚的事 | 具体应该给什么 | | --- | --- | | 最终成果 | 一篇文章、一份表格、一个视频,还是能运行的工具 | | 使用场景 | 给谁看、用在哪里、读者已经知道多少 | | 输入材料 | 原始资料、已有文件、参考样稿、数据与限制条件 | | 完成标准 | 必须回答的问题、需要检查的结果、交付的文件格式 | 这张表,可以拿来检查很多请求。 你让AI分析一家企业,完成标准可以是“解释收入从哪里来、利润为什么变化,并列出支持判断的数据”。 你让它做字幕工具,完成标准可以是“输入一个链接,成功生成能够打开的中文文本文件”。 你让它制作视频,完成标准就得包括画面、声音、字幕和最终导出。只有脚本,还只是完成了其中一部分。 **再拿做视频举个完整的例子。** 假设要做一条8分钟的科普视频。 我会先确定一个观众看完必须弄懂的问题。主题越宽,越容易最后什么都讲一点,什么都没讲透。 接着整理资料,把能核实的事实、作者观点和仍有争议的内容分开。研究结果给后面的脚本使用。 然后安排论证顺序:先讲观众遇到的困惑,再解释原因,用例子把机制讲清楚,最后补上适用条件。 脚本稳定后,再做分镜。每一段需要实拍、示意图、数据图表,还是字幕强调,要明确下来。 配音做好之后,按照实际音频安排画面时长。最后检查声音有没有被截断、字幕是否对应、图表能不能读清楚,再导出成片。 这些步骤里,AI可以参与多处。但每一步都有自己的输入和结果,前一步改动,也可能影响后一步。 如果口播内容都没定,就先大量生成画面,后面换了脚本,素材很可能跟着返工。 Anthropic在工作流设计中提到,将适合拆分的任务分成连续步骤,并检查中间结果。这套思路,放到日常内容制作里同样有参考价值。 不必把每件事拆成几十步。关键是找到会影响后续工作的几个节点,先把它们做稳。 **再往前一步,是把有效的方法留下来。** 一篇文章终于写到满意,就把读者定位、表达要求和检查标准保存下来。 一个视频流程跑通,就把文件命名、素材要求、音频处理和导出设置整理好。 一份报表做对,就保留字段说明、计算方法和结果样例。 下次继续使用这些材料,AI就更容易接上你的工作。 你积累的东西会越来越具体:哪些资料可以直接用,哪一步最容易出错,怎样的成品符合要求。 我觉得,这比每次从空白对话开始,更容易形成稳定的产出。 **至于靠AI赚钱,还需要把“产出”接到“需求”上。** AI可以降低一部分制作成本。但成本降下来之后,仍然要回答:这份东西帮谁解决了什么问题? 给商家做内容,要看有没有把产品和顾客的疑问讲清楚;给企业整理资料,要看结果能不能直接用于下一步工作;做网站,要看访客能否找到信息、完成操作。 拿到一大段答案,并不会自动带来客户。交付的东西有用,才有继续合作的理由。 因此,衡量AI投入,我会同时看四个指标:完成时间、修改次数、成品质量,以及后续是否真的被使用。 订阅费和调用费当然也要算进去。一个更便宜的工具,如果每次都需要大量返工,总成本未必更低。 **如果想马上试一次,可以这样安排任务。** > 我要完成【具体成果】,给【目标人群】在【使用场景】中使用。 > 现有材料是【文件、资料或参考样稿】。 > 成品必须满足【三条能够检查的要求】。 > 请先检查材料是否足够,再按合适的步骤完成;最后对照要求检查结果,并交付【文件或格式】。 这段话可以作为起点,再根据任务调整。 第一次用,不妨选一件你已经熟悉、又经常重复做的事。自己做一遍,记录时间;再让AI做一遍,把修改和检查时间也算进去。 这样比较几次,你就会知道它在哪一步帮得上忙,哪些材料应该提前准备,哪些工作适合固定下来。 我是林一。后面我会继续用具体任务,讲清楚AI怎样进入日常工作。