ARTICLE · 1122014
AI 工具太多,其实只有四类
一张速查表、两档深度,和三个比「该学哪个」更值钱的问题
每周都有新产品冒出来。上个月刚记住的名字,这个月换了版本号;一个还没弄明白,下一个又火了。
学 AI 最贵的成本从来不是订阅费,是注意力被反复切成碎片。
但如果把市面上主流的产品摊开,只按「你到底要做什么」重新排一遍,会发现能解决的事其实只有几类。下面这张表是整篇的骨架,先扫一眼,再对照自己手上的事找位置。
这张表按用途分类,所以同一个产品会出现在好几行——ChatGPT 能聊天、能做图、也能通过不同功能执行任务。这不是表格啰嗦,而是它本来就有好几副面孔。
还有一点要先说清楚:同一类里,很多产品实际用起来差别没有宣传的那么大。所以这张表的正确用法,不是把每一行都学一遍,而是遇到具体问题时回来反查一行。
一、先分清一件事:你要的是「回答」,还是「结果」
这是整张表真正的分水岭,也是大多数人卡住的地方。
「哪个模型更强」是个很难回答、而且很快就过期的问题。「你要回答还是要结果」是个当天就能回答、而且五年后依然成立的问题。
二、聊天 AI:门槛最低的第一站
聊天类大概是你最早接触的 AI,也是现在最不需要犹豫的一类。
国内常见的有豆包、DeepSeek、Kimi、千问;海外常见的有 ChatGPT、Claude、Gemini 和 Grok。
它们最早只能聊天、答问、写段文字,后来能联网查资料,现在功能又厚了一层:有些带上了 Agent 能力,可以做 PPT、生成文档,或者直接分析你上传的表格。
用法没什么玄机。比如要写一篇文章,就把选题、写给谁、手头有什么材料告诉它,觉得哪儿不对就接着聊、接着改。这类工具的价值不在一次答对,而在你可以低成本地改十遍。
但有个边界要留意:普通聊天功能的交互仍然发生在 App 或网页里,你把内容发过去,它给你回答,支持生成文件的再把文件下载下来。
想让它直接整理你电脑里的文件、并保存到指定位置,就需要让它连接电脑上的工具,并授权访问文件。这一步跨出去,它就不再是聊天 AI 了——豆包工作、千问办公、WorkBuddy 这些东西,就是下一节的通用 Agent。它们和同品牌的聊天 App,在能接触到的资料、能操作的工具上,是两回事。
三、通用 Agent:给 AI 装上手和脚
聊天 AI 我们已经习惯了:把问题发过去,让它给个回答、帮忙想想办法。
Agent 往前走了一步,相当于给 AI 装上手脚,让它能使用电脑里的工具,真正上手干活——打开一个文件夹,读取里面的表格,统计好数据,再把结果保存成一份文件。
你告诉它想做什么,它调用工具,一步一步完成。这些活可以在你自己的电脑上做,也可以在云端或飞书、钉钉这样的办公软件里完成。
叫「通用」,是因为它能处理多种任务:整理材料、分析数据、做网站、写程序都行。但各家有明显侧重,有的更擅长编程,有的主要面向办公。
国内偏办公的:
WorkBuddy:读写本地文件、整理资料、分析数据,生成文档和表格。 豆包工作:接入飞书,查找团队资料、制作文档和分析表格。 千问办公:连接钉钉,做信息检索、文档制作和数据分析。 Kimi 的 Agent 功能与 Kimi Work:前者可以制作文档、表格、PPT 和网站;Kimi Work 在桌面运行,可连接本地文件和浏览器完成工作。 DeepSeek Harness(DSH):整理文件、分析数据、写文档和执行代码任务,目前仍在预览阶段。 AutoGLM:搜索和整理资料,生成研究报告、PPT 或网页。
海外的:
ChatGPT:桌面客户端授权后能直接调用电脑里的工具、读取文件和操作浏览器;提供 Work 和 Codex 两种任务执行方式,Work 面向日常工作,Codex 更侧重编程。 Claude Code:能读取和修改电脑里的文件、调用工具,既能写程序,也能处理材料和数据。 Grok Build:偏向程序开发,可以阅读和修改项目文件,并运行程序检查结果。
国内更偏编程的,还有 TRAE、CodeBuddy、Qoder CN(原通义灵码)和文心快码。你可以用自然语言讲需求,让它帮你写代码、改功能、找问题,再运行看看效果。
另外Pi Agent、Hermes Agent 和 OpenClaw也能处理多种任务,但这几款需要自己动手配置,按需要连接模型和工具。它们的另一个玩法是远程——出门在外用手机指挥家里那台电脑干活,后面个人助理部分会再讲。
用法上,记住一个例子就够:想把几份销售表格合并统计,就告诉它文件在哪、按什么统计、结果存到哪里,并且授权它访问。事情复杂的话,先看它的计划,做完再检查生成的表格——这两步别省。
一个原文没强调、但必须说的前提:授权就是交出文件读写权限。第一次用,先在无关紧要的目录里试,看清楚它的计划再放它进正式数据。
四、创作工具:图片、视频、声音
图片:工具与模型
用一段文字描述画面让它生成图,拿一张已有图片让它换背景、改局部,或者把几张图里的元素融合进一张新图——这些都属于图片制作。给文章配图、做海报、做产品图,都可以用上。背后干活的是图像模型。
做图的流程很朴素:先告诉它这张图用在哪儿、画面里要有什么、想要什么风格和比例;改图或融合,就把素材一起发过去,说清楚要保留什么、修改什么;生成后看看画面是否合适、海报上的字有没有错,需要改就直接说,最后下载。
视频:三条不同的路
视频和图片类似,但工具要分成三条线看,因为它们解决的问题根本不一样。
第一条:生成视频片段。文字描述场景生成动态画面,或者给一张图片让画面里的人物动起来,也可以提供人物、场景、动作参考让它照着生成镜头,或者修改已有视频。
即梦 AI:Seedance 系列,如 Seedance 2.5,可结合文字、图片、视频和声音参考来生成或修改片段。 可灵 AI:有可灵视频 3.0、3.0 Omni 等模型,可用文字、图片或参考素材生成视频,也能安排多个镜头。 海螺 AI:可以使用 MiniMax H3,结合文字、图片等素材生成带声音的视频。 Grok Imagine:视频模型 Imagine Video 1.5,能让图片动起来,同时生成环境音、音效或对话。 Google Flow:可用 Veo 3.1、Gemini Omni Flash 1.1 等模型,按文字、参考素材或指定的起止画面生成视频,也能用 Gemini Omni 修改已有视频。
先想清楚这条视频要讲什么、需要哪些镜头,再描述人物、场景、动作和镜头怎么变化;有参考图片或视频就一起给。生成拿到的是片段,要检查人物和动作是否符合要求。想做成一条完整视频,通常还要剪辑、加字幕和声音,再导出。
第二条:数字人口播。你希望画面里有个人对着镜头讲解,就用HeyGen。它也能翻译已有视频、同步口型,配上对应语言的声音和字幕。准备好讲解稿,选人物形象,或者用照片、短视频创建数字人,再设置声音和语言;生成后检查发音、停顿和口型,调整好再导出。
第三条:用代码编排视频。如果你手里已经有图片、图表、字幕和配音,想安排它们什么时候出现、怎么动,可以用Remotion——它用代码编排这些内容,再输出视频。你可以把脚本和素材交给 Codex、Claude Code 这类 Agent,讲清画面顺序、动画和字幕要求,让它写代码,预览调整后输出。
刚开始只想生成几个片段的话,前面那些工具就够了,不必一上来就写代码。
声音:配音与音乐
稿子写好了想配音,做成旁白或有声内容,看这两款:
MiniMax Audio:文字配音、声音克隆和多语言语音生成,可以调整情绪和表达方式。 ElevenLabs:文字配音、声音克隆、按描述设计声音,以及音视频配音翻译。
把文字准备好,选声音、语言和表达方式,生成后听读音、停顿和语速,调整好再下载;如果是给视频配音,再放进剪辑工具里配合画面。
想做歌曲或配乐,还有:
Suno:根据风格、情绪或歌词生成带演唱和编曲的歌曲,也能做纯音乐。 MiniMax Music:音乐模型系列,按创作构想和歌词生成歌曲。
以 Suno 为例:告诉它主题、风格和情绪,也可以提供歌词,试听调整后下载音频。就完了。
五、个人助理:唯一跨越「时间」的一类
前面讲的每一件事,做完一次就结束了。个人助理不一样,它可以持续跟进一件事:定期整理简报、跟进活动安排,或者记住你的偏好,遇到需要你决定的事再来问你。
厂商提供的云端助理有:
Grok Bot:使用独立云端电脑,跨应用处理任务,并保留工作偏好。 Meta Muse:在云端电脑和浏览器里推进长期任务,记住偏好,并在需要你决定时询问。 ChatGPT dot:在对话之间继续跟进任务,使用云端电脑,也可以把工作交给 Work 或 Codex。
用法举个例子:想每周一收到一份行业简报,就把关注什么、参考哪些资料、发到哪里讲清楚,连接好相关应用,设置定时任务;哪些事必须先问你,也可以提前约定。
还有一种是作者自己在用的:出门在外,用手机连到家里的电脑,继续安排 Agent 干活。手边没有电脑,也能交代任务、看进度。
想这么用,可以了解OpenClaw(小龙虾)、Hermes Agent:先让它们在电脑或服务器上运行,配置好模型和工具,再连接它们支持的聊天 App,就能通过手机发任务、收结果。Pi Agent也可以搭配远程连接工具来用。
唯一的前提:跑 Agent 的那台电脑或服务器要保持在线。
六、三个比「该学哪个工具」更值钱的问题
工具清单会过期,判断标准不会。下面这三条,是我认为比任何一份榜单都更值得记下来的。
第一个问题:它的产出,需要你返工吗?
一个工具真正的成本不是订阅费,是「你为它收拾残局的时间」。生成的东西能不能直接用、需不需要你逐字校对、格式会不会崩——这些决定了它是帮你省时间,还是在给你派活。
第二个问题:它改变了你的能力边界吗?
有些新工具只是把昨天的事做得快了一点,有些是真的让你能干以前干不了的事。前者可以等,后者值得马上上手。绝大多数上热搜的产品属于前者。
第三个问题:你手上有没有它对应的真实问题?
这一条最朴素,也最容易被忽略。工具的选型不该由它有多火决定,而该由你手上正在反复发生的那件麻烦事决定。如果没有具体问题,学得再熟也会忘。
AI 圈有句调侃:「有些东西不用着急学,拖着拖着就不用学了。」这话不只是玩笑——有些新产品,可能没几个月就消失了。挑有代表性的、能解决自己问题的先用好,以后真遇到解决不了的需求,再去找新的,也来得及。
七、如果把这张表拿到团队里用
个人挑工具靠手感,团队挑工具得靠流程,否则很容易变成「每个人都在用 AI,但没人说得清省下了什么」。
我的建议是:别按产品选,按工作流节点选。
把团队的工作拆成几段,一段一段去对应上面那四类能力——比如信息搜集与讨论对应聊天 AI,数据处理与文档产出对应通用 Agent,对外材料里的配图、视频、配音对应创作工具,周期性的简报与巡检对应个人助理。
这样做有三个好处:
判断标准统一了。 讨论的就不再是「A 比 B 强」,而是「这个节点该不该用 AI、用哪一层」。 投入可以量化。 衡量口径从「效果惊艳吗」换成「这一段能不能省掉 N 个人天」,试点的去留立刻有答案。 风险边界清楚。 Agent 是要文件的读写权限的,先把「哪些目录可以授权、哪些数据不出域」划出来,比事后补救便宜得多。
先在一两个节点上试点,跑通再铺开。工具选型里最容易被浪费的钱,是买了一个没人知道该用在哪儿的东西。
写在最后
把整篇压缩成一段话:
问问题、聊想法,找聊天 AI;想让它动手干活,找通用 Agent;做图片、视频、声音,找对应的创作工具;想让它持续跟进工作,就看个人助理。遇到什么需求,回来反查表里对应那一行就行。
学工具这件事,最终还是回到自己要解决的问题上。现在用的工具已经能把问题解决好了,那就足够了,没必要每出一款新产品都跟着学。
先分清你要的是回答还是结果,剩下的都是细节。