ARTICLE · 1037810
那么多AI工具,应该用哪个

文字与思考类工作
长文理解
纯能力: Gemini > Kimi > Claude
计成本:Gemini Flash >> Kimi≥Qwen/GLM
注:高手可以考虑开prompt缓存后成本能砍一半以上,反复问同一份文档时尤其明显。
文案创作(中文)
纯能力:Claude> DeepSeek≈ 豆包/Qwen计成本:DeepSeek>豆包>Qwen
注:Claude的优势在”不像AI写的“,值不值这个溢价看你了。我平时用ds写周报已经足够。让模型说人话可以用一些skil来补足
代码
纯能力:Claude ≥OpenAI> Gemini
计成本:GLM-Coder ≈ Qwen-Coder >DeepSeek
注:如果公司有订阅claude或者openai,那就直接用吧,不用考虑成本
结构化抽取/批量打标纯能力:
OpenAI> Claude ≈ Gemini计成本:Gemini Flash>豆包≈ DeepSeek
注:打标量大任务简单的活,只看成本就行了
联网调研
英文/实时:Grok ≈ Gemini > Kimi
中文:Kimi>豆包≈GLM
计成本:Kimi> 豆包> Gemini
Agent/工具调用
纯能力: Claude > OpenAI> Kimi
计成本:Kimi≥GLM>Qwen (Claude 订阅制
下仍居首)

二、多模态理解
图像理解
纯能力: Gemini ≥ Qwen-VL >OpenAI
中文OCR/表格:Qwen>豆包>Gemini
计成本:Qwen-VL>豆包>Gemini Flash
降本第一动作是压分辨率,不是换模型。4K截图直传的成本是1080p的约4倍,识别效果基本无差。
视频理解
纯能力:Gemini>>Qwen-VL>豆包(断档)
计成本:GeminiFlash>>Qwen-VL>豆包!1小时视频≈30-100万等效token。必须走T3档,用旗舰跑一次就是几十块。
声音理解(中文)
Qwen omni≈ 豆包>Gemini
三、多模态生成
图像生成
纯能力:Gemini>OpenAI≥豆包
计成本:豆包>Qwen>Gemini
图像生成·含中文字
豆包 ≈ Qwen >> Gemini/OpenAI (断档)
注:成本排序同上,这个维度能力和成本罕见地完全一致,无脑选国产。
视频生成
MiniMax
能力:豆包Seedance > Gemini Veo
计成本:豆包>MiniMax>>Veo
注:视频生成都很贵,量力而行
语音合成(中文)
MiniMax>豆包>Qwen
计费,总量可控,冲突不大)
计成本:豆包>MiniMax>Qwen(按成品时长)

没有绝对完美的 AI 工具,只有最适合自己需求的选择。
做视频生成看重画面质量,中文配音追求自然人声,大家可以根据预算、场景按需挑选。 还要记住:不管选哪款,AI 只是创作助手,好内容最终还是靠人的想法来把控。