乐于分享
好东西不私藏

Day 3:国产AI写作三剑客横评

Day 3:国产AI写作三剑客横评

Kimi vs 豆包 vs 通义千问,我用6个场景测出了结论

阿荣AI工具箱 | 第3篇实测记录

────────────────────────────────────────

前两篇测了DeepSeek,很多读者留言问:「Kimi呢?豆包呢?通义千问呢?」

这次专门针对写作场景,把Kimi、豆包、通义千问拉出来一起测。

为什么只测写作场景?因为这是大多数人用AI最高频的需求——写文章、改文案、起标题、发朋友圈……

上一篇DeepSeek的提示词设计方法,这次直接用上去测,看看同样的提示词,三款模型谁发挥最稳。

────────────────────────────────────────

写在前面:测试说明

统一测试环境:

· 时间:同一天内完成所有测试

· 账号:三款均使用免费版(普通用户可用的版本)

· Prompt:每轮完全相同,复制粘贴不做任何修改

· 不开启联网功能(测模型本身能力)

评分维度(每轮满分10分):

维度

说明

内容质量

逻辑、信息密度、准确性

中文表达

语感、流畅度、用词

实用性

能否直接用/小修即用

风格还原

对目标风格的模仿度

AI味指数

AI味越淡越好(反向评分)

6大测试场景:

1. 公众号长文写作

2. 文章改写润色

3. 爆款标题生成

4. 小红书文案创作

5. 朋友圈文案

6. 商务邮件撰写

────────────────────────────────────────

Round 1:公众号长文写作

测试Prompt:

你是一位科技类公众号作者,擅长写面向普通人的AI工具测评文章。请写一篇公众号长文,主题:《我连续用Notion AI工作了30天,说几句大实话》要求:字数1500-2000字 / 开头用真实场景引入,不要用套话 / 结构清晰,分3-4部分 / 语气真实,有个人观点 / 结尾有互动引导

Kimi 的表现

Kimi给出的开头:

「周三下午3点,我盯着一份需要整理成报告的会议纪录发愁。洋洋洒洒5000字,要提炼成200字的执行摘要,还要有结构有逻辑。就在这时候,我打开了Notion AI的「总结」功能,粘贴进去,30秒后……」—— Kimi 原文输出

分析:开头用具体时间点+具体任务,代入感强。三段式结构清晰,中间穿插了「没想到」「但这里有个坑」等真实反馈表达。偶尔出现「值得一提的是」,需手动清除2-3处。

豆包的表现

豆包换了思路,开头带着反差感:

「说真的,我是带着怀疑去用Notion AI的。市面上AI工具吹得天花乱坠,但真正好用的有几个?我订阅了一堆工具,最后常用的也就那两三个。」—— 豆包 原文输出

前半部分几乎没有AI味,但后半段稍微泄气,第三部分逻辑链断了,像在凑字数。

通义千问的表现

通义的开头中规中矩:

「在这个AI工具层出不穷的时代,如何找到真正适合自己的生产力工具,是很多职场人都在思考的问题。」—— 通义千问 原文输出(这句话一出来就知道后面不太对)

全篇有点像给领导汇报工作,内容准确但缺乏温度,不够吸引人继续读下去。

Round 1 评分:

维度

Kimi

豆包

通义

内容质量

8.5

7.5

7.0

中文表达

8.0

8.5

7.0

实用性

8.0

7.0

7.0

风格还原

8.5

8.0

6.5

AI味(反向)

7.5

8.5

5.0

总分

40.5

39.5

32.5

>>> Round 1 冠军:Kimi (结构和信息密度更优)

────────────────────────────────────────

Round 2:文章改写润色

这个场景对写公众号的人非常实用——你有一段初稿,读起来干涩,想让它更有可读性。

测试Prompt(输入相同段落,让三款模型各改一遍):

请帮我改写以下段落,要求:1. 保留核心意思不变2. 语气更生动,像真人在聊天3. 减少"但是""然而""因此"等连接词4. 字数控制在原段落的±20%以内原文:"AI工具在近年来取得了显著进展,但许多用户在实际使用过程中发现,这些工具的表现与宣传存在较大差距。因此,进行客观的横向对比测评,对于帮助用户做出正确的选择具有重要意义。"

Kimi 版本:

AI工具这两年确实进化快,但真正上手用过的人都知道——宣传的和实际用的,是两回事。所以我觉得有必要把几款主流工具拉出来比一比,让你自己看清楚哪个更值得用。」

豆包版本:

AI工具最近确实越来越强了,但买回来以后很多人都发现,广告说的跟实际用的差了一大截。到底哪款好用?别光听宣传,来看我实测结果!」

通义版本:

「近年来,AI工具领域发展迅速,但部分用户在使用时发现实际效果与产品宣传有所差异。客观的横向测评有助于用户做出更合理的选择。」

点评:Kimi理性自然;豆包最大胆,口语化最好;通义几乎没改。

>>> Round 2 冠军:豆包 (改写幅度大,口语化最好)

────────────────────────────────────────

Round 3:爆款标题生成

标题是公众号的命门,让三款模型各生成10个候选标题,精选3个对比。

Kimi 精选标题(3个):

《用同一段话让DeepSeek和ChatGPT各写一篇文章,差距让我沉默了》

《实测24小时:我把DeepSeek和ChatGPT放在一起干活,胜负出乎意料》

DeepSeek的6个优势,ChatGPT确实做不到》

豆包精选标题(3个):

DeepSeek把ChatGPT打了?我用10个任务测出了真相》

《同款提示词,DeepSeek vs ChatGPT,差距比我想象的大》

《用了ChatGPT两年,换DeepSeek之后我后悔了吗?》

通义精选标题(3个):

DeepSeek与ChatGPT对比实测:哪个更适合中文用户?》

《国产AI挑战海外大模型:DeepSeek能否超越ChatGPT?》

《实测DeepSeek与ChatGPT:两款AI工具全面对比分析》

点评:Kimi有情绪钩子;豆包有反转设计,点击欲强;通义像课题报告。

>>> Round 3 冠军:豆包 (爆款标题嗅觉最灵)

────────────────────────────────────────

Round 4:小红书文案创作

小红书是目前最容易冷启动的平台,风格要求特别——要口语、要emoji、要有"发现感"。

豆包版本(最优):

姐妹们!50页PDF变5分钟PPT这个救命技巧你们get到了吗!!今天被一份年度报告折磨了两小时,灵机一动把它扔给豆包,说"帮我提炼5分钟演讲提纲"——结果真的出来了,而且逻辑比我自己想的还清晰!具体怎么操作:1. 上传PDF(豆包支持直接上传)2. 告诉它:你是谁、要讲给谁听、时间多长3. 要求它按"问题→方案→结果"的结构出框架4. 对你觉得模糊的部分继续追问细节你们有没有其他用AI处理文档的方法?评论区分享一下~—— 豆包 原文

>>> Round 4 冠军:豆包 (小红书风格还原最强)

────────────────────────────────────────

Round 5:朋友圈文案

朋友圈比小红书更难写——既要真实,又要有传播性,还不能太硬广。

豆包版本(最优):

连续测了三款国产AI,拿同一个提示词让它们各写一遍——差距比我想象的大,而且有一个地方的差距是我完全没料到的。不剧透了,感兴趣的看原文。[文章链接]—— 豆包 原文

点评:用了悬念钩子「有一个地方完全没料到」,点击欲最强,语气最像真人。

>>> Round 5 冠军:豆包 (悬念设计+语气最像真人)

────────────────────────────────────────

Round 6:商务邮件撰写

商务场景看谁的职业感更到位。让三款模型写一封寻求AI工具合作的邮件。

Kimi 标题:

「公众号测评合作请求:阿荣AI工具箱 × [公司名],想帮你们触达X万精准用户」

豆包标题:

「想帮你们做一次真实测评——来自阿荣AI工具箱的合作邀请」(加了"不接广告,只做真实测评",很聪明)

通义标题:

「关于开展公众号测评合作的邀请」,正文以"尊敬的XXX,您好"开头——商务邮件忌讳。

>>> Round 6 冠军:Kimi (标题和专业感更强)

────────────────────────────────────────

六轮总成绩单

场景

冠军

亚军

第三

Round 1 公众号长文

Kimi

豆包

通义

Round 2 文章改写润色

豆包

Kimi

通义

Round 3 爆款标题

豆包

Kimi

通义

Round 4 小红书文案

豆包

Kimi

通义

Round 5 朋友圈文案

豆包

Kimi

通义

Round 6 商务邮件

Kimi

豆包

通义

累计夺冠次数:

模型

冠军次数

亚军次数

第三次数

豆包

4次

2次

0次

Kimi

2次

4次

0次

通义千问

0次

0次

6次

────────────────────────────────────────

阿荣的最终结论

豆包:写作场景的最佳搭档

豆包在口语化写作上有天然优势——小红书、朋友圈、改写润色,它把「真人感」处理得最好。

如果你的内容主要面向C端(小红书、朋友圈、日常推文),优先选豆包。

官网:doubao.com(免费版足够用,需绑定手机号)

Kimi:长文和职场场景更稳

Kimi在需要「信息密度+逻辑结构」的场景表现最好——公众号长文、商务邮件、资料整理。

特别提醒:Kimi支持上传文件(PDF/Word/Excel),这是豆包和通义免费版不具备的功能。

官网:kimi.moonshot.cn(免费版每月有额度)

通义千问:做辅助工具,不做主力

通义在写作风格上明显偏正式、偏文件感,6项测试全部垫底。但与钉钉深度集成,职场办公场景有独特优势。

────────────────────────────────────────

写作场景选工具决策树

你主要写什么类型的内容?├─ 小红书/朋友圈/社交媒体  →  豆包(首选)├─ 公众号长文/深度测评     →  Kimi(首选)或 DeepSeek├─ 改写/润色已有文章       →  豆包(最大胆)├─ 标题优化               →  豆包 or Kimi(都不错,多生成几组选)├─ 商务邮件/职场文档       →  Kimi└─ 读PDF/处理长文件        →  Kimi(支持文件上传)

────────────────────────────────────────

DeepSeek的关系(推荐工作流)

测了三篇了,我现在的工作流是这样的:

步骤

任务

用哪款

Step 1

选题+提纲

DeepSeek(逻辑推理最强)

Step 2

正文初稿

Kimi(长文结构好)

Step 3

标题+文案

豆包(口语化最自然)

Step 4

代码/技术问题

DeepSeek(压制性优势)

不是要你同时开四个窗口,而是根据任务选对工具。时间久了你会有自己的习惯。

────────────────────────────────────────

写在最后

测了三篇了,我发现一个规律:没有万能的AI工具,只有最适合当前任务的AI工具。

────────────────────────────────────────

发布前参考(3个备选标题)

标题A:《Kimi vs 豆包 vs 通义千问:我用6个写作场景测出了结论,通义全程垫底》

标题B:《同款提示词让三款AI各写一遍,差距一目了然(附写作场景选工具指南)》(推荐)

标题C:《写了三周AI测评,我现在这样分配三款模型——Kimi/豆包/通义》

建议封面图:三款工具Logo并排对比图,或综合评分表截图

建议摘要:测了Kimi/豆包/通义千问6个写作场景,结果有点意外——通义全程垫底,豆包4次夺冠,Kimi在长文上更稳