ARTICLE · 1095940
2026年AI工具产品实用指南:各个领域真正值得关注的产品与数据
说实话一开始我还是会挨个看看了解下的,但是被”震撼“得太多就有点儿麻木了,最终就变成了:我分不清,我真的分不清啊。
所以我所幸用了一晚上时间梳理了各机构公开数据,又做了些区分,分享给需要的人。
QuestMobile 2026年6月数据显示,中国AI原生App月活用户达4.99亿,同比增长85.4%。
头部格局稳定:豆包月活约3.82亿、千问约1.67亿、DeepSeek约1.30亿、Kimi月活约729万。
这几个我日常都用过,正好把数据和实际体验放在一起说下。
豆包:
月活超过第二名和第三名之和,已进入全网App总榜前20,是榜单内唯一上榜的AIGC应用。使用偏碎片化、高频。
我主要用它问日常问题、拍图识别花鸟鱼虫,基本替代了浏览器。
千问:
定位偏向通用助手与生产力工具的结合,与阿里生态(钉钉、夸克、淘宝等)的联动是它的特点。使用场景相对均衡,既有日常问答,也有文档处理、办公辅助。
我用的是PC端,主要问热点、语法校验和翻译类内容,因为问题可以分组、找起来方便,所以用得比较多。上面集成了Agent,但在我的使用场景下,速度偏慢,额度也不多,就偶尔用用吧。
DeepSeek:
使用者偏向长思考方式,10分钟以上时长的对话使用占比达30%,是头部产品中最高的,使用深度明显高于其他产品。适合需要逐步推理、逻辑分析或稍复杂的问题,在数学、代码等任务上表现不错。
我主要在手机和网页端用,回答质量比较高,有专业性问题或想写个简单demo,一般都用它。
Kimi:
月活从峰值超过3000万跌至不足千万,连续四个季度下滑。它的定位与其他产品不同,偏向长文本阅读和深度知识处理,特定任务上仍有独到之处。
我下载过客户端,但长文处理需求确实没那么多,对比千问也没明显优势,没用多久就转到千问了。
JetBrains对全球1.5万名以上专业开发者的调查显示,2026年5至7月,90%的专业开发者每周至少使用一次AI编程工具,68%每天都在用。事实证明,相比自己干活,大家还是更喜欢指挥别人干活,毕竟电子牛马任劳任怨(只要给钱=-=)
Claude Code:
Q1周活跃开发者约420万,部署于超过1400家企业工程组织。年化经常性收入2026年2月达25亿美元,此后持续攀升。JetBrains调查中职场使用率从1月的18%升至5至7月的39%,是GitHub Copilot(21%)的近两倍。Opus 5在SWE-bench Verified上达97%,DeepSWE任务解决率约74%。适合大型复杂代码库的深度任务。$20档位较易触及使用上限。增长在下半年放缓,过去四周增长率约5.2%,同期Codex约20.8%。
Codex:
用户增长最陡峭。年初周活约60万,8月突破2000万,最新约2500万。支持接入第三方模型,开源CLI工具和SDK,可嵌入CI流水线。云优先架构支持最多8个并行子Agent。知识工作者约占用户20%,增速是开发者的三倍以上。JetBrains调查中使用率从1月的3%升至5至7月的16%,认知度从27%升至65%。绝对值仍低于Claude Code,但增速显著。
Cursor:
月活约700万,日活超100万,付费企业约5万家,约六成财富500强企业已接入。核心优势在产品设计,将编码深度整合到桌面端,并推出自研模型Composer。但JetBrains调查显示其使用率从1月的18%降至5至7月的12%,同期Claude Code和Codex均有上升,竞争格局较此前更复杂。
Kimi K3:
2026年7月发布,2.8万亿参数,是目前全球参数规模最大的开源大模型,100万token上下文窗口。设计目标为长程编程,在极少人工监督下处理大型代码库。沙丘社区SQBench中综合得分60.5分,排名第一;TerminalBench 2.1得分88.3,Program Bench 77.8分。在结合软件工程与视觉推理的任务上表现突出,适合游戏开发、前端工程等需要“看到结果再迭代”的场景。鲁棒性与边界维度得分36分,低于GPT-5.6 Sol的64分,关键判断仍建议保留人工审核。API成本低于主流闭源模型。
别的用得少我就不评价了,只说2句:
Claude Code 被封了,爱过,累了。
Codex,现在能直接接DeepSeek了,好用,爱用。
这里要单独说一个我很推崇的工具:
Hermes Agent
自2026年2月开源,到5月GitHub星标超11万,日Token调用量约2910亿,在OpenRouter四个Agent品类中均排名第一。它的核心是“自进化”机制:任务完成后,若工具调用超5次、出错后自我修复或用户做过纠正,会自动将有效方法提炼为可复用的Skill文件。支持多种部署方式,兼容200+大模型。
稍微有些使用门槛:不支持Windows原生环境,需WSL2(其实沙箱使用确实更安全放心);低参数模型会导致“自进化”逻辑崩塌。
这是我到目前为止用的最多的Agent了,主要是随着使用积攒了很多Skill,使用起来确实越来越顺手,现在处理很多复杂任务也就是一句话的事情,完成度还很高。
如果你工作中涉及很多需要重复执行的复杂任务,我推荐你试试。
唯二的诟病就是,目前的终端交互不太友好,并且mero期待后续有新的优化吧。
这段时间AI办公方向的产品简直是打破头了,2026年7月,AI效率办公赛道月活达1.02亿,月总使用次数约13.87亿,同比增长112.4%。PC客户端月活同比增长340.6%。
WorkBuddy(腾讯)
2026年3月上线,7月PC客户端月活约658万,用户月人均使用19次,在PC端办公Agent中排名第一。支持混元、DeepSeek、GLM、Kimi、MiniMax等模型切换,接入腾讯文档、腾讯会议、企业微信。优势是腾讯生态的现成工作流整合。
千问办公(阿里)
8月公测,上线首月用户数突破3000万,企业用户占比过半。支持桌面端、云端、企业协同三种Agent模式。“企业上下文”功能可对数据压缩和结构化,内置专属模型处理企业数据。(3000万是注册用户数哈,不是月活)。
豆包工作(字节跳动)
2026年8月25日宣布推出,9月15日正式亮相,定位B端数字员工,与飞书深度打通。使用飞书账号登录后可继承企业知识和工作上下文,对已用飞书的企业迁移成本几乎为零。字节的布局还包括TRAE Work(6月升级,首月定价9.9元,截至6月注册用户破1000万,企业客户超1万家)和扣子。三条线整合形成从开发到协作的办公链条。
AI办公方向,只能各家各有定位、各有千秋吧,没法做什么统一的评判,大家根据实际工作需要选择就好。
Claude:
长文写作精度标杆。BenchLM评测中,Claude Fable 5在Arena Creative Writing保持最高Elo(约1508)。核心优势是长上下文回溯能力,输出自然、不公式化,适合需要保持语气一致的长篇创作。不足:特别长的生成任务中可能出现风格漂移,定价偏高。
Kimi:
中文超长文档的原生阅读器和分析器。K3搭载100万token上下文,单次可处理约75万字。沙丘社区SQBench长文本推理得分64分,排名第一;BrowseComp信息检索得分91.2。优势场景:多份文献对比梳理、中文合同和政策文件批量分析(术语映射准确率超96%,支持自动标注页码)、学术写作事实锚定。能力边界清晰:多模态、数学推理、创意写作非其重点。此前1M上下文需199元/月档位,2026年9月K2.8 Preview上线后所有会员档位均可使用。
Qwen3:
WritingBench上,Qwen3-235B-A22B-Thinking-2507排名第一,得分0.883。同系列Instruct版本差距在5个标准化分以内,API价格处于同性能区间最低水平。适合大规模、低成本的中文长文生成。
NotebookLM(Gemini Notebook):
截至2026年7月,超3000万用户和60万家组织。核心区别是回答绑定可追溯来源,每条回答关联用户上传的文档或网页,带清晰引用。2026年6月升级后加入代理式能力,可产出PDF报告、图表、预算试算表等。适合学术研究、行业分析等需要引用的写作。
通义千问Qwen3.7-Max:
支持100万token上下文,单次可解析百万字合同、整套源代码、数十万字报告。跨章节、跨文件关联检索能力提升,适配律师、研究员等批量资料处理需求。
简单总结一下就是:
自然文风长文用Claude;中文超长文档和文献溯源用Kimi;低成本批量生成用Qwen3;研究型写作且需来源可追溯用NotebookLM;超长合同报告跨文件对比用Qwen3.7-Max。
Sora关停后,即梦和可灵成为国内市场主角,各自方向不同。
即梦(Seedance):
2026年一季度月活约1352万,下载量约559万,稳居视频生成赛道首位。春节期间Seedance 2.0月活一度突破4500万。借助字节生态流量,策略是低门槛创作+免费积分。适合快速生成社交媒体内容。
可灵:
2026年1月月活突破1200万,App端付费用户较2025年12月增长约350%。用户结构更偏向付费意愿强的专业创作者。智能分镜和主体参考技术可用于影视前期创意验证,已参与《太平年》《大卫王朝》等剧集的部分虚拟场景和特效镜头制作。适合影视级制作、广告Demo和需要精确控制的场景。
如果是要找创作平台,也可以看看LibTV这种专业性的视频创作平台,我个人觉得现在已经很好用了。
音频:
ElevenLabs仍是全球TTS市场重要参与者,2026年6月月访问量约3441万,占全球TTS市场约35%份额。国内千问2026年9月宣布TTS降价约70%。
设计:
Figma Make 2026年Q1财报显示,年收入超10万美元的付费客户中约60%每周使用,高于上季度的50%。价值在于设计环境内直接通过对话生成交互原型。
数据分析:
据Riso Group 2026年7月统计,Hex在BI工具采用率排名中升至第4位(约17%),增速约30%。Ramp 2026年8月数据显示其采用率为22%,两者口径不同。Hex强调将分析成果转化为可分享的交互式数据应用。
法律:
Wolters Kluwer对810名律师的调查显示,92%在日常工作中至少使用一款AI工具。Thomson Reuters的CoCounsel在107个国家和地区拥有约100万用户。但这些是辅助工具,不能替代法律判断。
医疗健康:
截至2026年1月,蚂蚁方披露月活超3000万,单日提问量超1000万,三线及以下城市用户占55%,老年用户占25%,凌晨咨询量占16%。健康AI在解读体检报告时较为谨慎,存在“常规报告误判”的体验落差,目前更适合作为健康咨询的补充而非替代。
日常问答和轻量任务:
豆包、千问或DeepSeek。免费,上手成本几乎为零。
- 碎片化查询用豆包;
- 简单的专业概念查询用千问;
- 稍复杂推理和分析用DeepSeek。
写长篇内容:
- 文风自然、长文创作:Claude。
- 中文超长文档、文献溯源:Kimi。
- 低成本批量生成中文内容:Qwen3系列。
- 研究型写作、来源可追溯:NotebookLM。
理解和分析长文档:
- 超长中文文档:Kimi。
- 通用超长文档:Qwen3.7-Max。
- 精准回溯长对话早期信息:Claude。
- 多来源关联分析并生成报告:NotebookLM。
写代码:
- 单任务精度、大型代码库:Claude Code。
- 并行多任务、成本效率:Codex。
- 长程编程、开源、结合视觉推理:Kimi K3(关键的地方还是要自己过一遍)。
- IDE深度集成:Cursor。
做视频:
- 社交媒体短视频:即梦。
- 影视级制作、精确控制:可灵。
- 创作平台:LibTV。
AI办公协作:
- 已用飞书:豆包工作。
- 已用腾讯文档/企业微信:WorkBuddy。
- 企业级Agent搭建和深度数据处理:千问办公。
自进行Agent:
- Hermes Agent,适合将AI作为个人助理层长期使用的技术用户。
做设计:
Figma Make;
3D建模可关注TripoAI等。
做数据分析:
- Hex适合转化为可分享的数据应用;
- Tableau Agent可视化更强;
- Looker在对话式分析的模糊问题理解上表现更好。
没有什么工具能通吃所有场景(也许以后会有吧=-=),工具的价值不在于有多少人用,而在于能否真的帮你做事,减少重复劳动,解放你的双手,拓展你的能力边界。
所以,如果你有明确的使用需求,根据实际情况选一两款工具深度使用,这才是理想的使用方式。
声明:本文基于公开数据和第三方评测整理,不构成购买建议,产品选择请结合个人实际需求。文中涉及的产品评价均基于可追溯的公开数据,不同评测环境下的结果可能存在差异。部分内容含主观判断,仅供参考。
还有几项针对引用数据的说明:
- 注册用户数与月活用户数的区别:部分产品披露的是“上线首月注册用户数”或“累计用户数”,与月活跃用户数不一样,不能直接比较。
- PC客户端月活与全端月活的区别:同一产品在不同报告中的PC端月活与全端月活可能存在差得比较大,因为统计范围不同。
- 第三方评测的版本差异:同一评测机构的不同版本、不同时间点的评测结果可能存在差异。
- 数据来源的时效性:本文引用的数据以2026年公开信息为主,部分产品数据更新得比较快,建议以最新官方披露为准。