乐于分享
好东西不私藏

普通人该如何选 AI 模型

普通人该如何选 AI 模型
TCC WEEKEND 第十七期
TCC WEEKEND这个号是七三开,有七成的内容要靠Hermes帮我去找,剩下三成是我自己去梳理这些内容,不断理出选题,一步一步把它变成一篇文章。
但这一次不太一样。这段时间看到了不少东西,想跟大家说一说。
前段时间我去了一趟菲律宾,去做一个项目落地。进到客户公司里,跟当地的PM聊起来,我问他,你们这边(整个菲律宾)AI落地得怎么样。
他说,很排斥。
她想了想又说,不是随口一句抱怨。老板一直在推,天天说要用 AI。员工这边没人教过,连从哪儿下手都不知道。
很明显的信息差问题。
具体聊到哪句话,我现在想不太起来了。但我还挺感慨的。
我不知道菲律宾那边具体是怎么抗议的。我只想又起来曾经发生的一些事。
2023 年,一批画师发现自己的画被拿去训练 AI 模型,没打招呼,也没给钱,几个人联合把小红书告了。配音演员也遇到同样的事,某配音演员发现自己的声音被人偷去做 AI 配音,播放量超过一亿次,他的收入掉到巅峰时期的五分之一。2024 年,另一位配音演员殷某打赢了全国第一起 AI 生成声音人格权侵权案,赔了二十五万。
这些都是具体到不能再具体的真实发生的事。画师告的是偷画风,配音演员告的是偷声音,两边吵的其实是一件事,我的东西凭什么被拿走。
但现在回国以后打开抖音,同质化的AI 漫剧已经铺满推荐页,条条都是爆款。每走两步就撞上一张 AI 生成的大屏广告图。AI新出的应用多到我根本来不及一个个点开。这是现在的现状。
国情不一样,这个我承认。方向上,我觉得都差不多。
你知道机会这东西,往往会藏在比较混乱的时期里。国内走过这条路两次。2000 年,《光明日报》一篇报道把电脑游戏叫作"电子海洛因",六月国家七部门联合发文治理,游戏机这个东西一禁就是十四年,直到 2014 年上海自贸区才解封。2015 年初,出租车司机在青岛、南京、济南连着罢运,抵制专车,十几个城市把它定性成黑车,到当年 10 月,上海就给滴滴快的发出了全国第一张网约车牌照。这两次,秩序建立之前那段时间,都是野蛮生长的窗口,谁先摸进去,谁就占了便宜。
AI 这一轮,混乱程度我觉得比前两次都大。现在 AI 发展的速度,网络安全这一层根本追不上,监管和教程都还没写全,这段时间就是窗口。教程一旦写全,你上手会快一百倍,但你能走到的地方,也就焊死在教程画出来的那条线上。
这篇文章想干的事很直接。趁着这扇门还虚掩着,把屋子里到底有什么,先认清楚。
什么是开源和闭源,什么是算力
打开任何一条 AI 新闻,开源和闭源这两个词都躲不开,我自己也是花了点时间才理顺的。
开源,是模型的代码或者权重公开出来,谁都能下载,放到自己的电脑或服务器上跑,也能接着改。闭源反过来,模型内部怎么做的不公开,你只能通过这家公司的 App、网页或者接口用它。
这两件事分别决定你手里握着什么,和你要不要为它掏钱,是两条不同的轴,很多人下意识把它们绑在一起,那是两个常见的误区。
第一个误区,开源等于免费。不一定。权重能免费下载,不等于运行不要钱,你自己部署要买显卡、租服务器、维护系统,模型越大,成本越高。有些开源模型还带着门槛,Meta 的 Llama 4 用的是 Llama 4 Community License,月活超过 7 亿需要额外授权。阿里的 Qwen3.8-Max 走专有商业许可证,月活过 1 亿或者收入过 2000 万美元也要拿授权。Kimi K3 更严,年营收只要过 2000 万美元,就得另签一份 Kimi K3 License。
第二个误区,闭源等于收费。也不对。Claude 有免费版,价格是 0 美元,Gemini 3.7 Flash 也有免费层。把免费做得最彻底的是智谱,GLM-4.7-Flash 完全免费。OpenAI 从 8 月 6 日起,也让 ChatGPT 免费版默认无限使用 GPT-5.6 Luna。
开源
闭源
谁能碰到模型本身
代码或权重公开,能下载,能自己部署,能接着改
只能通过官方 App、网页或者接口用
免不免费
权重可能免费,但部署要花钱,协议可能带月活或营收门槛
不等于一定收费,很多家有免费层或免费版
数据放哪
可以自己部署,数据不用出自己的服务器
数据要经过对方提供的服务
这一期出现的例子
DeepSeek V3(MIT)、腾讯混元 Hy3(Apache 2.0)、智谱 GLM-5 系(Apache 2.0)
OpenAI GPT-5.6 主力系列、Anthropic Claude 全系
我自己的判断是,国内很多模型特别爱强调开源,不只是技术理想,也是在用透明和选择权,去对抗闭源模型的收费体系。闭源厂商卖的是省心,开源厂商给的是自由和议价空间,没有哪条路天然更高级。
再说算力。这个词经常被讲得很抽象,其实拆开看就三样东西,芯片、电、还有跑芯片的机器。
模型训练和回答问题,靠的都是显卡在做海量的矩阵运算,一块显卡同时干的事,一台普通电脑的处理器要干很久。做一个大模型,需要成千上万块显卡连起来一起跑,这些显卡堆在一起就是数据中心。显卡越多,能训练的模型越大,能同时服务的人越多。
这些显卡运转起来极其耗电,所以你会看到,凡是讨论 AI 的地方,最后总会绕到能源上,谁家电便宜、电网稳,谁就能撑起更大规模的算力。这也是为什么芯片这么关键,全球能造出顶级 AI 芯片的公司就那么几家,芯片供应跟不上,再多的电和资金也堆不出算力。
芯片、电、数据中心,这几样东西最后都会变成一个数字,摊到你调用接口的账单上。8 月 13 日晚上,DeepSeek 官宣把旗舰模型 V4 Pro 的价格在高峰时段涨了 3.5 倍,官方把未来的降价计划,明着和华为昇腾 950 芯片的上市节奏挂钩。芯片供应跟上了,算力才能松快,价格才能降下来,这条链子一环扣一环。
这十二家 AI 公司,都是什么来头
全球市场先说六家。
OpenAI 这几年一直被当成 AI 行业的钟表,别人对表,它自己却在被贴身紧逼。它现在的主力是闭源的 GPT-5.6,分 Sol、Terra、Luna 三档,可以理解成大杯中杯小杯。Sol 面向复杂推理、编码和科研,接口价格每百万 token 输入 5 美元、输出 30 美元;Terra 适合日常,2 美元和 12 美元;Luna 面向高并发低成本,0.2 美元和 1.2 美元,8 月 6 日起,ChatGPT 免费版默认无限用这一档。咬得最紧的是自己人做的 Codex,2026 年 5 月的数据显示,Codex 的使用量只有 Claude Code 的四成左右,OpenAI 靠免费两个月加上庞大的对话用户基数往里导流,想把这块地盘抢回来。LMArena 上,gpt-5.5-high 这个版本 Elo 1482,排第 17(这个快照抓到的还是 5.5 版本,还没更新到最新的 5.6,两边未必是同一个模型)。日常聊天想要免费额度慷慨的人,或者需要顶级推理能力又预算够的人,都可以从这家入手。
Anthropic 是那个被别人当靶子的位置。Claude Code 在编程 agent 这个赛道占了 54% 的市场份额,财富十强里有 8 家是它的付费客户,Kimi K3 和智谱 GLM 现在公开对标的对象,都是它的 Fable 5。产品线上,Opus 5、Sonnet 5、Haiku 4.5,加一个当前最强的 Fable 5。LMArena 上 claude-fable-5 排第一,Elo 1506,编程、创意写作、专家问题都是全球第一。免费版 0 美元,Pro 17 到 20 美元,Max 100 美元起,Fable 5 接口每百万 token 输入 10 美元、输出 50 美元,不便宜。工作里大量涉及长文、代码和复杂任务,又愿意为质量付费,这家基本绕不开。
这个市场份额我查完有点意外,一家公司在一条赛道上吃掉一多半,这几年少见。
Google 这边旗舰 Gemini 3.5 Pro 还没发,投资者一直盯着它,想看 DeepMind 到底跟不跟得上 Anthropic 和 OpenAI 的脚步。现在打头阵的是 8 月 13 日发布的 3.7 Flash,被定位成企业搭建自主 AI 系统的低成本选项,接口价格每百万 token 输入 0.75 美元、输出 3.75 美元,年底涨到 1.5 美元和 7.5 美元,明显低于 Anthropic 和 OpenAI 的旗舰定价,走的是低价换生态入口的路子。LMArena 上 gemini-3.7-flash-high 排第 9,Elo 1490。经常处理图片和文档、需要多模态能力的人,或者预算有限但要做编程调试的人,这家性价比最高。
Meta 是六家里唯一一个从开源掉头往回走的。今年 4 月,它把 Llama 系列换成了闭源的 Muse Spark,理由很直接,开源没能带来清晰的营收,OpenAI 和 Anthropic 靠闭源模型的年化营收已经分别冲到 240 亿和 300 亿美元,Meta 在 AI 基础设施上砸了几百亿,账却算不平。差异化押注在社交图谱数据,购物场景能结合平台的创作者内容和用户兴趣标签,这是没有社交数据的对手复制不了的能力。旧的 Llama 4 官方 API 已经在 7 月 6 日关停。LMArena 上找不到 Meta 官方模型的成绩,我查到的只有英伟达拿 Llama 微调出来的一个变体,不是官方的,不冒充。普通人不太会直接摸到它,它更多是开发者和产品背后的底座。
xAI Grok 现在是一边接第三方的活,一边自己单干。8 月 12 日发布的 Grok 4.6,两天后就上线了 GitHub Copilot,同时覆盖 VS Code、JetBrains、Xcode 等八个开发界面。它自己公布的评测里,GDPVal-AA 知识工作测试拿到 1753 分,反超了 GPT-5.6 Sol Max 的 1728 和 Claude Fable 5 Max 的 1741。LMArena 抓到的版本号是 grok-4.20-beta1,Elo 1475,排第 24(这个版本号和刚才说的 4.6 命名体系不一样,两边未必是同一个模型)。接口价格每百万 token 输入 2 美元、输出 6 美元,SuperGrok 订阅从 10 美元的 Lite 到 300 美元的 Heavy。编程为主、想在 Copilot 里多一个模型选项的人,可以留意这家。
Mistral 是唯一一家不太适合套进聊天机器人这条评价体系里的公司。媒体爱叫它欧洲版 OpenAI,它自己走的其实更接近 Palantir 的打法,把工程师派驻到政企现场,模型直接部署在客户自己的基础设施上。Large 3 用 Apache 2.0 开源,接口价格每百万 token 输入 0.5 美元、输出 1.5 美元。LMArena 上 mistral-medium-3.5 排第 96,Elo 1427,是十二家里排得最靠后的一个。跨语言企业材料,特别在意数据留在自己服务器上、不愿意交给美国云厂商的场景,这家是少数选项之一。
再看国内六家。
DeepSeek 今年的价格坐了一趟过山车。5 月,它把旗舰 V4 Pro 的接口价格永久砍到原来的四分之一,被网上叫作"AI 大模型的斩杀线",逼得全行业跟着卷。到了 8 月 13 日晚上,它又官宣把高峰时段的输出价格从 6 元涨到 27 元,涨了 3.5 倍,8 月 17 日起正式执行峰谷计价,同时把未来的降价计划和华为昇腾 950 芯片的上市节奏绑在了一起。它另外还在做 Harness 项目,8 月 13 日用 MIT 协议开源,团队的资深研究员陈德里在社交媒体上说得很直白,简单来说就是对标 Claude Code。LMArena 上 deepseek-v4-pro 排第 51,Elo 1458;SuperCLUE 上 65.60 分排第二。数学、STEM、编程这几类活它一直很稳,就是现在得接受价格随时段浮动。
阿里通义千问的 Qwen3.8-Max 和企业级产品千问办公是同一天发布的,8 月 3 日,这不是巧合。Qwen3.8-Max 是 2.4T 的 MoE 架构,首次开放 Max 级模型的权重。千问办公对标的是腾讯 WorkBuddy 和字节 Trae,抢的是企业办公 agent 这块地盘。LMArena 上 qwen3.8-max 排第 8,Elo 1491;SuperCLUE 上以 71.48 分排第一,六个能力维度里,规划能力打到 90.94 分,是六家国内厂商里最高的。接口价格每百万 token 输入 2 美元、输出 6 美元。本来就在阿里云或者国内企业办公环境里的人,用它比单纯比跑分更有现实意义。
字节豆包月活 3.45 亿,断层式领先国内所有对手,但今年 5 月,它悄悄在 App Store 上线了付费订阅,标准版 68 元一个月,靠付费撑算力成本。行业里把它和 DeepSeek 看成断层领跑的双寡头,豆包靠中文原生优势占 C 端入口,DeepSeek 靠开源性价比啃 B 端。它对标的正是 DeepSeek 的开源路线和阿里通义的全球化路线,靠抖音、剪映、即梦这些自家生态守住用户规模。LMArena 上 dola-seed-2.0-pro 排第 56,Elo 1456;SuperCLUE 上 65.94 分,排在第二档。第一次接触 AI、想要一个打开就能用的日常入口,这家门槛最低。
Kimi 这一代把自己的对标对象换了。过去开源模型的策略是跟在闭源旗舰后面用低价追,Kimi K3 反过来,直接把自己摆到 Claude Fable 5 和 GPT-5.6 Sol 旁边比,不再对标 DeepSeek、Qwen、GLM 这些开源同行。K3 是 2.8T 参数、100 万 token 上下文,在盲测平台 Frontend Code Arena 上以 1679 分登顶,反超了 Fable 5。LMArena 上 kimi-k3-max 排第 12,Elo 1489;SuperCLUE 上 70.68 分排第一。它的问题是贵,接口按人民币算,输出每百万 token 100 元,是 DeepSeek 低价档 V4-Flash 输出定价的约 50 倍,实测同一篇论文,DeepSeek 花 1 块钱,K3 要花 54 块,而且完整的 100 万 token 上下文,要 199 元档以上的会员才能用满。长跨度、高难度的编程和研究任务,预算不太敏感,可以直接上它。
腾讯混元半年前才把成立近十年的 AI Lab 撤了,核心研发人员并入大模型部,统一向今年新加入的首席科学家姚顺雨汇报,7 月 6 日发的 Hy3,走的是实用普惠路线,不追极致跑分。它明着对标 DeepSeek、阿里通义、字节豆包这几家,用 Apache 2.0 开源加低价抢份额,海外渠道价格大概是每百万 token 0.18 美元,国内输入 1 元、输出 4 元,缓存命中只要 0.25 元。LMArena 上 hy3 排第 54,Elo 1457;SuperCLUE 上 62.13 分,在六家国内厂商里排第五。它已经放进了自家的元宝、WorkBuddy、CodeBuddy 里做验证。在意国内服务、想把调用成本压到最低,这家现在是最便宜的选项之一。
智谱 GLM 早年的口号是追赶 OpenAI,现在对标的对象换成了 Anthropic。官方公告里写得很直接,前沿智能不应该只属于少数人,也不应该被少数规则随时收回。最新的 GLM-5.3 号称是编程能力最强的开源模型,内部体感评测比上一代提升 50%,官方说编程和智能体能力已经接近 Claude Fable 5,只是这一版还没开源,仍在做安全评估。LMArena 上 glm-5.2-max 排第 33,Elo 1471;SuperCLUE 上 63.27 分排第四。它 2026 年 1 月已经在港交所上市。面对一个很大的代码库,需要模型理解多个模块怎么连接,这是它的强项。
对标对象从 OpenAI 换成 Anthropic,这步棋走得很清楚,编程 agent 这条赛道,这几年谁都在抢。
企业 AI 落地,到底是什么样子
认完这十二家,AI 到企业手里,会长成另一种样子。
Gartner 预测,到 2026 年底,40% 的企业应用会嵌入任务型 AI 智能体。现在排在需求最前面的是智能体,能处理具体业务决策的专业智能体,正在把泛用型聊天机器人挤到辅助位。往后一步是数字员工,2025 年主要落在客服、导购这类高频交互场景,占比接近一半,2026 年开始往更深的业务场景铺。排在最后的是知识库问答,它现在更像是打底的基础设施,不是终点,企业高管早就吐槽过,光靠知识库问答提效果,始终碰不到核心业务。
普通人现在最容易搞混的,是 coding agent 和 AIGC,它们不是一回事。
普通聊天式编程是这样的,你问 AI 一段代码怎么改,它给答案,你复制到编辑器里跑,报错了再贴回去。Coding agent 不一样,你把任务交给它,它自己读项目、写代码、跑程序、看报错、接着改,你给的是目标,不是每一步操作,更像给一个程序员派活。Claude Opus 5、Grok 4.6、DeepSeek V4 Pro、Kimi K3、GLM 都在往这个方向走。普通人不写代码,不用为了赶潮流强学;工作里有大量重复操作,或者想做点小工具、处理批量文件,可以从小任务开始试,比如修一个明确的报错,别第一次就让它独立搞一个支付系统。
AIGC 是让 AI 从读内容走向造内容,图片、视频、音乐都算。这条线的门槛没有宣传里那么低,生成一张还不错的图容易,连续生成十张人物一致、能直接商用的图就难了。刚开始别追一键大片,先拿它做低风险、容易判断结果的东西,封面、配图、分镜草稿,等你摸清楚自己对构图、风格、一致性有什么要求,再进入正式生产。
最后
模型还会一直更新下去。今天 GPT-5.6 Luna 变成免费版默认,明天 Gemini 3.5 Pro 真的发了,后天 GLM-5.3 也开源了,把精力全砸在追版本号上,很可能知道了全世界发生了什么,却没来得及用 AI 干成一件事
回到开头那件事,游戏机禁令锁了十四年,专车从黑车到持牌用了九个月,AI 这一轮,从画师告小红书算起已经三年,走到哪个区间,我说不准。我知道的是,这段没有标准答案的时间迟早会结束,教程迟早会写全,写全那天,你的上限也就跟着写进了那本教程里,改不动了。
菲律宾那位员工的问题很简单,没人教她。这句话我想起来的时候是替她感慨,回头一想,这句话对我们自己也一样成立,只是我们这边的处境换了个说法,教程还没写完之前,你愿不愿意自己先去试。
先听懂开源和闭源,知道自己是在买省心还是在要选择权。再把这十二家公司认全,知道谁在对标谁,谁的优势在哪,谁的短板是什么。然后想清楚自己的活该配哪家,日常聊天先用免费的,编程按任务大小选,需要长上下文和深度研究要舍得花钱。等这些都摸顺了,再碰 coding agent 和 AIGC。
搞清楚你想要什么,比追新版本重要得多,这句话我在很多地方都听过。这一次我想加一句,比它更重要的,是趁着没人告诉你该怎么做的这段时间,自己先去试一次。
参考来源
  • OpenAI 官方博客、ChatGPT 官方更新说明、OpenAI API 定价页
  • Anthropic 官方 Claude 模型发布博客及 API 定价页;Claude Code 市场份额与财富十强客户数据来自 Agentic Coding 行业分析报道
  • Google Gemini 官方发布说明;Gemini 3.7 Flash 发布报道,来源 SiliconANGLE、Axios、Yahoo Finance 交叉核实
  • Meta Muse Spark 转型报道,来源 36 氪、知乎相关问答、CSDN、ibco.com.tw 深度解析
  • xAI Grok 4.6 官方发布说明(x.ai)、GitHub Changelog、Unite.AI 报道
  • Mistral AI 官方博客;"欧洲 OpenAI"定位分析,来源 Judy AI Lab、TechCrunch
  • DeepSeek 官方定价公告;5 月降价与 8 月涨价报道,来源财新、赛迪网、AI 工具实验室
  • DeepSeek Harness 团队成员陈德里公开表态,转引自 CSDN、知乎相关报道
  • 阿里通义千问官方发布、阿里云开发者社区文章、it168 关于 Qwen3.8-Max 与千问办公的报道
  • 字节跳动豆包相关行业数据,来源 QuestMobile 月活统计、搜狐及 CSDN 关于商业化转型的报道
  • 月之暗面 Kimi K3 官方发布说明;实测数据来源钛媒体、财经头条、知乎相关文章
  • 腾讯混元 Hy3 官方发布说明、新华网、腾讯新闻关于团队重组的报道
  • 智谱 GLM/Z.ai 官方发布博客、IT之家、新浪科技关于 GLM-5.3 的报道
  • LMArena Leaderboard(arena.ai/leaderboard)、SuperCLUE 2026 年 7 月通用榜(SuperClueAI.com)
  • 菲律宾 BPO 行业 AI 冲击相关背景资料,来源 Philstar、Manila Bulletin、Outsource Accelerator(CODE AI campaign 与 BIEN 调查)、Capital Economics 行业分析,未在正文直接引用具体数据,仅作背景参考
  • 《光明日报》"电子海洛因"事件相关报道,来源品玩、知乎相关问答梳理
  • 2015 年出租车罢运抵制专车事件报道,来源中新网、新浪汽车、虎嗅
  • 中国 AI 绘画与 AI 配音维权事件报道,来源腾讯新闻、36 氪、新华网、光明网等关于画师诉讼、AI 盗声、AI 生成声音人格权侵权案的交叉报道
  • 2026 企业 AI 落地趋势报告,来源 Gartner 预测、搜狐、实在智能、IT之家关于数字员工与智能体落地排序的报道