在小山学堂学了3天,AI 圈的热门词和核心概念都知道的差不多了。
但你会不会也跟我一样,刷的 AI 资讯越多、看的产品越多、听人聊"用 AI 干了啥"越多,心里冒出来的问号反而越多:
• 饭局上,有人说「我训了个模型」,到底训了什么? • 某公司发布了一个 AI 产品,到底做了什么,含金量高吗? • 某模型公司发布了「开源模型」等于免费吗? • 宣传「跑分第一」的模型,为什么我用起来感觉不行? • 跟 AI 聊天,感觉越聊越懂我,是它在学习吗? • 据说有 AI 检测工具,能检测出「这是AI写的」,可信吗? • 有博主说ta有「提示词秘籍」值得买吗? • 问 AI 同一个问题,为什么每次答案不一样? • 为什么跟 AI 聊天觉得 AI 很聪明,但 AI 客服还是那么蠢? • 苹果手机上的 Siri 和 ChatGPT 是一种东西吗? • ……
这些疑问,原来不止我有,很多人都有,所以小山学堂入门课,专门做了一个「祛魅打假」系列,把这些问题都讲清楚了。
事先声明:个人学习体会记录,可能存在偏颇。
第一节是「有人说“我训了个模型”,到底训了什么?」。
客观上,「训模型」指的是从头预训练、后训练、微调这些让模型参数发生变化的工作。
但是,有些人在说「训模型」的时候,说的是跟AI聊天、改了提示词、挂了知识库这些都没动参数,严格说只算「用模型」的工作。
有没有让模型参数发生变化这个事情,背后的门槛和成本天差地别。

其实,能通过改提示词满足实际需求也很厉害,但用「训了个模型」这样含糊的话来包装,总有夸大其次之嫌。
课上教了三个问题,能让人在进一步沟通中弄清楚对方到底做了啥(括号部分是我的补充):
• 第一问:底座模型是什么模型?——如果是从头预训练的话,就没有底座模型,如果是微调或者用模型的话,总是有基座模型的。 • 第二问:训练花了多少算力?——训练是真金白银烧出来的。说不出成本量级的「训练」,多半没发生过。(要注意:花了多少算力的单位是FLOPs(浮点运算次数),不是Token,如果想要更清晰的答案,可以追问「用了多少张卡?跑了多久?」,懂行的会懂。) • 第三问:训练的数据哪来的?——改参数需要成规模的训练数据。对方如果答「就是把公司文档喂给它了」,那基本是挂知识库。(还可以追问「数据量有多大?跑了多少轮」,答得出来,说明至少做了微调。)
第二节是「AI圈黑话翻译器」。
各家公司的 AI 战略、产品宣发稿,总有很多让人“不明觉厉”的黑话。
但到底是什么意思,含金量高吗?
这一节课很有意思,找了 8 句经常能听到的黑话,看看它们的含金量。
以下内容结合了我的认知,不纯来源于课堂。
• 「我们自主研发了大模型」——只要不是套 API,都有含金量,可能做了微调、后训练或者从头预训练,需要再扒详细情况。 • 「基于深度自研的技术架构」——大概率是基于开源模型或框架做改造,用话术镀金。 • 「我们绝对没做套壳产品」——套壳是指拿已有大模型作为底座,加上自身界面、功能的产品,早期很多纯聊天的 AI 产品都叫「套壳」。但是这几年大家都意识到了工程化和体验的重要性,“壳”已经进化成了“harness”,所以听到这个话,可以再多聊两句。 • 「已上线100个数字员工」——配置好了100套提示词和工作量的Agent,背后是同一个模型,含金量仁者见仁,智者见智,毕竟不知道实际有没有用起来。 • 「全面拥抱智能体时代」——智能体就是Agent的中文,指能自己动手干活的 AI,但这句话本身是个口号,没有真东西。 • 「用 AI 为业务深度赋能」——让业务团队能用 AI 了也是赋能、做了“数字员工”也是赋能、做了专属产品也是赋能,「深度」太模糊,具体要看降本、增效、增收的情况。 • 「AI 原生应用」——有一定含金量,可能是围绕 AI 设计的全新产品,也可能在老产品上加了辅助的 AI 功能。 • 「我们 All in AI」——响亮的口号,在说战略已经重视了 AI 发展,但行动上不好说。
这节课之后,看到这些黑话,我就不会只被炫到,而是知道怎么找重点了。
第三节是「“开源模型“等于免费吗?」。
先给非技术背景人员说说「开源」跟「免费」为什么会产生关联关系。
在软件圈,开源给的是完整源代码,就类似一家餐厅,把菜单配方做法全部公开,那么你可以不用去餐厅就能吃上,甚至可以再开一家餐厅赚钱(但具体要看授权许可说明)。
所以当模型公司说开源了自己的模型,就有一些人认为是免费可用了。
实则不然,因为模型开源有三部分——训练数据、训练方法和权重,多数开源模型只是开放「权重」——也就是开放最终的成果模型,不开源过程。
有算力资源的可以部署了自己用(但是商用可能有限制,具体要看授权许可说明)。
完全开源的模型:
还延伸讲了另外两个概念——模型的「满血版」和「蒸馏版」。
• 满血版:通常是原始参数在千亿参数级以上大模型本体,在各大榜单上有名次,在机房才能跑得起来。 • 蒸馏版:厂商让满血大模型做老师,教出来的尺寸小几十倍的模型,能在电脑上跑。 
这节课之后,看到「模型开源」、「满血版」、「模型蒸馏」就心里有底了。
第四节是「”跑分第一“的模型,为什么用起来不行?」。
一个模型好不好用,现在的“客观”评价基准就是——看模型在评测榜单上的排名。
评测跑分,相当于模型的高考成绩单了。
但考得好,不一定的干活得干得好。因为:
• 评测场景缺失:实际要干得活不在考试范围内。 • 刷榜/数据污染:模型的训练数据里可能有题库答案,背过答案就考的好了。 • 过拟合:厂商按考纲优化模型,牺牲了一些基本能力训练。
所以跑分、排名,只能当做参考,实际看模型好不好用,还是要拿自己的活儿去测。
道理我懂,但是我以前的评测习惯是——在模型上线时,看手里有哪些活,顺便测一下。
看了这节课之后,我意识到,应该攒个私人题库——从自己的工作/业务场景中攒10个问题,想换模型的时候,把10个问题跑一遍,这样才是省事又安心的。
第五节是「AI越聊越懂我,是它在学习吗?」。
答案是——「没有」。(我刚知道的时候挺意外的。)
因为对模型来说,跟「学习」对等的概念是「训练」,结果是——模型参数会发生变化。
而「聊天」的过程中,模型参数是不会发生变化的。
那这个「越来越懂我」的感觉是怎么来的呢?
课上说,是因为在对话过程中,AI 产品把个人信息记下来,放在一个「小本本」上了,每次对话,都把这个小本本上记的内容和最新发过来的信息一起塞给模型看。
所以模型没有一点变化,但 AI 产品让人觉得模型「越聊越懂我了」。

第六节是「AI检测器说”这是AI写的“,可信吗?」。
据我所知,现在有很多网络小说都是用 AI 写的,而且很多学生写论文也是用 AI 来写。
为了相关避免大家滥用 AI,小说平台、学术平台,都有了「AI 检测器」。
我一直以为,这个工具应该是很成熟的,直到我看到了课程里的例子⬇️

说实话,我没有想到这句话会被判断为「AI 写的」,至少,我从中看不到「AI味」。
为此,我还真的去找了个检测器尝试了一下,得到了的结果是——报错:检测文本长度需大于350字。
不过,课程从原理上来分析,检测器的思路是找「AI 味」:用词是否太规范、句子是否太通顺、结构是否太整齐。
而这些恰好是公文类、标准化材料类必须的要求——通顺、规范、结构清楚,也是一些严谨写作的人的对自己的要求,很容易被误判。
所以,以目前的检测器的思路来说,确实是不能可靠的区分是「人写的」还是「AI写的」,更不能作为审核的决定性依据。
第七节是「”提示词秘籍“值得买吗?」。
一张图讲清楚,市面上卖的提示词秘籍,葫芦里卖的什么药,到底值多少钱:
真正的提示词秘籍,无外乎一句话:想清楚你的场景、任务和验收标准,在真实需求场景里持续地迭代打磨。
如果有人愿意提供可靠的方法和持续的陪练服务,直到解决问题,那确实是值得付费的。
但那最符合这项要求的人,大概率就是你自己。
第八节是「同一个问题,为什么每次答案不一样?」。
在之前的课程里学到过,生成式语言模型的工作逻辑其实就是「接话茬」。
那么,在一句话之后要接什么样的内容?本身就是没有「正确答案」的。
那么,怎么模型怎么接住问题后的下一个字呢?
就是从选项里随机挑选一个。
在给店名取名的这个示例里,可以直观体验到它的随机挑一个的。
这张图里很值得注意的点,是它旁边标了 40%、25%、20% 和 15%。
我一开始以为是实时统计的中签分布概率,后面发现不是——是模型出厂设置里带的、选择这个token的概率。
那为什么它不默认永远选概率最高的那一个?
其实可以通过调节参数,尽可能让模型选择最高概率的下一个token。
但如果这样的话,大模型就只是一个无聊的复读机,而不是现在人人称奇的智能了。
在这一课里,解锁的知识点就是——生成式大语言模型的出厂特征是「随机性」。
第九节是「AI客服为什么那么蠢?」。
这个问题相信很多人都有感受,豆包已经快要成精了,但是各大购物软件里的 AI 客服依然像人工智障一样。
我一直没想明白,背后的原因是什么,今天这一课给我了答案,其实就三个原因:
• 舍不得花钱:只接入了便宜的小模型、知识库也只做了最简单的。 • 护栏太严格:为了防止 AI 聊天出现违规或者给出商家无法交付的承诺,让模型只能按审核过的标准回答回复。 • 就是冒充的:还在用以前老式的关键词命中回复的机器人,也叫它们 AI 客服。
我还学到了可以避开人工智障客服,找到人类客服的技巧——直接说“转人工”,或者用“投诉”“维权”之类的关键词去触发转人工。
第十节是「Siri和ChatGPT是一种东西吗?」。
大多数人听过或者接触到的第一个AI助手应该都是——Siri。
一句“嘿 Siri”,手机上就会出现一个跳动的光球,至今也有十多年了。
其实我一开始对 Siri 的期待,就是一个像 ChatGPT 一样的玩意儿——能自由会话、能处理手机上的所有任务。
但 Siri 背后目前用的还是上一代技术——预置了成千上万个命令,匹配到什么就去做什么,匹配不到就只能“抱歉”,做不到像ChatGPT一样,说什么都“稳稳的接住你”。
但未来的 Siri 们,肯定会想ChatGPT、豆包看齐的,因为已经看到现在各个手机厂商都在给自家的手机助手换脑子了。
只是这个过程涉及到各种法律法规,还有设备算力提供能力等等限制,还需要一步步来。
学完「祛魅打假篇」,想说
前几天学完了 AI 热词和基础概念,感觉学到了不少,结果一看「祛魅打假篇」的这个问题清单,只能支支吾吾答上几个。
学完之后才发现原来很多看着厉害的“黑话”,背后只是假大空的口号,或是精美的镀金包装。
网上总在渲染“明天 AI 就要替代人类啦”,但真到问题现场,才看得到一切都还是毛坯阶段,发展需要循序渐进,不会因为有了 AI 一蹴而就。
还让我意识到,对自己在使用体验或学习产生的疑惑,不能觉得“我猜大概是这样”,或者“AI就是很厉害,自己能解决”就草草过了,应该去理解真正的工作机制和原理,才能建立正确的认知。
碎碎念
不知道有没有人连续看这几期学习日记,可能会发现其实内容风格一直在调整变化。
Day 1的内容是硬着头皮,尽可能地仔细写,陆陆续续写了两三天。
Day 2-3,觉得不能写那么慢了,就逼着自己按一个标准结构,用语音输入法说一大堆,然后再缩写,但现在回看,内容还是很啰嗦,
今天带着自己的思考做复述和表达,一个一个字敲下来,发现脑子跟手的距离,好像比脑子跟嘴的距离更近,敲出来的结果,阅读起来是更加符合脑子的预期的,而前两天阅读语音转文字的内容,脑子总有一些疑问,只想删删删,真是有趣。
夜雨聆风