ARTICLE · 1128617
你真的懂AI吗?30期纵览:从一次回答,走到模型、评测与本地部署
黑 粉 科 技
$你真的懂AI吗?30期纵览:从一次回答,走到模型、评测与本地部署
30期不是30堂课。从一个会说话的程序、两次AI寒冬,到你电脑上真正能用的模型:沿着一条故事线,把知识、真实产物与选择连起来。
黑粉科技 · 2026-10-05▊
9 月那次测试,我让一台 64GB Mac 带着本地模型连做 5 道网页题。最后,1 题正式交付,另 3 题可运行但没有交付,还有 1 题没写完、无法运行。黑洞、城市、水墨长卷都出来了,验收表却没有跟着一起漂亮起来。能写、能跑、能把事情做完,是三个不同的门槛。
原来我想看模型能不能写代码,后来却不断排查:到底是模型、工具参数、运行引擎,还是我自己的代理程序出了问题?这些经历来自 9 月留存的记录,不是今天重跑。它们让我想把散落在评测、教程和工具开发里的知识连起来,做成《你真的懂 AI 吗?》。
这个系列计划 30 期,沿着知识库原有的全景、起源、原理、名场面、实操和边界顺序展开;只把相邻且适合一起讲的资料合并。
无论你在用 ChatGPT 还是本地模型,目标都不是多背 30 组术语,而是遇到答案不可靠、费用算不清、模型跑不动或任务做不完时,知道先检查哪一环。第一期既给你整套阅读路线,也拿一次回答示范:知识怎样变成判断和行动。

#评测录制
▍🎯 这30期,帮你从“会提问”走到“会判断”
如果你也碰过这些情况——回答很像真的却找不到出处,跑分很高却办不成事,模型能装进电脑却越聊越慢——这套系列就是为这些具体问题准备的。无需先学完编程,也不要求换电脑;练习可以从一封邮件、一段回答或一个小任务开始。
▸第 01—03 期,先看全景,再沿着两次寒冬与开放权重的赛跑走进 AI 的起源。
▸第 04—16 期,依次拆开网络、词元、向量、注意力、训练、推理和一次对话,再看模型版图、评测、文件与硬件。
▸第 17—21 期,用真实名场面回看这些机制;第 22—27 期进入本机运行、量化、知识库与工具,第 28—30 期讨论幻觉、规模和选择的边界。
前 10 期逐篇计划和练习放在后面的表格里。这一篇先让你知道:系列适合谁、黑粉科技以前做过什么,以及看懂一次回答能怎样改变你今天的用法。
▍🔍 黑粉科技做什么?把AI从发布会搬到你的桌面
如果你第一次来,这里是黑粉科技。我有台 Mac,也折腾普通电脑和自己写的软件。宗旨是“让 AI 成为你的超能力”,主要做三件事:本地跑、免费用、自己造。 重要模型发布也会跟进,但要继续追问:它解决哪件事,普通设备要付出什么,免费到哪一步,你怎样拿回一个能用的结果?
内容主线 · 我会讲什么 · 你应该获得什么
本地部署
我会讲什么 · 模型安装、内存与速度、工具调用、长任务和失败复盘
你应该获得什么 · 知道自己设备适合什么,不把能启动误当能长期用
免费资源
我会讲什么 · 免费 API、开源平替、软件与素材入口,写清额度、许可和付费墙
你应该获得什么 · 有可核实的获取与使用路径,不把一次赠金当永久免费
自制软件
我会讲什么 · 把重复操作做成工具,展示真实功能、修错过程与发行边界
你应该获得什么 · 不只看产品名,能判断它是否解决自己的问题
重要模型与原理
我会讲什么 · 核对模型开放范围、能力、格式和硬件门槛,用热点解释机制
你应该获得什么 · 面对新名词会问条件、证据和成本,不必每次都追最大的模型
完整实测与长视频以 B 站为主,YouTube 同步视频;公众号承载长文、复盘与精选提醒,官网集中保存完整文章、工具和资源入口。形式不同,标准一样:介绍和实测分清,成功和失败都看,结果要能回到记录。

#往期内容|官网精选
▍⚡ 不从零许愿:已经有哪些内容和工具?
截至 2026 年 10 月 5 日,官网已有 63 篇已发表中文原文;译文、草稿和这套尚在制作的系列没有重复计入。它们覆盖模型实测、部署教程、资源复核与工具介绍。这是内容数量,不是 63 次独立实验;下面给出能直接打开的内容入口。

#往期内容|文章归档
归档里的两篇分别问“Mac、Windows、Linux 怎么选”和“免费 API 到底还有几个能用”。前者把电脑选择拆成内存、兼容与维护,后者把免费拆成真实请求、额度和失败边界。
一个决定任务放在哪台机器上,一个决定哪些任务值得交给在线服务。这个系列会把背后的知识接起来,读完以后,你可以回到旧评测里重新判断条件,而不只记住当时的结论。
目前还有 4 款公开自制软件,把这些问题接成可以使用的功能:黑粉盒子管理免费模型 API 候选与本地路由;方寸智匣 LocalBrain 管理本地模型与多模态工具;ScreenLex 把本地影视字幕整理成英语学习词库;黑粉录屏把录制、剪辑和导出检查串起来。它们不是学习本系列的必装清单,而是部分案例的工具入口;具体平台、版本与下载见文末。
如果你今天就想拿点有用的东西,可以从下面 8 个内容入口开始。它们是已发表内容的精选路径,不是另外 8 款自制产品。
你想解决什么 · 已有内容入口 · 拿来怎么用
不知道怎样把需求说清楚
已有内容入口 · [12 个日常场景模板](https://hyphentech.top/ai-prompt-templates-12-scenes/)
拿来怎么用 · 挑场景替换自己的任务条件,别照抄夸张效率承诺
找可用的免费模型接口
已有内容入口 · [免费 AI API 复测记录](https://hyphentech.top/free-ai-api-radar-2026-09-23/)
拿来怎么用 · 先看测试日期、额度和限制,再做自己的最小请求
想用普通电脑跑模型
已有内容入口 · [11 个低内存模型的旧实测](https://hyphentech.top/localbrain-small-models-lowmem/)
拿来怎么用 · 对照设备和 8K 上下文条件,不把结论外推到任意长对话
想比较本地 AI 能力
已有内容入口 · [6 个本地 AI 的测试记录](https://hyphentech.top/mlx-local-ai-test-m5pro/)
拿来怎么用 · 查看不同任务和失败点,不只看一张速度表
想让模型做完一件事
已有内容入口 · [5 道网页游戏任务与复现材料](https://hyphentech.top/localbrain-flash-next-five-tasks/)
拿来怎么用 · 按同一验收条件看交付、能跑和放弃的区别
想比较写报告的能力
已有内容入口 · [5 个模型做同一份电影报告](https://hyphentech.top/movie-model-benchmark/)
拿来怎么用 · 比较事实、分析和交付,而不是只比回答长短
想做一集 AI 动画
已有内容入口 · [动画流程与成本分析](https://hyphentech.top/ai-animation-pipeline-cartoon-real-cost/)
拿来怎么用 · 顺着角色、镜头、声音、剪辑的环节核算投入
想找设计与开发资源
已有内容入口 · [免费资源站目录](https://hyphentech.top/free-design-resources/)
拿来怎么用 · 按用途找入口,许可证与当前免费政策仍需复核
你可以先选一条最贴近自己的路径:正在挑电脑,先看部署与内存;每天写邮件、报告,先看任务模板和事实核实;想让模型直接动手,先看五道题与交付检查。模板库覆盖 12 个日常场景;接口清单、速度与资源额度则有日期,过期了要重查,不把旧记录包装成今天的新政策。
这些旧内容不是要你一次读完,而是给下面的知识找落脚点:免费接口怎么查证,电脑怎样选,模型怎样交付。现在就拿其中那组五道题打开这一篇,先看结果,再拆开它背后的零件。
▍💰 先看一组真实作品:漂亮的作品,为什么还不算做完?
拿五道题做开篇的例子,因为它同时暴露了模型能力和系统边界。题面要求只交付一个 HTML 文件,不借第三方库、不加载网络资源,断网双击也能打开;考的是三维引力模拟、时间循环、城市寻路、中文互动长卷与神经网络可视化。
以下挑出能说明不同问题的结果,完整轮次和复现材料见五道题测试:https://hyphentech.top/localbrain-flash-next-five-tasks/。

#五题评测结果
《奇点实验室》是唯一正式交付的一题:22 轮、6902 秒,约 115 分钟,最后文件 45018 字节。模型自己提交的第三组 36 步交互检查全过;另一个独立脚本按 19 项检查通过 18 项,页面没有运行时错误。这不是“19 项全满分”,两套检查测的东西不同,不能把一次交付改写成从此不会犯错。

#自制程序|奇点实验室
这张图的吸引力在于:文字要求真的变成了可以运行的程序。可若只把截图发出来,说“本地 AI 一次搞定物理模拟”,就把中间 22 轮和失败处理都擦掉了。读者看见的是几秒钟,我付出的却是一个多小时和一条完整执行链。作品可以好看,证据不能只剩好看的那一张。
《霓虹城》显示的是另一道门槛:道路、车辆、小地图和任务都出现了,白天与夜间的状态也不同,可两小时预算到点前没有正式交付,“按 W 加速”的检查仍没过。两张图能让你看见状态变化,却不能替驾驶操作验收。这是第 14、24、26 期要继续讲的问题:测试覆盖了什么,完成又由谁判定?

#评测实图|霓虹城·白天

#评测实图|霓虹城·夜晚
《星槎异闻录》说明约束怎样被遗漏。五个场景、水墨视差、古文与今译都出现了,页面最后能运行,可原创仿古文只写了 228 字,题目要求至少 350 字。这不是古籍,也不是没有做,而是做得不完整。漂亮页面与不合格字数可以同时存在,审美满意不能替要求签字。

#评测实图|星槎异闻录
《神经元熔炉》把第 4 期的神经网络变成了可以观察的画面:样本、连接、决策边界、损失和准确率一起更新。旧核验中它有 5 个画布、22 个控件,无运行时错误,但到时未主动交付。截图里的 87.5% 属于这个演示的分类任务,不是生成它的语言模型得分;这种“分数到底在给谁打分”的误会,会接到第 14 期。

#评测实图|神经元熔炉
再看那道没有跑起来的题:《六十秒后重启》。旧记录里最后文件写到 99268 字节,仍然没闭合。代码字数很多、过程很忙,结果却不能交付。这个失败没有被我从结果表里删掉,因为它正好提醒我们:AI 输出的多少,与它实际完成的多少,不是同一个指标。
你看到的证据 · 能够支持的判断 · 暂时不能支持的判断
有一段代码
能够支持的判断 · 模型生成了程序文本
暂时不能支持的判断 · 文件已落盘、语法正确、可以运行
浏览器页面打开
能够支持的判断 · 该版本有运行画面
暂时不能支持的判断 · 全部操作、性能和边界都正确
一次自检通过
能够支持的判断 · 这组检查在这一版通过
暂时不能支持的判断 · 题目所有要求都被覆盖
按原题验收后交付
能够支持的判断 · 在这次条件下完成该任务
暂时不能支持的判断 · 换题、换模型或下一版也必定完成
同一组作品里,代码生成、状态变化、条件遗漏和完整交付同时存在。第一期先把它们放在一起区分这些门槛,后面再逐期解释原因。先回到标题里的问题:“猜下一个词”怎么能组合出程序?答案要从模型怎样生成、软件怎样执行两边拆开,不能只给它换一个“高级输入法”或“全知助理”的外号。
▍🧩 先看全景:别把14个零件的责任都算给模型
先看大象的全身照,再研究鼻子。这个办法比一上来背缩写管用:你先知道每个名词住在哪里、管什么、出了问题该检查谁。对象地图告诉你系统有哪些零件,系列计划告诉你接下来往哪走;两张地图都不是排行榜。

#系统全景
下面这张表最值得看的是第三列。回答胡编,未必是检索坏了;模型没找到文件,未必是智力不够;电脑内存够,也不代表工具链就能完成任务。把不同零件的责任分开,才不会一次失败就开始下载另一个更大的模型。图中的检索、工具和量化是可选环节,不是每次聊天都会全部经过。
零件与常见名词 · 主要管什么 · 它不保证什么
①分词与嵌入:词元、向量
主要管什么 · 把输入变成编号与模型使用的表示
它不保证什么 · 切分完成不代表事实核实;向量相似不等于正确
②模型骨架:注意力、专家网络
主要管什么 · 决定模型计算的结构与信息交互方式
它不保证什么 · 仅凭架构名不能判定成品能力
③训练:预训练、微调、偏好优化
主要管什么 · 用数据和目标更新参数
它不保证什么 · 普通聊天不会自动把新知识写入固定权重
④权重:模型参数、检查点
主要管什么 · 保存训练得到的参数
它不保证什么 · 有权重不等于具备联网、文件权限或可用服务
⑤量化:低比特权重
主要管什么 · 减少部分权重的存储与运行开销
它不保证什么 · 不是无损压缩;质量与工具调用表现可能改变
⑥推理引擎:llama.cpp、MLX
主要管什么 · 加载模型,执行计算并输出结果
它不保证什么 · 格式能识别不等于架构能运行;实现与模板会影响结果
⑦上下文与 KV 缓存
主要管什么 · 利用本轮输入和历史;复用已有键值计算
它不保证什么 · 长窗口不保证不遗漏;缓存不等于跨会话记忆
⑧采样:温度、候选截断
主要管什么 · 从输出分布选择接下来的词元
它不保证什么 · 调低温度不能给事实盖章
⑨外部记忆:检索增强、知识库
主要管什么 · 保存资料,检索后把相关片段送入上下文
它不保证什么 · 存了不等于取回;取回也不等于理解或答对
⑩工具与循环:智能体
主要管什么 · 把调用交给程序执行,读回结果并决定下一步
它不保证什么 · 模型说完成不等于动作执行或验收通过
⑪服务层:接口、队列、超时
主要管什么 · 让客户端按协议请求,管理连接与任务
它不保证什么 · 端点就绪不保证请求成功、低延迟或高并发
⑫边界:许可、权限、可靠性
主要管什么 · 明确能做、允许做及仍需核查的范围
它不保证什么 · 开放权重不自动等于任意商用;拒答也不总是能力不足
⑬评测:样本、评分、验收
主要管什么 · 在明确条件下检查能力和任务完成情况
它不保证什么 · 单项高分不能替代你的实际工作验收
⑭硬件:内存、带宽、算力
主要管什么 · 为权重、缓存和计算提供资源
它不保证什么 · 装得下不等于速度够;单一配置无法推断所有任务
试着用一分钟定位三个词:量化住在模型压缩这一站;检索增强住在外部资料这一站;智能体住在工具执行与循环这一站。它们可以一起工作,但解决的是三类问题。量化不能代替查资料,查资料不能代替真的保存文件,保存文件也不能代替验收。接下来用一封邮件把这张全景图走一遍。
▍🚀 一封邮件,先把“AI”拆开
假设你要发一封催款邮件:“对方逾期 10 天,欠款 8000 元,请改得客气一点,金额和日期不能变,不要新增承诺。”这是说明流程的例子,不是一次新实测。
聊天界面先把你的要求、邮件原文,以及需要保留的对话记录组装起来。支持系统指令的产品,还可能放入它自己的行为要求。你屏幕上看到的一句话,并不一定是模型收到的全部内容。
这里就能解释一个常见误会:为什么同一个模型,换个软件突然不听话?模型文件没变,聊天模板、默认指令、截取的历史却可能变了。Hugging Face 的聊天模板文档明确提醒,消息角色需要转成模型接受的控制标记,格式错了会损伤表现。
聊天模板说明:https://huggingface.co/docs/transformers/chat_templating
接着,分词器把文字切成词元,再换成编号。词元可以是词、字或更小的片段,并不是“一个汉字”。模型把编号变成向量,通过多层网络组合前文信息,算出接下来各个词元的候选分数。
采样程序按设定规则选择输出,把新词元接回上下文,再生成后续内容。常见自回归生成会这样逐步推进;屏幕一次跳出几个字,还受传输和界面缓冲影响,不能把屏幕动画当作内部计算次数。

#回答生成流程(示意)
这条链里,分词是编码,网络计算是模型,采样与停止是运行规则。训练则发生在另一阶段:普通聊天推理不会每回答一句,就自动把你说的话永久写进模型权重。产品能保存聊天记录或用户偏好,是另外一层存储。
顺手抓住邮件里最重要的边界:改得更礼貌是生成任务;8000 元是否保持、有没有新增付款期限,是验收任务。模型写出一段流畅文字,还不能证明这封邮件能发。
▍🧠 1966年,它只是反问,人却想和它单独聊聊
你大概以为,聊天框对面坐着一个“知道答案”的东西。可“回答很像人”和“理解得像人”,中间隔着一条很长的路。1966 年,约瑟夫·魏泽鲍姆发表了 ELIZA 程序的论文。它通过规则识别输入,把一些话改成反问,便能制造对话感。
ELIZA 还有一个耐人寻味的故事:魏泽鲍姆后来回忆,自己的秘书希望与程序单独交谈。他惊讶的不是程序突然理解了人生,而是人这么快就把对话感当成了理解。人的信任,有时会跑在机器真实能力的前面。
今天的模型远比那套规则复杂,这不意味着那条提醒已经过时。它说“我理解你的感受”,首先证明它生成了一句合适的话;能不能保住金额、找到正确文件、兑现一个任务,还得分别看证据。
▍📉 让一个只记得前一个字的程序,接着写《三字经》
python
import random
from collections import defaultdict
text = ("人之初,性本善。性相近,习相远。苟不教,性乃迁。教之道,贵以专。"
"昔孟母,择邻处。子不学,断机杼。窦燕山,有义方。教五子,名俱扬。"
"养不教,父之过。教不严,师之惰。")
follow = defaultdict(list) # 记下:每个字后面出现过哪些字
for a, b in zip(text, text[1:]):
follow[a].append(b)
print("“不”后面出现过:", follow["不"])
random.seed(7)
ch = out = "人"
for _ in range(30): # 一个字一个字往下“猜”
ch = random.choice(follow[ch]) # 出现得越多,越容易被抽中
out += ch
print(out)
真实输出:
text
“不”后面出现过: ['教', '学', '教', '严']
人之道,性本善。性乃迁。苟不严,贵以专。苟不教不严,贵以专。教
“不”后面出现过四次,两次是“教”,所以抽到“教”的机会是一半。它写出来的每一对相邻的字,在原文里都真的出现过——“苟不”“不严”“严,”——可连起来,就成了“苟不严,贵以专”这种似是而非的句子。因为它只看前一个字。
真正的大模型做的是同一件事,只改了两处:它看的不是前一个字,而是前面几千、几万个字;它的“下一个词元表”不是数出来的,而是由一个有几十亿到上万亿个参数的神经网络算出来的。
这段小程序是对照,不是一个微型 GPT。它只统计相邻字符;真正语言模型会通过参数与上下文计算更复杂的分布。笑完“苟不严,贵以专”,我们就有了一个具体问题:它保住了局部搭配,为什么保不住整段意思?后面的词元、注意力与训练,接着回答。
▍都是“猜下一个词”,凭什么能做复杂工作?
把训练目标和最后学到的能力混在一起,是这个问题最容易滑倒的地方。
想接好“这段代码会报错,因为……”,训练中就需要学到代码结构、错误模式和解释方式。为了在大量不同上下文中预测得更好,网络会形成可迁移的规律。它的输出机制仍然是生成词元,但输出可以表达推理步骤、算法、计划和程序。
就像你把“写出下一行正确的解答”作为练习目标,练久了会学到数学关系,不只是练出一种漂亮笔迹。这个比喻只解释目标与能力的区别,不表示模型拥有和人一样的理解或意识。
能力也不是只靠预训练。指令微调让它更像在回答请求,后续训练会影响推理、偏好和安全边界。2017 年的 Transformer 论文提供了注意力架构的重要基础,但今天的产品还包含模型之外的工程系统。Transformer 原始论文:https://arxiv.org/abs/1706.03762
对用户来说,最有价值的判断不是“它到底算不算真的懂”,而是:换一种问法、换一份没见过的资料,它还能稳定完成吗?如果只能复述已知答案,遇到新约束就丢条件,能力边界已经露出来了。
▍搜索、记忆、智能体:别让模型一个人背全部锅
邮件改好之后,你让它“查一下对方公司的最新地址”。这一步需要当前外部信息。支持搜索的产品可以调用工具,把资料带回对话;没调用搜索,仅凭已有参数生成地址,就不该当成已经查实。
你又说“下次都用这个署名”。它能否记住,取决于软件有没有保存偏好,以及下一次有没有把偏好交给模型。一次对话记得住,不代表重新开对话、换账户或换设备还记得住。
最后让它“替我发送”。这就越过了回答,进入工具执行。需要邮件工具、账户权限、收件人确认,还需要发送后的真实状态。一个模型说“已发送”,和发件箱里确实有这封邮件,是两种证据。

#模型与工具分工(示意)
本地部署也一样。LocalBrain 这样的工具箱负责把模型、语音、工具等连接起来;实际能力要看所选模型、运行引擎和启用的工具。
//装了一个入口,不等于获得所有模型的全部本领。
把责任拆清之后,排错就有方向了:不知道最新消息先查检索;忘记署名先查历史与记忆;工具没执行先查权限和返回值;越聊越慢再查上下文、缓存和硬件。每次换个更大的模型,未必能修好这些问题,倒可能先把内存填满。
▍一个真实修错过程:思考、工具、检查怎样接起来
下面不是一张抽象架构图,而是 LocalBrain 1.4.6 保留的旧界面:模型先检索碰撞检测资料,再写入文件;页面自检报错,编辑一处后又自检,最后显示画布存在、动画帧推进、无控制台错误。界面记录总用时 1 分 30 秒、8 轮、9 次工具、2 次失败。仅从这张图,就能分开“模型说了什么”和“工具做了什么”。

#自制程序|LocalBrain修错记录
截图中,错误是读取了不存在对象的 x 属性;后续改法先判断对象是否存在,再做碰撞处理。模型生成的解释并没有自行改变文件,真正改变文件的是编辑工具。它说“修好了”之后还要看下一次执行回执,否则只是把希望写成了过去式。
把这个过程拆成四个零件就清楚了。模型负责根据现有证据提出改法;工具把参数变成真实文件操作;检查器报告实际运行状态;代理程序保存历史、决定继续还是停止。它们协作时看起来像一个人,但任何一环坏掉,都可能把答案变成假交付。
五道题里还有一个更难处理的形态:模型的思考已经说要补 input 字段,发出的参数却仍旧照抄失败文本。后来系统不再把这段错误参数原样留给它抄,而是保留失败事实、把无效调用替换成占位。原记录中的冒烟任务从连续三次超时,变成 8 轮交付。这个变化发生在执行链,不是偷偷换了一颗更大的模型。
这也解释了为什么“多想一会儿”不是万能修复。分析正确、参数正确、执行成功、验收成立之间,仍有好几道关。你让 AI 做表格,它可以把公式解释得很漂亮,却写到错误工作表;让它改网站,它可以准确指出问题,却没有保存文件。判断聪明不聪明,最终还得落到动作。
环节 · 需要保留的证据 · 典型误判
分析
需要保留的证据 · 具体错误、原文与改法
典型误判 · 解释合理,就当作已经解决
调用
需要保留的证据 · 工具名、合法参数、授权范围
典型误判 · 声称会执行,就当作真的执行
结果
需要保留的证据 · 工具回执与当前文件
典型误判 · 写入成功,就当作内容正确
验收
需要保留的证据 · 按需求覆盖的独立检查
典型误判 · 没有报错,就当作功能全对
更新后
需要保留的证据 · 新版本重新验证
典型误判 · 改了一行,继续沿用旧版通过结果
当然,自动化也不等于人从此没事干。机器替你写文件,空出的时间可能变成检查文件;替你做了一个页面,接着又想让它做一整套。我现在更愿意把省下来的工作和新增的审核一起算,而不是只算“生成用了多少秒”。

▍词元、上下文与缓存:一个知识点怎样接到下一个
词元听起来像一节基础课,上下文像另一节,硬件又是第三节。实际使用时,它们是一串因果:文字变成词元,题面、历史和工具回执占据上下文;模型先处理输入,再生成输出;历史状态需要缓存与内存,长任务还可能反复做输入处理。最后落到你身上,就是等待、费用和能不能收尾。
先区分两种速度。预填是读输入,解码是逐步生成输出。你看到模型每秒输出很多词元,未必意味着它能很快交付:发送后先等的时间、工具运行时间、失败重试,以及最后检查文件的时间,都没被一个输出速度数字包进去。
我留存的 2026 年 9 月 27 日深度扫描很适合说明这一点。M5 Pro、Qwen3-8B Q4_K_M、llama.cpp b10357,分别在 0、4096、16384、32768 的上下文深度生成 64 词元,每档两次样本。
平均生成速度依次 54.5、48.9、37.3、28.0 词元/秒。模型没有变,深度增加后最后一档约为第一档的 51.4%。

#上下文与生成速度(旧评测)
这是一个具体配置的结果,不是“所有模型长对话都恰好减半”。可是它足以打破一个误区:上下文窗口只是容量许可,并不是速度承诺。标着能放很长内容,不代表把几十轮失败记录全部塞进去还划算。每轮反复阅读旧错误,既花计算,又可能让模型继续抄错。
五道题的恢复记录里,系统把 129446 词元的长历史整理到 22418,后续能更集中地读取文件、定位错误。这不是把过去全部清空:原始要求、目前产物和必要状态要保住。压缩太激进又会忘记约束,所以“少放点历史”也不是可以不看任务就执行的口诀。
缓存也容易被说成魔法。它可以在条件符合时复用已经计算的前缀,省去一部分重复工作;但前面消息变了、模板变了,或服务重启后原状态没恢复,收益就会变。聊天记忆负责保存与取回信息,计算缓存负责复用计算,两者不是一回事。
常见说法 · 遗漏了什么 · 你应该查什么
词元就是字数
遗漏了什么 · 不同文字、前导空格、分词器会改变切分
你应该查什么 · 同一编码器的实际计数与收费口径
窗口越大越好
遗漏了什么 · 内存、速度、有效信息密度与恢复成本
你应该查什么 · 自己的任务深度、延迟和失败记录
有记忆就不用重复要求
遗漏了什么 · 偏好有没有保存、这次有没有取回
你应该查什么 · 新对话是否真正带入关键约束
有缓存就不用再读历史
遗漏了什么 · 缓存匹配与重启恢复条件
你应该查什么 · 服务端实际缓存命中与输入耗时
本地模型没有成本
遗漏了什么 · 设备、磁盘、电力、时间与维护
你应该查什么 · 端到端耗时、占用和人工返工
这就是后面逐期展开的方式:词元接着长度、上下文和费用;上下文接着遗忘、失速与缓存;工具接着权限、执行与验收。第一期先把连接处找出来,第 5、9、16、22—26 期再分别讲细。你不必今天记住全部参数,先知道自己的问题应该回到哪一层。
▍“只会猜词”与“什么都懂”,两头都容易把人带偏
第一个误区是把输出机制当成能力上限。模型生成的是词元,可这些词元可以表达代码、数学步骤和工具参数。就像我们在网页题里看见的,短小输出机制可以组合出复杂程序。它需要的能力来自训练学到的规律,不能因为输出接口简单,就把内容也判成简单。
第二个误区恰好相反:会写复杂程序,便以为它理解了全部需求。水墨长卷有画面、有交互,古文却没到字数;城市有车有路,一个加速检查却没过。这说明能力可以很强,也可以在同一任务中出现遗漏。一个亮点不能替其它条件签字。
第三个误区是把流畅当可靠。生成目标会影响表达,但事实真假需要对应外部世界:公司地址要查来源,报价要看日期,文献要打开原文,程序要运行。模型能用同样顺畅的语气说对和说错,所以“它答得很自信”只能描述语气。
第四个误区是把产品入口当模型本领。搜索、读取本地文件、保存偏好、发送邮件,都依赖软件与工具。给模型接了一套工具,能力边界发生变化;没有这些接口,再大的模型也不会仅凭一句话就把硬盘里的文件真正改掉。
第五个误区是把演示通过当长期可靠。一次网页能跑只是样本;工具参数合法不代表业务条件都满足;一分钟成功不代表高峰期、断网、重启后也成功。要把工作真正交出去,至少先验收一个完整任务,再逐步增加长度、复杂度和权限。
对个人来说,这些差别最终影响选择:写一段可自己检查的文案,和让代理替你修改几十个文件,风险不同。钱也不是只分“云端收费、本地免费”。按量计费的一方靠请求与使用量获得收入,硬件与软件各有成本;对你最重要的是哪条路径能用较少的等待、返工和信息暴露完成任务,而不是替某一家站队。
▍卡住了,先找零件,再找对应的一期
还有一种更实用的找法:不按术语排序,直接按症状找入口。我把常见问题接到这套 30 期计划上。下面列的是优先检查方向,不是唯一故障原因;同一个症状,可能由不同环节造成。
你遇到的症状 · 先查什么 · 对应系列内容
回答很自信,出处却不存在
先查什么 · 原始资料是否支持主张,不拿自信语气当证据
对应系列内容 · 第 28 期:可靠性与核实
同样字数,账单却不同
先查什么 · 分词器、输入输出词元和收费口径
对应系列内容 · 第 5 期:词元与费用
多想很久,错项还是没少
先查什么 · 正确率、等待时间与任务收益是否一起改善
对应系列内容 · 第 9 期:推理的代价
榜单高分,自己的任务却做不完
先查什么 · 样本和评分是否匹配工作要求
对应系列内容 · 第 14、24 期:评测与体检
它说文件存好了,实际找不到
先查什么 · 工具调用、权限、路径及最终读回
对应系列内容 · 第 26 期:工具循环与验收
参数没变,答案突然发散
先查什么 · 采样设置、输入模板与软件版本
对应系列内容 · 第 23、24 期:采样与引擎
下载了模型,软件却不认
先查什么 · 文件格式、架构支持与转换条件
对应系列内容 · 第 15、24 期:模型包与引擎
模型能启动,稍长的任务就内存不足
先查什么 · 权重、缓存、工作缓冲与系统余量
对应系列内容 · 第 16、22、23 期:硬件、缓存与量化
越聊越慢,重启后又变了
先查什么 · 上下文深度、缓存命中与恢复条件
对应系列内容 · 第 16、22 期:速度与缓存
知识库已经放入,答案仍然漏条件
先查什么 · 本次检索片段是否相关、完整且真正送入模型
对应系列内容 · 第 25 期:知识库与检索
服务显示就绪,客户端还是超时
先查什么 · 请求路径、模型加载、排队与服务日志
对应系列内容 · 第 26 期:模型服务
不知道该选大模型还是小模型
先查什么 · 自己的任务、可靠性、时间、费用和设备约束
对应系列内容 · 第 25、30 期:选型与最终判断
这才是十分钟走完全程的用法:先在全景图中给一个陌生词找位置,再拿一个真实症状找到检查入口,最后对一项任务做验收。今天不要求你掌握全部 14 个零件;读完以后,能把一次失败拆成几个可检查的问题,就已经比‘再换个模型试试’多走了一步。
▍30期怎样安排?每一段都对应一件实际的事
看过一次回答和一次交付,现在再看 30 期计划,每个名字就有了位置。第 01—03 期交代全景与起源,第 04—16 期沿原顺序拆开原理,第 17—21 期走进真实名场面,第 22—27 期进入实操,第 28—30 期讨论边界。新模型与热点只在能改变理解或选择时加入,不跟着发布会打乱文章顺序。
阶段 · 期数 · 你要解决的问题
全景与起源
期数 · 1—3
你要解决的问题 · 认识模型与人的期待,回看两次寒冬和开放权重的赛跑
拆开机器
期数 · 4—16
你要解决的问题 · 参数、词元、向量、注意力、训练、推理,再接评测与硬件
名场面
期数 · 17—21
你要解决的问题 · 用真实突破与失误练判断
把它用起来
期数 · 22—27
你要解决的问题 · 部署、缓存、量化、采样、评测、知识库与服务
边界与选择
期数 · 28—30
你要解决的问题 · 幻觉、规模与自己的选型
按顺序读,你会看见概念怎样一层层接起来;也可以先从正在踩的坑跳进去。账单莫名变大看第 5 期,模型分数漂亮却办不成事看第 14、24、26 期,回答不可靠看第 28 期。下面把 30 期写清楚,不必为了阅读这个系列先买新设备。
30 期会沿着原有顺序展开:先看起源和竞争,再拆原理,随后走进名场面、实操和边界。第 4 期的网络、第 6 期的向量、第 7 期的注意力,会在第 10 期重新接成一次回答;第 8 期训练和第 9 期推理,也会接到后面的评测与可靠性。故事不孤立,概念也不各说各话。
这些是计划,不是已经发表的 30 篇。每期会配实际例子、常见误区与小练习,适合的地方再加表情包和真实故事;需要公式时给算例,需要结果时交代条件。不承诺每天一篇赶工上线:解释不足、证据不足的时候,先把问题查清,不能把读者当字数验收员。
▍为什么关注黑粉科技,又为什么要收藏官网?
如果只想解决今天的一件事,前面的文章和工具入口就够你开始;如果想以后自己判断,就沿着这套系列往下读。公众号和官网提供两种读法:一个提醒你重要内容来了,一个让你随时回来把知识和记录查全。
我会继续把官方介绍、本人实测和推断分清,保留对选择有用的失败条件。关注这里得到的应该是判断依据与可用路径,而不是每隔几天被一个“又强了”的形容词催着换模型。
官网与公众号安排同步完整文章,不做一边完整版、一边缩水版。 系列各期、日常文章、自制工具介绍与可公开资源都在同步范围内。官网定期更新全部可公开内容;公众号的系列文章将按“你真的懂 AI 吗?”合集整理。排版和附件入口可以不同,知识、证据与关键解释不删;私人知识库、凭证和内部日志不在公开范围。
订阅的作用,是不用每次自己想起来再来查。本系列首期安排推送,后续各期继续发布,但不逐篇群发。 另外会定期整理重要变化、值得复看的实测、实用资源与阶段汇总;部分精华不做面向所有人的公开推广,只通过公众号向已关注、订阅的读者推送。关注“黑粉科技”,就是接收这些精选消息与系列提醒的入口。
你想怎么读 · 建议入口 · 能获得什么
不想错过重要内容
建议入口 · 关注并订阅黑粉科技公众号
能获得什么 · 精选推送、重要更新与阶段汇总;不会每篇都群发
想按顺序补课
建议入口 · 官网系列目录,及公众号计划整理的“你真的懂 AI 吗?”合集
能获得什么 · 按期阅读同步的完整正文;后续内容随发布补齐
遇到问题再来查
建议入口 · 把 hyphentech.top 加入浏览器收藏夹
能获得什么 · 完整文章、往期内容、工具与公开资源;定期浏览更新
“只向订阅读者推送”说的是消息触达,不是把公开文章加上关注后才能阅读的门锁。公开文章依然可以通过链接阅读;是否每次收到通知,也受微信设置与平台展示影响。你可以用公众号等精选提醒,用官网主动看全量更新,两种方式互相补位。
如果这套讲法对你有用,关注“黑粉科技”,再把黑粉科技官网:https://hyphentech.top加入收藏夹。公众号用来接收精选与阶段提醒;官网用来查全量内容、补课和找资源。
后续文章与配套资料会随发布持续补齐,值得定期打开,而不只是收藏今天这一篇。电脑浏览器可按 Ctrl+D,Mac 通常是 Command+D;微信里可复制网址到常用浏览器收藏。
今天先做一个小练习:拿一段你可以公开或已脱敏的邮件,列出“要改什么”和“绝不能改什么”,再逐项核对模型的输出。你会发现,流畅、正确和能发出去,需要分别检查。下一期就从这里接着拆:它为什么能把错误写得那么像真的?
查证来源与边界
01 · 聊天模板官方说明
https://huggingface.co/docs/transformers/chat_templating
02 · Transformer原始论文
https://arxiv.org/abs/1706.03762
03 · 官网完整内容入口
https://hyphentech.top
下一期把时间拨回 1958 年前后:为什么一个会学习的想法,要穿过两次寒冬才走到今天?
下一篇接着看:1958 年,人们已经在期待会学习的机器。几十年后它才真正改变行业。中间不是一条直线上升的曲线,而是承诺、失望,以及老想法终于等到条件的故事。
工具矩阵 / 持续更新
我做的工具
这些工具都由我持续维护。预览版会明确标注,下载、更新和已知边界以发行页为准。
黑粉盒子 HyphenBox
[正式迭代]
免费大模型 API 雷达:持续复测可用性,本地统一接口,Key 只存本机
下载与更新https://github.com/HackerChi-Hub/hyphenbox-release/releases
方寸智匣 LocalBrain
[正式迭代]
本地模型的多模态 MCP 工具箱:TTS / Whisper / 视频生成一站接入
下载与更新https://github.com/HackerChi-Hub/localbrain-releases/releases
ScreenLex 光影词库
[正式迭代]
看美剧顺手把生词背了,Mac/Windows 双平台,免费
下载与更新https://github.com/HackerChi-Hub/screenlex-download/releases
黑粉录屏 HyphenScreen
[正式迭代]
录屏 + 智能剪辑一体:达芬奇式时间线、自动打码、导出前成片体检,免费
下载与更新https://github.com/HackerChi-Hub/HyphenScreen-Releases/releases
让AI成为你的超能力
黑粉科技 · 本地部署 · 免费白嫖 · 自制软件
hyphentech.top