夜雨聆风学习资料网

ARTICLE · 1128617

你真的懂AI吗?30期纵览:从一次回答,走到模型、评测与本地部署

你真的懂AI吗?30期纵览:从一次回答,走到模型、评测与本地部署

黑 粉 科 技

● ● ●你真的懂AI吗? · 第01期

$你真的懂AI吗?30期纵览:从一次回答,走到模型、评测与本地部署

30期不是30堂课。从一个会说话的程序、两次AI寒冬,到你电脑上真正能用的模型:沿着一条故事线,把知识、真实产物与选择连起来。

黑粉科技 · 2026-10-05▊

9 月那次测试,我让一台 64GB Mac 带着本地模型连做 5 道网页题。最后,1 题正式交付,另 3 题可运行但没有交付,还有 1 题没写完、无法运行。黑洞、城市、水墨长卷都出来了,验收表却没有跟着一起漂亮起来。能写、能跑、能把事情做完,是三个不同的门槛。

原来我想看模型能不能写代码,后来却不断排查:到底是模型、工具参数、运行引擎,还是我自己的代理程序出了问题?这些经历来自 9 月留存的记录,不是今天重跑。它们让我想把散落在评测、教程和工具开发里的知识连起来,做成《你真的懂 AI 吗?》。

这个系列计划 30 期,沿着知识库原有的全景、起源、原理、名场面、实操和边界顺序展开;只把相邻且适合一起讲的资料合并。

无论你在用 ChatGPT 还是本地模型,目标都不是多背 30 组术语,而是遇到答案不可靠、费用算不清、模型跑不动或任务做不完时,知道先检查哪一环。第一期既给你整套阅读路线,也拿一次回答示范:知识怎样变成判断和行动。

#评测录制

▍🎯 这30期,帮你从“会提问”走到“会判断”

如果你也碰过这些情况——回答很像真的却找不到出处,跑分很高却办不成事,模型能装进电脑却越聊越慢——这套系列就是为这些具体问题准备的。无需先学完编程,也不要求换电脑;练习可以从一封邮件、一段回答或一个小任务开始。

▸第 01—03 期,先看全景,再沿着两次寒冬与开放权重的赛跑走进 AI 的起源。

▸第 04—16 期,依次拆开网络、词元、向量、注意力、训练、推理和一次对话,再看模型版图、评测、文件与硬件。

▸第 17—21 期,用真实名场面回看这些机制;第 22—27 期进入本机运行、量化、知识库与工具,第 28—30 期讨论幻觉、规模和选择的边界。

前 10 期逐篇计划和练习放在后面的表格里。这一篇先让你知道:系列适合谁、黑粉科技以前做过什么,以及看懂一次回答能怎样改变你今天的用法。

▍🔍 黑粉科技做什么?把AI从发布会搬到你的桌面

如果你第一次来,这里是黑粉科技。我有台 Mac,也折腾普通电脑和自己写的软件。宗旨是“让 AI 成为你的超能力”,主要做三件事:本地跑、免费用、自己造。 重要模型发布也会跟进,但要继续追问:它解决哪件事,普通设备要付出什么,免费到哪一步,你怎样拿回一个能用的结果?

内容主线 · 我会讲什么 · 你应该获得什么

本地部署

我会讲什么 · 模型安装、内存与速度、工具调用、长任务和失败复盘

你应该获得什么 · 知道自己设备适合什么,不把能启动误当能长期用

免费资源

我会讲什么 · 免费 API、开源平替、软件与素材入口,写清额度、许可和付费墙

你应该获得什么 · 有可核实的获取与使用路径,不把一次赠金当永久免费

自制软件

我会讲什么 · 把重复操作做成工具,展示真实功能、修错过程与发行边界

你应该获得什么 · 不只看产品名,能判断它是否解决自己的问题

重要模型与原理

我会讲什么 · 核对模型开放范围、能力、格式和硬件门槛,用热点解释机制

你应该获得什么 · 面对新名词会问条件、证据和成本,不必每次都追最大的模型

完整实测与长视频以 B 站为主,YouTube 同步视频;公众号承载长文、复盘与精选提醒,官网集中保存完整文章、工具和资源入口。形式不同,标准一样:介绍和实测分清,成功和失败都看,结果要能回到记录。

#往期内容|官网精选

▍⚡ 不从零许愿:已经有哪些内容和工具?

截至 2026 年 10 月 5 日,官网已有 63 篇已发表中文原文;译文、草稿和这套尚在制作的系列没有重复计入。它们覆盖模型实测、部署教程、资源复核与工具介绍。这是内容数量,不是 63 次独立实验;下面给出能直接打开的内容入口。

#往期内容|文章归档

归档里的两篇分别问“Mac、Windows、Linux 怎么选”和“免费 API 到底还有几个能用”。前者把电脑选择拆成内存、兼容与维护,后者把免费拆成真实请求、额度和失败边界。

一个决定任务放在哪台机器上,一个决定哪些任务值得交给在线服务。这个系列会把背后的知识接起来,读完以后,你可以回到旧评测里重新判断条件,而不只记住当时的结论。

目前还有 4 款公开自制软件,把这些问题接成可以使用的功能:黑粉盒子管理免费模型 API 候选与本地路由;方寸智匣 LocalBrain 管理本地模型与多模态工具;ScreenLex 把本地影视字幕整理成英语学习词库;黑粉录屏把录制、剪辑和导出检查串起来。它们不是学习本系列的必装清单,而是部分案例的工具入口;具体平台、版本与下载见文末。

如果你今天就想拿点有用的东西,可以从下面 8 个内容入口开始。它们是已发表内容的精选路径,不是另外 8 款自制产品。

你想解决什么 · 已有内容入口 · 拿来怎么用

不知道怎样把需求说清楚

已有内容入口 · [12 个日常场景模板](https://hyphentech.top/ai-prompt-templates-12-scenes/)

拿来怎么用 · 挑场景替换自己的任务条件,别照抄夸张效率承诺

找可用的免费模型接口

已有内容入口 · [免费 AI API 复测记录](https://hyphentech.top/free-ai-api-radar-2026-09-23/)

拿来怎么用 · 先看测试日期、额度和限制,再做自己的最小请求

想用普通电脑跑模型

已有内容入口 · [11 个低内存模型的旧实测](https://hyphentech.top/localbrain-small-models-lowmem/)

拿来怎么用 · 对照设备和 8K 上下文条件,不把结论外推到任意长对话

想比较本地 AI 能力

已有内容入口 · [6 个本地 AI 的测试记录](https://hyphentech.top/mlx-local-ai-test-m5pro/)

拿来怎么用 · 查看不同任务和失败点,不只看一张速度表

想让模型做完一件事

已有内容入口 · [5 道网页游戏任务与复现材料](https://hyphentech.top/localbrain-flash-next-five-tasks/)

拿来怎么用 · 按同一验收条件看交付、能跑和放弃的区别

想比较写报告的能力

已有内容入口 · [5 个模型做同一份电影报告](https://hyphentech.top/movie-model-benchmark/)

拿来怎么用 · 比较事实、分析和交付,而不是只比回答长短

想做一集 AI 动画

已有内容入口 · [动画流程与成本分析](https://hyphentech.top/ai-animation-pipeline-cartoon-real-cost/)

拿来怎么用 · 顺着角色、镜头、声音、剪辑的环节核算投入

想找设计与开发资源

已有内容入口 · [免费资源站目录](https://hyphentech.top/free-design-resources/)

拿来怎么用 · 按用途找入口,许可证与当前免费政策仍需复核

你可以先选一条最贴近自己的路径:正在挑电脑,先看部署与内存;每天写邮件、报告,先看任务模板和事实核实;想让模型直接动手,先看五道题与交付检查。模板库覆盖 12 个日常场景;接口清单、速度与资源额度则有日期,过期了要重查,不把旧记录包装成今天的新政策。

这些旧内容不是要你一次读完,而是给下面的知识找落脚点:免费接口怎么查证,电脑怎样选,模型怎样交付。现在就拿其中那组五道题打开这一篇,先看结果,再拆开它背后的零件。

▍💰 先看一组真实作品:漂亮的作品,为什么还不算做完?

拿五道题做开篇的例子,因为它同时暴露了模型能力和系统边界。题面要求只交付一个 HTML 文件,不借第三方库、不加载网络资源,断网双击也能打开;考的是三维引力模拟、时间循环、城市寻路、中文互动长卷与神经网络可视化。

以下挑出能说明不同问题的结果,完整轮次和复现材料见五道题测试:https://hyphentech.top/localbrain-flash-next-five-tasks/。

#五题评测结果

《奇点实验室》是唯一正式交付的一题:22 轮、6902 秒,约 115 分钟,最后文件 45018 字节。模型自己提交的第三组 36 步交互检查全过;另一个独立脚本按 19 项检查通过 18 项,页面没有运行时错误。这不是“19 项全满分”,两套检查测的东西不同,不能把一次交付改写成从此不会犯错。

#自制程序|奇点实验室

这张图的吸引力在于:文字要求真的变成了可以运行的程序。可若只把截图发出来,说“本地 AI 一次搞定物理模拟”,就把中间 22 轮和失败处理都擦掉了。读者看见的是几秒钟,我付出的却是一个多小时和一条完整执行链。作品可以好看,证据不能只剩好看的那一张。

《霓虹城》显示的是另一道门槛:道路、车辆、小地图和任务都出现了,白天与夜间的状态也不同,可两小时预算到点前没有正式交付,“按 W 加速”的检查仍没过。两张图能让你看见状态变化,却不能替驾驶操作验收。这是第 14、24、26 期要继续讲的问题:测试覆盖了什么,完成又由谁判定?

#评测实图|霓虹城·白天

#评测实图|霓虹城·夜晚

《星槎异闻录》说明约束怎样被遗漏。五个场景、水墨视差、古文与今译都出现了,页面最后能运行,可原创仿古文只写了 228 字,题目要求至少 350 字。这不是古籍,也不是没有做,而是做得不完整。漂亮页面与不合格字数可以同时存在,审美满意不能替要求签字。

#评测实图|星槎异闻录

《神经元熔炉》把第 4 期的神经网络变成了可以观察的画面:样本、连接、决策边界、损失和准确率一起更新。旧核验中它有 5 个画布、22 个控件,无运行时错误,但到时未主动交付。截图里的 87.5% 属于这个演示的分类任务,不是生成它的语言模型得分;这种“分数到底在给谁打分”的误会,会接到第 14 期。

#评测实图|神经元熔炉

再看那道没有跑起来的题:《六十秒后重启》。旧记录里最后文件写到 99268 字节,仍然没闭合。代码字数很多、过程很忙,结果却不能交付。这个失败没有被我从结果表里删掉,因为它正好提醒我们:AI 输出的多少,与它实际完成的多少,不是同一个指标。

你看到的证据 · 能够支持的判断 · 暂时不能支持的判断

有一段代码

能够支持的判断 · 模型生成了程序文本

暂时不能支持的判断 · 文件已落盘、语法正确、可以运行

浏览器页面打开

能够支持的判断 · 该版本有运行画面

暂时不能支持的判断 · 全部操作、性能和边界都正确

一次自检通过

能够支持的判断 · 这组检查在这一版通过

暂时不能支持的判断 · 题目所有要求都被覆盖

按原题验收后交付

能够支持的判断 · 在这次条件下完成该任务

暂时不能支持的判断 · 换题、换模型或下一版也必定完成

同一组作品里,代码生成、状态变化、条件遗漏和完整交付同时存在。第一期先把它们放在一起区分这些门槛,后面再逐期解释原因。先回到标题里的问题:“猜下一个词”怎么能组合出程序?答案要从模型怎样生成、软件怎样执行两边拆开,不能只给它换一个“高级输入法”或“全知助理”的外号。

▍🧩 先看全景:别把14个零件的责任都算给模型

先看大象的全身照,再研究鼻子。这个办法比一上来背缩写管用:你先知道每个名词住在哪里、管什么、出了问题该检查谁。对象地图告诉你系统有哪些零件,系列计划告诉你接下来往哪走;两张地图都不是排行榜。

#系统全景

下面这张表最值得看的是第三列。回答胡编,未必是检索坏了;模型没找到文件,未必是智力不够;电脑内存够,也不代表工具链就能完成任务。把不同零件的责任分开,才不会一次失败就开始下载另一个更大的模型。图中的检索、工具和量化是可选环节,不是每次聊天都会全部经过。

零件与常见名词 · 主要管什么 · 它不保证什么

①分词与嵌入:词元、向量

主要管什么 · 把输入变成编号与模型使用的表示

它不保证什么 · 切分完成不代表事实核实;向量相似不等于正确

②模型骨架:注意力、专家网络

主要管什么 · 决定模型计算的结构与信息交互方式

它不保证什么 · 仅凭架构名不能判定成品能力

③训练:预训练、微调、偏好优化

主要管什么 · 用数据和目标更新参数

它不保证什么 · 普通聊天不会自动把新知识写入固定权重

④权重:模型参数、检查点

主要管什么 · 保存训练得到的参数

它不保证什么 · 有权重不等于具备联网、文件权限或可用服务

⑤量化:低比特权重

主要管什么 · 减少部分权重的存储与运行开销

它不保证什么 · 不是无损压缩;质量与工具调用表现可能改变

⑥推理引擎:llama.cpp、MLX

主要管什么 · 加载模型,执行计算并输出结果

它不保证什么 · 格式能识别不等于架构能运行;实现与模板会影响结果

⑦上下文与 KV 缓存

主要管什么 · 利用本轮输入和历史;复用已有键值计算

它不保证什么 · 长窗口不保证不遗漏;缓存不等于跨会话记忆

⑧采样:温度、候选截断

主要管什么 · 从输出分布选择接下来的词元

它不保证什么 · 调低温度不能给事实盖章

⑨外部记忆:检索增强、知识库

主要管什么 · 保存资料,检索后把相关片段送入上下文

它不保证什么 · 存了不等于取回;取回也不等于理解或答对

⑩工具与循环:智能体

主要管什么 · 把调用交给程序执行,读回结果并决定下一步

它不保证什么 · 模型说完成不等于动作执行或验收通过

⑪服务层:接口、队列、超时

主要管什么 · 让客户端按协议请求,管理连接与任务

它不保证什么 · 端点就绪不保证请求成功、低延迟或高并发

⑫边界:许可、权限、可靠性

主要管什么 · 明确能做、允许做及仍需核查的范围

它不保证什么 · 开放权重不自动等于任意商用;拒答也不总是能力不足

⑬评测:样本、评分、验收

主要管什么 · 在明确条件下检查能力和任务完成情况

它不保证什么 · 单项高分不能替代你的实际工作验收

⑭硬件:内存、带宽、算力

主要管什么 · 为权重、缓存和计算提供资源

它不保证什么 · 装得下不等于速度够;单一配置无法推断所有任务

试着用一分钟定位三个词:量化住在模型压缩这一站;检索增强住在外部资料这一站;智能体住在工具执行与循环这一站。它们可以一起工作,但解决的是三类问题。量化不能代替查资料,查资料不能代替真的保存文件,保存文件也不能代替验收。接下来用一封邮件把这张全景图走一遍。

▍🚀 一封邮件,先把“AI”拆开

假设你要发一封催款邮件:“对方逾期 10 天,欠款 8000 元,请改得客气一点,金额和日期不能变,不要新增承诺。”这是说明流程的例子,不是一次新实测。

聊天界面先把你的要求、邮件原文,以及需要保留的对话记录组装起来。支持系统指令的产品,还可能放入它自己的行为要求。你屏幕上看到的一句话,并不一定是模型收到的全部内容。

这里就能解释一个常见误会:为什么同一个模型,换个软件突然不听话?模型文件没变,聊天模板、默认指令、截取的历史却可能变了。Hugging Face 的聊天模板文档明确提醒,消息角色需要转成模型接受的控制标记,格式错了会损伤表现。

聊天模板说明:https://huggingface.co/docs/transformers/chat_templating

接着,分词器把文字切成词元,再换成编号。词元可以是词、字或更小的片段,并不是“一个汉字”。模型把编号变成向量,通过多层网络组合前文信息,算出接下来各个词元的候选分数。

采样程序按设定规则选择输出,把新词元接回上下文,再生成后续内容。常见自回归生成会这样逐步推进;屏幕一次跳出几个字,还受传输和界面缓冲影响,不能把屏幕动画当作内部计算次数。

#回答生成流程(示意)

这条链里,分词是编码,网络计算是模型,采样与停止是运行规则。训练则发生在另一阶段:普通聊天推理不会每回答一句,就自动把你说的话永久写进模型权重。产品能保存聊天记录或用户偏好,是另外一层存储。

顺手抓住邮件里最重要的边界:改得更礼貌是生成任务;8000 元是否保持、有没有新增付款期限,是验收任务。模型写出一段流畅文字,还不能证明这封邮件能发。

▍🧠 1966年,它只是反问,人却想和它单独聊聊

你大概以为,聊天框对面坐着一个“知道答案”的东西。可“回答很像人”和“理解得像人”,中间隔着一条很长的路。1966 年,约瑟夫·魏泽鲍姆发表了 ELIZA 程序的论文。它通过规则识别输入,把一些话改成反问,便能制造对话感。

ELIZA 还有一个耐人寻味的故事:魏泽鲍姆后来回忆,自己的秘书希望与程序单独交谈。他惊讶的不是程序突然理解了人生,而是人这么快就把对话感当成了理解。人的信任,有时会跑在机器真实能力的前面。

今天的模型远比那套规则复杂,这不意味着那条提醒已经过时。它说“我理解你的感受”,首先证明它生成了一句合适的话;能不能保住金额、找到正确文件、兑现一个任务,还得分别看证据。

▍📉 让一个只记得前一个字的程序,接着写《三字经》

python

import random

from collections import defaultdict

​

text = ("人之初,性本善。性相近,习相远。苟不教,性乃迁。教之道,贵以专。"

        "昔孟母,择邻处。子不学,断机杼。窦燕山,有义方。教五子,名俱扬。"

        "养不教,父之过。教不严,师之惰。")

​

follow = defaultdict(list)            # 记下:每个字后面出现过哪些字

for a, b in zip(text, text[1:]):

    follow[a].append(b)

​

print("“不”后面出现过:", follow["不"])

​

random.seed(7)

ch = out = "人"

for _ in range(30):                   # 一个字一个字往下“猜”

    ch = random.choice(follow[ch])    # 出现得越多,越容易被抽中

    out += ch

print(out)

真实输出:

text

“不”后面出现过: ['教', '学', '教', '严']

人之道,性本善。性乃迁。苟不严,贵以专。苟不教不严,贵以专。教

“不”后面出现过四次,两次是“教”,所以抽到“教”的机会是一半。它写出来的每一对相邻的字,在原文里都真的出现过——“苟不”“不严”“严,”——可连起来,就成了“苟不严,贵以专”这种似是而非的句子。因为它只看前一个字。

真正的大模型做的是同一件事,只改了两处:它看的不是前一个字,而是前面几千、几万个字;它的“下一个词元表”不是数出来的,而是由一个有几十亿到上万亿个参数的神经网络算出来的。

这段小程序是对照,不是一个微型 GPT。它只统计相邻字符;真正语言模型会通过参数与上下文计算更复杂的分布。笑完“苟不严,贵以专”,我们就有了一个具体问题:它保住了局部搭配,为什么保不住整段意思?后面的词元、注意力与训练,接着回答。

▍都是“猜下一个词”,凭什么能做复杂工作?

把训练目标和最后学到的能力混在一起,是这个问题最容易滑倒的地方。

想接好“这段代码会报错,因为……”,训练中就需要学到代码结构、错误模式和解释方式。为了在大量不同上下文中预测得更好,网络会形成可迁移的规律。它的输出机制仍然是生成词元,但输出可以表达推理步骤、算法、计划和程序。

就像你把“写出下一行正确的解答”作为练习目标,练久了会学到数学关系,不只是练出一种漂亮笔迹。这个比喻只解释目标与能力的区别,不表示模型拥有和人一样的理解或意识。

能力也不是只靠预训练。指令微调让它更像在回答请求,后续训练会影响推理、偏好和安全边界。2017 年的 Transformer 论文提供了注意力架构的重要基础,但今天的产品还包含模型之外的工程系统。Transformer 原始论文:https://arxiv.org/abs/1706.03762

对用户来说,最有价值的判断不是“它到底算不算真的懂”,而是:换一种问法、换一份没见过的资料,它还能稳定完成吗?如果只能复述已知答案,遇到新约束就丢条件,能力边界已经露出来了。

▍搜索、记忆、智能体:别让模型一个人背全部锅

邮件改好之后,你让它“查一下对方公司的最新地址”。这一步需要当前外部信息。支持搜索的产品可以调用工具,把资料带回对话;没调用搜索,仅凭已有参数生成地址,就不该当成已经查实。

你又说“下次都用这个署名”。它能否记住,取决于软件有没有保存偏好,以及下一次有没有把偏好交给模型。一次对话记得住,不代表重新开对话、换账户或换设备还记得住。

最后让它“替我发送”。这就越过了回答,进入工具执行。需要邮件工具、账户权限、收件人确认,还需要发送后的真实状态。一个模型说“已发送”,和发件箱里确实有这封邮件,是两种证据。

#模型与工具分工(示意)

本地部署也一样。LocalBrain 这样的工具箱负责把模型、语音、工具等连接起来;实际能力要看所选模型、运行引擎和启用的工具。

//装了一个入口,不等于获得所有模型的全部本领。

把责任拆清之后,排错就有方向了:不知道最新消息先查检索;忘记署名先查历史与记忆;工具没执行先查权限和返回值;越聊越慢再查上下文、缓存和硬件。每次换个更大的模型,未必能修好这些问题,倒可能先把内存填满。

▍一个真实修错过程:思考、工具、检查怎样接起来

下面不是一张抽象架构图,而是 LocalBrain 1.4.6 保留的旧界面:模型先检索碰撞检测资料,再写入文件;页面自检报错,编辑一处后又自检,最后显示画布存在、动画帧推进、无控制台错误。界面记录总用时 1 分 30 秒、8 轮、9 次工具、2 次失败。仅从这张图,就能分开“模型说了什么”和“工具做了什么”。

#自制程序|LocalBrain修错记录

截图中,错误是读取了不存在对象的 x 属性;后续改法先判断对象是否存在,再做碰撞处理。模型生成的解释并没有自行改变文件,真正改变文件的是编辑工具。它说“修好了”之后还要看下一次执行回执,否则只是把希望写成了过去式。

把这个过程拆成四个零件就清楚了。模型负责根据现有证据提出改法;工具把参数变成真实文件操作;检查器报告实际运行状态;代理程序保存历史、决定继续还是停止。它们协作时看起来像一个人,但任何一环坏掉,都可能把答案变成假交付。

五道题里还有一个更难处理的形态:模型的思考已经说要补 input 字段,发出的参数却仍旧照抄失败文本。后来系统不再把这段错误参数原样留给它抄,而是保留失败事实、把无效调用替换成占位。原记录中的冒烟任务从连续三次超时,变成 8 轮交付。这个变化发生在执行链,不是偷偷换了一颗更大的模型。

这也解释了为什么“多想一会儿”不是万能修复。分析正确、参数正确、执行成功、验收成立之间,仍有好几道关。你让 AI 做表格,它可以把公式解释得很漂亮,却写到错误工作表;让它改网站,它可以准确指出问题,却没有保存文件。判断聪明不聪明,最终还得落到动作。

环节 · 需要保留的证据 · 典型误判

分析

需要保留的证据 · 具体错误、原文与改法

典型误判 · 解释合理,就当作已经解决

调用

需要保留的证据 · 工具名、合法参数、授权范围

典型误判 · 声称会执行,就当作真的执行

结果

需要保留的证据 · 工具回执与当前文件

典型误判 · 写入成功,就当作内容正确

验收

需要保留的证据 · 按需求覆盖的独立检查

典型误判 · 没有报错,就当作功能全对

更新后

需要保留的证据 · 新版本重新验证

典型误判 · 改了一行,继续沿用旧版通过结果

当然,自动化也不等于人从此没事干。机器替你写文件,空出的时间可能变成检查文件;替你做了一个页面,接着又想让它做一整套。我现在更愿意把省下来的工作和新增的审核一起算,而不是只算“生成用了多少秒”。

▍词元、上下文与缓存:一个知识点怎样接到下一个

词元听起来像一节基础课,上下文像另一节,硬件又是第三节。实际使用时,它们是一串因果:文字变成词元,题面、历史和工具回执占据上下文;模型先处理输入,再生成输出;历史状态需要缓存与内存,长任务还可能反复做输入处理。最后落到你身上,就是等待、费用和能不能收尾。

先区分两种速度。预填是读输入,解码是逐步生成输出。你看到模型每秒输出很多词元,未必意味着它能很快交付:发送后先等的时间、工具运行时间、失败重试,以及最后检查文件的时间,都没被一个输出速度数字包进去。

我留存的 2026 年 9 月 27 日深度扫描很适合说明这一点。M5 Pro、Qwen3-8B Q4_K_M、llama.cpp b10357,分别在 0、4096、16384、32768 的上下文深度生成 64 词元,每档两次样本。

平均生成速度依次 54.5、48.9、37.3、28.0 词元/秒。模型没有变,深度增加后最后一档约为第一档的 51.4%。

#上下文与生成速度(旧评测)

这是一个具体配置的结果,不是“所有模型长对话都恰好减半”。可是它足以打破一个误区:上下文窗口只是容量许可,并不是速度承诺。标着能放很长内容,不代表把几十轮失败记录全部塞进去还划算。每轮反复阅读旧错误,既花计算,又可能让模型继续抄错。

五道题的恢复记录里,系统把 129446 词元的长历史整理到 22418,后续能更集中地读取文件、定位错误。这不是把过去全部清空:原始要求、目前产物和必要状态要保住。压缩太激进又会忘记约束,所以“少放点历史”也不是可以不看任务就执行的口诀。

缓存也容易被说成魔法。它可以在条件符合时复用已经计算的前缀,省去一部分重复工作;但前面消息变了、模板变了,或服务重启后原状态没恢复,收益就会变。聊天记忆负责保存与取回信息,计算缓存负责复用计算,两者不是一回事。

常见说法 · 遗漏了什么 · 你应该查什么

词元就是字数

遗漏了什么 · 不同文字、前导空格、分词器会改变切分

你应该查什么 · 同一编码器的实际计数与收费口径

窗口越大越好

遗漏了什么 · 内存、速度、有效信息密度与恢复成本

你应该查什么 · 自己的任务深度、延迟和失败记录

有记忆就不用重复要求

遗漏了什么 · 偏好有没有保存、这次有没有取回

你应该查什么 · 新对话是否真正带入关键约束

有缓存就不用再读历史

遗漏了什么 · 缓存匹配与重启恢复条件

你应该查什么 · 服务端实际缓存命中与输入耗时

本地模型没有成本

遗漏了什么 · 设备、磁盘、电力、时间与维护

你应该查什么 · 端到端耗时、占用和人工返工

这就是后面逐期展开的方式:词元接着长度、上下文和费用;上下文接着遗忘、失速与缓存;工具接着权限、执行与验收。第一期先把连接处找出来,第 5、9、16、22—26 期再分别讲细。你不必今天记住全部参数,先知道自己的问题应该回到哪一层。

▍“只会猜词”与“什么都懂”,两头都容易把人带偏

第一个误区是把输出机制当成能力上限。模型生成的是词元,可这些词元可以表达代码、数学步骤和工具参数。就像我们在网页题里看见的,短小输出机制可以组合出复杂程序。它需要的能力来自训练学到的规律,不能因为输出接口简单,就把内容也判成简单。

第二个误区恰好相反:会写复杂程序,便以为它理解了全部需求。水墨长卷有画面、有交互,古文却没到字数;城市有车有路,一个加速检查却没过。这说明能力可以很强,也可以在同一任务中出现遗漏。一个亮点不能替其它条件签字。

第三个误区是把流畅当可靠。生成目标会影响表达,但事实真假需要对应外部世界:公司地址要查来源,报价要看日期,文献要打开原文,程序要运行。模型能用同样顺畅的语气说对和说错,所以“它答得很自信”只能描述语气。

第四个误区是把产品入口当模型本领。搜索、读取本地文件、保存偏好、发送邮件,都依赖软件与工具。给模型接了一套工具,能力边界发生变化;没有这些接口,再大的模型也不会仅凭一句话就把硬盘里的文件真正改掉。

第五个误区是把演示通过当长期可靠。一次网页能跑只是样本;工具参数合法不代表业务条件都满足;一分钟成功不代表高峰期、断网、重启后也成功。要把工作真正交出去,至少先验收一个完整任务,再逐步增加长度、复杂度和权限。

对个人来说,这些差别最终影响选择:写一段可自己检查的文案,和让代理替你修改几十个文件,风险不同。钱也不是只分“云端收费、本地免费”。按量计费的一方靠请求与使用量获得收入,硬件与软件各有成本;对你最重要的是哪条路径能用较少的等待、返工和信息暴露完成任务,而不是替某一家站队。

▍卡住了,先找零件,再找对应的一期

还有一种更实用的找法:不按术语排序,直接按症状找入口。我把常见问题接到这套 30 期计划上。下面列的是优先检查方向,不是唯一故障原因;同一个症状,可能由不同环节造成。

你遇到的症状 · 先查什么 · 对应系列内容

回答很自信,出处却不存在

先查什么 · 原始资料是否支持主张,不拿自信语气当证据

对应系列内容 · 第 28 期:可靠性与核实

同样字数,账单却不同

先查什么 · 分词器、输入输出词元和收费口径

对应系列内容 · 第 5 期:词元与费用

多想很久,错项还是没少

先查什么 · 正确率、等待时间与任务收益是否一起改善

对应系列内容 · 第 9 期:推理的代价

榜单高分,自己的任务却做不完

先查什么 · 样本和评分是否匹配工作要求

对应系列内容 · 第 14、24 期:评测与体检

它说文件存好了,实际找不到

先查什么 · 工具调用、权限、路径及最终读回

对应系列内容 · 第 26 期:工具循环与验收

参数没变,答案突然发散

先查什么 · 采样设置、输入模板与软件版本

对应系列内容 · 第 23、24 期:采样与引擎

下载了模型,软件却不认

先查什么 · 文件格式、架构支持与转换条件

对应系列内容 · 第 15、24 期:模型包与引擎

模型能启动,稍长的任务就内存不足

先查什么 · 权重、缓存、工作缓冲与系统余量

对应系列内容 · 第 16、22、23 期:硬件、缓存与量化

越聊越慢,重启后又变了

先查什么 · 上下文深度、缓存命中与恢复条件

对应系列内容 · 第 16、22 期:速度与缓存

知识库已经放入,答案仍然漏条件

先查什么 · 本次检索片段是否相关、完整且真正送入模型

对应系列内容 · 第 25 期:知识库与检索

服务显示就绪,客户端还是超时

先查什么 · 请求路径、模型加载、排队与服务日志

对应系列内容 · 第 26 期:模型服务

不知道该选大模型还是小模型

先查什么 · 自己的任务、可靠性、时间、费用和设备约束

对应系列内容 · 第 25、30 期:选型与最终判断

这才是十分钟走完全程的用法:先在全景图中给一个陌生词找位置,再拿一个真实症状找到检查入口,最后对一项任务做验收。今天不要求你掌握全部 14 个零件;读完以后,能把一次失败拆成几个可检查的问题,就已经比‘再换个模型试试’多走了一步。

▍30期怎样安排?每一段都对应一件实际的事

看过一次回答和一次交付,现在再看 30 期计划,每个名字就有了位置。第 01—03 期交代全景与起源,第 04—16 期沿原顺序拆开原理,第 17—21 期走进真实名场面,第 22—27 期进入实操,第 28—30 期讨论边界。新模型与热点只在能改变理解或选择时加入,不跟着发布会打乱文章顺序。

阶段 · 期数 · 你要解决的问题

全景与起源

期数 · 1—3

你要解决的问题 · 认识模型与人的期待,回看两次寒冬和开放权重的赛跑

拆开机器

期数 · 4—16

你要解决的问题 · 参数、词元、向量、注意力、训练、推理,再接评测与硬件

名场面

期数 · 17—21

你要解决的问题 · 用真实突破与失误练判断

把它用起来

期数 · 22—27

你要解决的问题 · 部署、缓存、量化、采样、评测、知识库与服务

边界与选择

期数 · 28—30

你要解决的问题 · 幻觉、规模与自己的选型

按顺序读,你会看见概念怎样一层层接起来;也可以先从正在踩的坑跳进去。账单莫名变大看第 5 期,模型分数漂亮却办不成事看第 14、24、26 期,回答不可靠看第 28 期。下面把 30 期写清楚,不必为了阅读这个系列先买新设备。

期数
文章与原文线索
01
你真的懂 AI 吗?30 期纵览:从一次回答,走到模型、评测与本地部署;原文线索:十分钟走完全程;你已经在用它了-大模型到底是什么
02
AI 经历过 2 次寒冬,为什么 2012 年才翻身?显卡、数据和一场比赛的故事;原文线索:三次浪潮与两次寒冬
03
GPT-2 曾被嫌太危险,6 年后又开放权重?一条下载链接背后的 AI 赛跑;原文线索:开源与闭源的赛跑-2017 年至今
04
神经网络真在“动脑”?2 个旋钮,拆开机器学习和聊天记忆;原文线索:神经网络到底在算什么
05
同一个 strawberry 能切成 1 块或 3 块?Token、活字印刷和 AI 的 3 笔账;原文线索:token-模型眼里的世界
06
Embedding 相似就答对了?3 个词、一个向量空间和知识库的误会;原文线索:语言怎么变成数学
07
Transformer 能看 128K 就记得住?2017 年的论文和 QKV 的 3 个误区;原文线索:Transformer-2017 年的那篇论文
08
AI 会续写却不肯答题?预训练、SFT 与偏好优化,3 个环节怎样教出助手;原文线索:从预测下一个词到会聊天
09
推理模型多想就更准?从 17.7% 到 78.7%,一张草稿的价值与代价;原文线索:会思考的模型-推理模型在想什么
10
AI 为什么一个词一个词往外蹦?跟着 1 次回答,走过分词、注意力和采样;原文线索:一次对话的旅程
11
今天的版图;原文线索:今天的版图
12
被测物是一个配置;原文线索:被测物是一个配置
13
开放的程度-开源许可证与无审查;原文线索:开放的程度-开源许可证与无审查
14
成绩单上的三类数字+基准地图-分数为什么会骗人;原文线索:成绩单上的三类数字;基准地图-分数为什么会骗人
15
打开一个模型文件夹-每个文件都在管什么;原文线索:打开一个模型文件夹-每个文件都在管什么
16
一台电脑能跑多大的模型-内存带宽算力三堵墙+速度是算出来的-从带宽到每秒多少字;原文线索:一台电脑能跑多大的模型-内存带宽算力三堵墙;速度是算出来的-从带宽到每秒多少字
17
AlexNet-两块游戏显卡赢下的那场比赛;原文线索:AlexNet-两块游戏显卡赢下的那场比赛
18
AlphaGo 第 37 手-人类看不懂的那一步;原文线索:AlphaGo 第 37 手-人类看不懂的那一步
19
ChatGPT 五天百万用户-一个输入框改变的事;原文线索:ChatGPT 五天百万用户-一个输入框改变的事
20
一个开放权重模型让芯片股单日暴跌;原文线索:一个开放权重模型让芯片股单日暴跌
21
一个专为排行榜特调的版本;原文线索:一个专为排行榜特调的版本
22
第一次在自己电脑上跑一个模型+KV-cache 显存账本;原文线索:第一次在自己电脑上跑一个模型;KV-cache 显存账本
23
量化-给模型压缩体重+采样参数说人话;原文线索:量化-给模型压缩体重;采样参数说人话
24
给你的模型做一次体检+MLX-llama.cpp-vLLM 引擎横评;原文线索:给你的模型做一次体检;MLX-llama.cpp-vLLM 引擎横评
25
十个模型留谁删谁+知识库外部记忆与 RAG;原文线索:十个模型留谁删谁;知识库外部记忆与 RAG
26
智能体工具记忆与反馈回路+服务化-并发队列健康检查与资源仲裁;原文线索:智能体工具记忆与反馈回路;服务化-并发队列健康检查与资源仲裁
27
给本机出一张能力表;原文线索:给本机出一张能力表
28
幻觉为什么无法根除;原文线索:幻觉为什么无法根除
29
规模法则会不会撞墙;原文线索:规模法则会不会撞墙
30
没有最好的模型;原文线索:没有最好的模型

30 期会沿着原有顺序展开:先看起源和竞争,再拆原理,随后走进名场面、实操和边界。第 4 期的网络、第 6 期的向量、第 7 期的注意力,会在第 10 期重新接成一次回答;第 8 期训练和第 9 期推理,也会接到后面的评测与可靠性。故事不孤立,概念也不各说各话。

这些是计划,不是已经发表的 30 篇。每期会配实际例子、常见误区与小练习,适合的地方再加表情包和真实故事;需要公式时给算例,需要结果时交代条件。不承诺每天一篇赶工上线:解释不足、证据不足的时候,先把问题查清,不能把读者当字数验收员。

▍为什么关注黑粉科技,又为什么要收藏官网?

如果只想解决今天的一件事,前面的文章和工具入口就够你开始;如果想以后自己判断,就沿着这套系列往下读。公众号和官网提供两种读法:一个提醒你重要内容来了,一个让你随时回来把知识和记录查全。

我会继续把官方介绍、本人实测和推断分清,保留对选择有用的失败条件。关注这里得到的应该是判断依据与可用路径,而不是每隔几天被一个“又强了”的形容词催着换模型。

官网与公众号安排同步完整文章,不做一边完整版、一边缩水版。 系列各期、日常文章、自制工具介绍与可公开资源都在同步范围内。官网定期更新全部可公开内容;公众号的系列文章将按“你真的懂 AI 吗?”合集整理。排版和附件入口可以不同,知识、证据与关键解释不删;私人知识库、凭证和内部日志不在公开范围。

订阅的作用,是不用每次自己想起来再来查。本系列首期安排推送,后续各期继续发布,但不逐篇群发。 另外会定期整理重要变化、值得复看的实测、实用资源与阶段汇总;部分精华不做面向所有人的公开推广,只通过公众号向已关注、订阅的读者推送。关注“黑粉科技”,就是接收这些精选消息与系列提醒的入口。

你想怎么读 · 建议入口 · 能获得什么

不想错过重要内容

建议入口 · 关注并订阅黑粉科技公众号

能获得什么 · 精选推送、重要更新与阶段汇总;不会每篇都群发

想按顺序补课

建议入口 · 官网系列目录,及公众号计划整理的“你真的懂 AI 吗?”合集

能获得什么 · 按期阅读同步的完整正文;后续内容随发布补齐

遇到问题再来查

建议入口 · 把 hyphentech.top 加入浏览器收藏夹

能获得什么 · 完整文章、往期内容、工具与公开资源;定期浏览更新

“只向订阅读者推送”说的是消息触达,不是把公开文章加上关注后才能阅读的门锁。公开文章依然可以通过链接阅读;是否每次收到通知,也受微信设置与平台展示影响。你可以用公众号等精选提醒,用官网主动看全量更新,两种方式互相补位。

如果这套讲法对你有用,关注“黑粉科技”,再把黑粉科技官网:https://hyphentech.top加入收藏夹。公众号用来接收精选与阶段提醒;官网用来查全量内容、补课和找资源。

后续文章与配套资料会随发布持续补齐,值得定期打开,而不只是收藏今天这一篇。电脑浏览器可按 Ctrl+D,Mac 通常是 Command+D;微信里可复制网址到常用浏览器收藏。

今天先做一个小练习:拿一段你可以公开或已脱敏的邮件,列出“要改什么”和“绝不能改什么”,再逐项核对模型的输出。你会发现,流畅、正确和能发出去,需要分别检查。下一期就从这里接着拆:它为什么能把错误写得那么像真的?

查证来源与边界

01 · 聊天模板官方说明

https://huggingface.co/docs/transformers/chat_templating

02 · Transformer原始论文

https://arxiv.org/abs/1706.03762

03 · 官网完整内容入口

https://hyphentech.top

下一期把时间拨回 1958 年前后:为什么一个会学习的想法,要穿过两次寒冬才走到今天?

下一篇接着看:1958 年,人们已经在期待会学习的机器。几十年后它才真正改变行业。中间不是一条直线上升的曲线,而是承诺、失望,以及老想法终于等到条件的故事。

工具矩阵 / 持续更新

我做的工具

这些工具都由我持续维护。预览版会明确标注,下载、更新和已知边界以发行页为准。

黑粉盒子 HyphenBox

[正式迭代]

免费大模型 API 雷达:持续复测可用性,本地统一接口,Key 只存本机

下载与更新https://github.com/HackerChi-Hub/hyphenbox-release/releases

方寸智匣 LocalBrain

[正式迭代]

本地模型的多模态 MCP 工具箱:TTS / Whisper / 视频生成一站接入

下载与更新https://github.com/HackerChi-Hub/localbrain-releases/releases

ScreenLex 光影词库

[正式迭代]

看美剧顺手把生词背了,Mac/Windows 双平台,免费

下载与更新https://github.com/HackerChi-Hub/screenlex-download/releases

黑粉录屏 HyphenScreen

[正式迭代]

录屏 + 智能剪辑一体:达芬奇式时间线、自动打码、导出前成片体检,免费

下载与更新https://github.com/HackerChi-Hub/HyphenScreen-Releases/releases

让AI成为你的超能力

黑粉科技 · 本地部署 · 免费白嫖 · 自制软件

hyphentech.top

相关学习资料