
大家好,我是寂寞的熊猫。
最近 Hugging Face 上一个名字长到离谱的模型被本地 LLM 圈追着下载:DavidAU/Qwen3.6-27B-Fable-Fusion-711。我去翻了下实时数据,过去一个月下载量 73 万多次,971 个赞。对一个不是大厂官方、纯社区折腾出来的 27B 模型来说,这个热度已经说明问题。
这类社区魔改版能火,背后通常有几件事:把官方对齐阶段训出来的"拒绝倾向"拆掉(社区常说的去审查),再叠加多阶段微调和量化,让它在消费级显卡上既跑得动、又比原版更"好用"。去审查涉及合规风险,这篇不展开,重点讲能力含多少金、凭什么在本地跑起来。
省流版
- 底子是官方 Qwen3.6-27B Dense,社区在它身上做了一轮多阶段微调,不是从零炼的新模型,原生 262K 上下文、64 层这些都没动
- "711" 来自 ARC-C 跑到 0.711,作者包装成"700 高智能俱乐部",但这套标尺是作者自己定的,0.711 在 27B 里确实强,可没到吊打闭源旗舰的地步
- 能被这么多人跑起来,靠的是 MTP 加速和量化生态:MTP 把生成速度拉到 1.8 到 2 倍,量化版本从 12GB 到 30GB 全覆盖,16GB 显卡就能起步
- uncensored 名不副实、AMD 上跑得慢、tool call 看 harness,它适合本地实验和创作,不适合直接怼到公网生产
它是本地能跑的强模型,但强在哪、弱在哪得拆开看。
这个 711 到底是什么水平
先说"711"哪来的。它来自一个叫 ARC-C 的基准。ARC 是一套初高中科学题,专门考模型是真推理还是靠模式匹配背答案,ARC-C 是其中更难的 Challenge 集。0.711 的意思是,这套难题它答对了大概 71%。
作者把这个分数包装成了一个说法:突破 700 是"高智能俱乐部",以前这个区间只有 OpenAI、Claude、Gemini 这些闭源旗舰能进,27B 开源模型是头一个。
这里要分清两件事。第一,0.711 在 27B 这个量级,确实是高分,不是吹的。第二,"700 俱乐部"是作者自己造的标尺,不是行业公认的基准线。ARC-C 只是众多衡量维度里的一个,拿它当唯一标尺来说"干翻闭源",听听就好。
更关键的是信息分级。作者自报的,是这套微调后的模型在 7 项轻量基准(ARC-C、ARC-E、BoolQ、HellaSwag、OpenBookQA、PIQA、WinoGrande)上的成绩,其中 6 项超过官方 Qwen3.6-27B-Instruct,7 项全部超过参数更大的 35B MoE 版。
| 基准 | Fable-Fusion-711 | 官方 27B-Instruct | 备注 |
|---|---|---|---|
| ARC-C | 0.711 | 0.647 | "711"得名于此 |
| BoolQ | 0.912 | 0.910 | 几乎持平 |
| HellaSwag | 0.780 | 0.773 | 略胜 |
| PIQA | 0.812 | 0.806 | 略胜 |
但这张表有两个口径要打折听。一是这些都是选择题型基准,考的是知识和常识推理,不是代码、不是长文创作、不是 Agent 工具调用,跟真实使用的"好用"不是一回事。二是官方那几个最硬的分数(MMLU-Pro 86.2、C-Eval 91.4)是底座模型的,不是这个微调版的,这个微调版没公开 plain MMLU。
自报的多选题分数说明它底子没被微调弄坏、甚至略有提升,但这离"消费级显卡上逼近旗舰"的体感,中间还隔着 MTP 和量化这两件事。
为什么这么火(一):MTP 加速
这么多人追着下,门槛低是直接原因。门槛分两块:速度和显存。先说速度,靠 MTP。
MTP 全称 Multi-Token Prediction,多 Token 预测,属于投机解码这一类加速技术。普通大模型生成文本是一个字一个字往外蹦,每蹦一个字,都要回头把前面所有字重新过一遍。这个逐字生成的过程叫 decode,是推理里最吃资源的环节。
MTP 的做法是给主模型配几个额外的预测头。主模型在正经输出第一个字的时候,这些预测头顺手把接下来几个字也一起猜出来,然后主模型一次性并行核对这几个猜测,猜对的全采纳,猜错的从错处重写。因为核对是并行的,一次能验好几个,整体就比逐字快得多。关键是输出质量和原模型完全一致,无损。
普通生成像一个人认真写字,每写一个字都要翻回去看一遍前面写的。MTP 像这个人每写一个字,顺手把接下来三四个字也快速填个草稿,再回头一次性核对,对的留下、错的擦掉。因为是同一套权重在猜,主输出和草稿默契高,猜对的比例(接受率)也高。
我自己在 Linux 服务器上跑 Q4_K_M 的 MTP 版实际验证过这套机制。服务日志里能看到,MTP 的草稿接受率在 0.69 到 0.95 之间浮动,对应实际生成速度稳在 56 到 63 tok/s。接受率越高,一次核对留下的字越多,加速越明显。第三方在 RTX 5090 上的实测也接近:MTP 版比标准版快 1.7 到 1.9 倍。
但 MTP 不是没代价。作者自己在模型卡里提醒:当草稿接受率低于 50% 时,带 MTP 的版本反而可能比常规量化更慢。猜得不对,核对完剩不下几个字,白费草稿算力。所以 MTP 是"大多数时候更快",不是"一定更快"。
为什么这么火(二):量化
门槛的另一块是显存,靠量化。
27B 全精度模型塞不进消费级显卡。量化的作用是把模型权重从高精度压到低精度,比如从 16bit 压到 4bit,体积和显存占用直接砍掉一大半,代价是少量精度损失。这个模型不是简单一刀切,而是用了一套双重要性矩阵(imatrix)校准:先跑一批数据测出模型里哪些部分对精度敏感、哪些不敏感,敏感的保持高精度,不敏感的狠压,再用逐词准确率、逻辑偏移量、困惑度这几项指标校验压缩后智力没掉。
效果是量化版本覆盖极广,从 12GB 一直排到 30GB,几乎对应所有消费级显卡档位:
| 显存档位 | 推荐量化 | 文件体积 | 适合谁 |
|---|---|---|---|
| 16GB | IQ2_M / IQ4_XS | 约 12-17GB | 极限低显存,能跑起来为先 |
| 24GB | Q4_K_M / Q5_K_M | 约 18-21GB | 甜点位,质量速度平衡 |
| 32GB | Q6_K | 约 24GB | 追求更高质量 |
| 40GB+ | Q8_0 | 约 30GB | 多卡或工作站,接近全精度 |
我自己跑的就是 24GB 档位的 Q4_K_M,配 MTP,体感很流畅。AMD 显卡用户要单独留意:这个模型在 AMD 加 Vulkan 后端上有个已知坑,输出张量的格式会导致负载偏到 CPU、速度掉到 15 tok/s 左右。作者专门出了带 AMD 标记的特化版本,把输出张量格式调了一下,换 ROCm 后端能拉到 37 tok/s。AMD 用户认准带 AMD 后缀的版本。
量化生态铺得这么全,把"27B 模型本地跑不跑得动"这个问题,变成了"你要哪个质量、速度、显存的平衡点"。
真实能力到底是什么
真干起活来行不行,一份第三方代码实测比作者的自报分数更有参考价值:在 RTX 5090 上,用 60 道 Python 编程题(Bug 修复、补丁应用、隐藏单测)对这个模型做了 5 轮测试。
| 量化版本 | 解决率 | 生成速度 |
|---|---|---|
| MTP Q5_K_M | 90.0% | 约 103-116 tok/s |
| MTP Q4_K_M | 88.3% | 约 105-118 tok/s |
| 标准 Q6_K(无 MTP) | 86.7% | 约 58-65 tok/s |
90% 的解决率说明它做中高级的代码 Bug 修复和实现类任务,硬实力够。但测试者也明确点出了边界:在系统架构设计级的难题上(运算符优先级解析、插件循环加载检测、数据库迁移失败回滚),它会触到能力上限。而且因为融入了 Fable 叙事和写作数据,它的纯代码解决率(90%)略低于纯代码特化模型(前代能到 98%)。
它的真实画像是偏创作和通用的强模型,代码够用但不是冠军。长文创作、角色扮演、一般推理是强项,这正是融入 Fable 叙事数据带来的加成,代价是极限代码能力让了一步。
它的甜点不是"挑代码冠军",是"通用强、弱审查、本地跑得动"这三件事凑一起。
几个真实的坑
一是 uncensored 名不副实。 名字里挂着 Uncensored、Heretic,但在某些推理框架和系统提示词下,它该拒绝还是会拒绝,并没有名字暗示的那么彻底。把它当成"什么都会回答"来用,大概率会失望。
二是稳定性看 harness。 在 Agent 工具调用场景里,它对提示模板、KV cache 精度、外层框架(harness)非常敏感。有人跑得很稳,有人遇到 tool call 循环或语法错误。同一个模型,换一套外壳,表现可能差很多。
三是训练数据没全公开。 作者披露了用了 Polaris、Fable traces、F451 这些数据的"配方",但没公开完整的全量数据卡,也没说清楚其中商业模型推理轨迹的采集和授权边界。底座虽然是 Apache 2.0,这点对严肃合规审查是个问号。
四是不能上公网生产。 它没有官方安全背书、没有内置护栏、行为在边界场景不可预测。拿去做面向公众的产品,等于把生成不当内容的法律责任全揽到自己身上,平台审核也能随时让你下架。它适合的场景很窄:本地实验、创作草稿、私域工具、Agent 探索。
写在最后
这个模型本身没有任何架构级创新,它的价值在于证明了一件事:大厂在官方对齐上砸的精力,和"模型在实际使用中好不好用"之间,存在一段能被社区微调填平的距离。73 万月下载、近千赞,是用脚投票的结果。
本地折腾、跑创作和 Agent 实验,它值得装一个试试。想拿它做公网面向普通用户的产品,别碰,用官方底座。
如果这篇文章对你有帮助,欢迎点赞、转发。
我是寂寞的熊猫,感谢你读到这里。
夜雨聆风