ARTICLE · 1043837
AI大模型热点|Bonsai 2把27B模型压进约6GB,智谱公开Infra Agent自我优化案例
◆Bonsai 2将27B模型压缩到约6GB
Ternary AI发布Bonsai 2 27B,模型基于Qwen3.8 27B,并提供MLX、GGUF等本地运行版本。PrismML公布的对照结果显示,Bonsai 2相较完整精度版本体积缩小超过9倍,在包含推理、数学、编码、指令跟随、视觉和Agent工具使用的聚合评测中,得分为83.9,约为基线的98.2%。
这个结果来自一组评测的聚合值,不能直接理解为每个任务都保留98.2%的准确率。三值量化把权重表示压到更低比特,带来的是存储和带宽优势,同时也会增加量化误差、算子适配和不同硬件上的解码复杂度。模型卡中还需要继续关注各项基准的单项分数、量化格式、推理框架和上下文长度。
Hugging Face公开模型文件显示,Bonsai 2的2-bit MLX版本约为5.9GB。对于拥有16GB或更大统一内存的消费级设备,这个体积使本地部署门槛明显降低,但实际可用内存还要加上KV Cache、运行时缓冲区和上下文输入。能装进显存不等于长上下文和高并发都能稳定运行,部署时仍需按任务测量速度和准确率。
◆GLM-5.3参与搭建自己的推理基础设施
智谱在9月17日发布的技术文章中,记录了GLM-5.3驱动的Infra Agent如何参与搭建GLM-5.3-Flash的生产推理服务。文章称,系统运行在超过10万张国产加速卡组成的集群上,团队在不到两周内完成从新硬件适配到生产可用的推理系统,端到端吞吐相对初始基线提升约3倍。
文章披露的优化包括节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化、Layer Split,以及Encode-Prefill-Decode解耦架构。Infra Agent并不是只生成代码,它还要根据数值正确性测试、性能时间线和端到端吞吐反馈提出假设,再修改实现并重新验证。
智谱把这个案例称为递归自我改进的早期形态,同时也明确表示还没有达到完全自主设计和训练下一代模型的程度。公开内容真正有价值的部分,是把“Agent参与系统优化”拆成了可追踪的工程循环:定义目标、观察反馈、定位瓶颈、修改代码、做局部验证,再回到真实服务验收。
对于模型压缩和推理优化,后续应该分别看两个指标:模型本身在固定评测上的质量损失,以及在具体硬件、上下文和并发条件下每个成功任务的成本。体积缩小、吞吐提高都只是中间结果,最终仍要回到真实任务的准确率、延迟和稳定性。
◆参考来源
PrismML:《Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint》:https://prismml.com/news/bonsai-2-27b Hugging Face模型卡:《Ternary-Bonsai-2-27B-mlx-2bit》:https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit Z.ai:《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》:https://z.ai/blog/glm-built-its-inference-infrastructure