乐于分享
好东西不私藏

你的下一款 AI 助手,可能不再联网:Liquid AI 把 26 亿参数的「智能体」塞进了手机

你的下一款 AI 助手,可能不再联网:Liquid AI 把 26 亿参数的「智能体」塞进了手机

不用云端 API、不烧调用费、数据不出本机,一个 2.6B 的小模型在手机上跑出了 30 token/秒的 Agent 节奏——端侧智能体的实用化闸门,今天被 Liquid AI 拉开了。

     8 月 5 日,Liquid AI 悄悄上线了一篇博客:《LFM2.5-2.6B: Deploy Agents Everywhere》。 名字很直白,野心很大——让智能体(Agent)在 everywhere 跑起来,而且是在端侧 everywhere

模型不大:26 亿参数(2.6B)。

预训练不小:约 34 万亿词元,词表扩到 128K

    跑的地方很野:Apple M5 Max 上 220 token/秒,Ryzen AI Max+ 395 上 113 token/秒,旗舰手机上稳稳 30 token/秒,量化后内存占用 不到 2.5GB

    授权很开放:LFM2.5-2.6B 与 Base 版已在 Hugging Face 开源,llama.cpp、MLX、vLLM、SGLang、ONNX 首日原生支持。

    这不是又一个"手机跑通 7B 量化"的 Demo 级新闻。它指向的是一类新东西:端侧原生(device-native)的智能体模型——会规划、会调工具、会跑多步工作流,而且真的能在你口袋里的硬件上持续跑。

01 为什么是「Agent 模型」,而不是「小语言模型」?

    过去两年,端侧小模型的故事一直是"缩水版聊天机器人":参数砍到 1B~3B,跑通问答、摘要、翻译,但一旦让它真去干活——读一份 PDF、查日历、调内部 API、写一段脚本再自己跑——基本就崩了。

    Liquid AI 这次的抓手很准:他们没把 LFM2.5-2.6B 训练成一个"更乖的客服",而是按 Agent 工作流 重新设计了后训练。

官方披露的四条后训练链路是这样的:

  1. 监督微调(SFT——先打底,覆盖通用指令与多域任务;

  2. 教师特化(Teacher Specialization)——数学、代码、工具调用各训一个专家教师;

  3. 多领域在策略蒸馏(Multi-domain On-policy Distillation)——把多个教师的决策轨迹融回主模型,不是离线抄答案,而是在线跑样本;

  4. 智能体强化学习(Agentic RL)——在 OpenClaw、Hermes Agent 等真实 Agent 沙箱里多轮交互,用"能不能把任务跑完"当奖励,而非刷静态选择题。

这一步是关键分水岭。多数小模型只在"判断题"上被蒸馏,LFM2.5-2.6B 是在"执行环"里被 Reinforcement Learning 打磨过的:调错工具 → 拿到报错 → 改参数 → 再调,这套轨迹直接进训练样本。

    架构上它也偏端侧友好:LFM2 混合架构(短卷积块 + 分组查询注意力),原生 128K 上下文,128K 词表专门照顾工具 schema、文件路径、JSON 结构这些"Agent 天天啃的硬骨头"。


02 2.6B 打 9.7B:不是全面超车,而是"Agent 赛道超车"

    Liquid AI 的基准表里,对手是 Gemma-4-E2B(5.1B)、Gemma-4-E4B(8B)、Qwen3.5-4B(4.7B)、Qwen3.5-9B(9.7B)——每一个都比它大,最大近 4 倍

结果很有意思,不是"小模型感动自己",而是结构性胜出:

  • 指令遵循:IFBench 59.17(Qwen3.5-9B 56.47)、Multi-IF 80.07(Qwen3.5-9B 62.55)、IFStruct 85.49(Qwen3.5-9B 78.50);

  • 工具使用:ToolSandbox 77.83,反超 Qwen3.5-9B 的 76.44;BFCLv4 56.88,仅微逊于 Qwen3.5-9B(60.13);

  • Agent 综合:Claw-Eval 平均 62.85,BrowseComp+ 26.89,均紧贴或超过同场较大模型;

  • 弱项也很诚实:AIME25 数学、LiveCodeBench v6 编码,仍是大参数模型领先——官方明说"重编码或重知识检索的活,换更大的"。

    翻译成人话:如果你要的是"本地私人助理:整理邮件、跑通 MCP 工具、自动填表、离线调研、手机上点一下就执行",这个 2.6B 比很多 8B~9B 云端模型更顺手;如果你要它写一整套分布式服务,别为难它

    这就是端侧 Agent 的正确评测方式:不在全科统考里卷,而在"多步任务完成率"里赢。

03 30 token/秒的手机意味着什么?三个被改写的前提

    很多团队对"端侧 Agent"有三个潜意识假设:

  • 假设 A:端侧太慢,交互像拨号上网;

  • 假设 B:端侧太笨,只能做唤醒词级任务;

  • 假设 C:端侧不省钱,因为要量化到残废。

LFM2.5-2.6B 把三个假设一起拆了。

速度侧:M5 Max 220 token/秒,手机 30 token/秒。30 token/秒是什么概念?人类默读速度约 20~30 字/秒,也就是说模型开口的速度和你看书差不多,Agent 多轮"思考—调工具—再思考"的循环不会再卡成 PPT。

能力侧:128K 上下文 + 工具 RL,意味着它能把"当前网页内容 + 本地备忘录 + 工具返回 JSON"一起塞进上下文做决策,而不是只靠 system prompt 硬撑。

成本侧:不调云端 API = 边际推理成本趋零。Liquid AI 在博客里算过一笔账:单张 H100 高并发下跑这模型能到近 15K output token/秒,约 13 亿 token/天;但更性感的是反方向——把这些 token 挪到用户自己的手机和笔记本上,电费归用户,隐私归用户,并发归设备数,不限速也不计费

    对开发者来说,这等于把"后台常驻 Agent"从奢侈品变成水电煤:你可以让笔记本在睡眠前自动跑一个"整理今天会议录音→提取待办→写入本地 Obsidian→明天早上语音播报"的循环,全程离线。

04 它为什么能直接进你的工程栈?

    Liquid AI 没把模型锁在自己运行时里,而是首日铺齐了端侧最主流的推理矩阵:

  • llama.cpp:GGUF 量化,树莓派到手机通吃;

  • MLX:Apple Silicon 统一内存直通,Mac/iPhone 原生体验;

  • vLLM / SGLang:真要上边缘服务器,GPU 吞吐照样吃满;

  • ONNX:跨 NPU、Windows/Linux 桌面、WebGPU 浏览器全走。

    Hugging Face 上除了 LFM2.5-2.6B,还有 LFM2.5-2.6B-Base 和 LFM2.5-2.6B-ONNX(Q4 约 1.9GB,Q4F16 约 1.5GB),浏览器里开个 WebGPU Demo 就能看到一个"本地调研 Agent"边搜边写摘要。

一个最小可运行片段(transformers >= 5.0.0):

from transformers import AutoModelForCausalLM, AutoTokenizermodel_id = "LiquidAI/LFM2.5-2.6B"tok = AutoTokenizer.from_pretrained(model_id)model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", dtype="bfloat16")# chat template + tool schema 拼进去,generate,拿轨迹

     如果你做 iOS/macOS,MLX 一条 mlx_lm.generate 就能把模型嵌进 Swift App;做 Android,llama.cpp 的 JNI 封装或 ONNX Runtime WebGPU 都能接;做桌面 Agent 产品,直接挂 OpenClaw / Hermes Agent 的 harness,把 67 个 MCP 工具塞给它就完事——Liquid 自家前代 8B-A1B 的 Local Cowork 演示就是这么跑的:单笔记本、13 个 MCP server、零云端、零 key。


05 端侧 Agent 的"真场景"清单(不是 Chat 替代品)

     别再把端侧模型当"省钱的 GPT 替身"用,错配会让你失望。LFM2.5-2.6B 这类模型的甜区在高频、私密、弱网、常驻四类场景:

  • 手机离线助理:飞行模式下总结邮件、重组日程、本地相册语义检索;

  • 企业本机办公 Agent:读内网文档(不出域)→ 填 ERP 表单 → 调内部 API,合规团队会爱死;

  • 车载/嵌入式:Liquid AI 已和奔驰合作嵌入车端,LFM2.5 系列本就覆盖 230M~8B-A1B 的车载/IoT 档位;

  • 隐私敏感行业:医疗本机病历摘要、金融本机流水分类、法务本机合同抽取;

  • 批量长尾任务:给 1 万份简历打标签、给 10 万张票据抽字段——云端跑是账单,端侧跑是晚上插电。

    它不适合:当主力 coding model、当深度科研推理引擎、当多语言知识库唯一信源。官方自己也写了"coding-heavy workload, reach for something bigger"。

06 端侧智能体元年,可能不是从"最大"开始的

     回头看 2026 年上半年的端侧节奏:Gemini Nano 进 Pixel、Gemma 3B 类模型占满手机 NPU、LFM2.5-230M/350M/1.2B 先铺物联网,再到今天 2.6B 把"Agent RL + 128K + 30 token/s 手机"合龙——斜率变了

     过去我们默认:要 Agent 能力 → 得上云 → 得交钱 → 得信任厂商。LFM2.5-2.6B 把这条链斩断在"设备边界"以内。它不完美,数学和代码还嫩,license 也不是 Apache 2.0 那种完全放任(Liquid 自用 lfm1.0 条款,商用要读细则),但它证明了一件事:2B~3B 档完全可以不是"玩具",而是"执行体"

     下一款让你觉得"诶这助理真懂我流程"的产品,未必跑在机房里。它可能正跑在你的 iPhone 散热片后面,30 token/秒,不联网,不记账,等你下一次抬起手机。

模型地址:

  • Hugging Face:LiquidAI/LFM2.5-2.6B 与 LFM2.5-2.6B-Base

  • 官方博客:Liquid AI — LFM2.5-2.6B: Deploy Agents Everywhere