🛠️ AI工具推荐:20B 端侧大模型在 iPhone 上跑出 120 tok/s,端侧 AI 打开新可能
一个大模型,能在 iPhone 上跑多快?
DeepGrove 团队近日发布 Maple-Preview,给出一个惊人的答案:一款 20B 参数的 MoE 模型,通过三值量化,在 iPhone 上跑出了每秒 120 token 的推理速度。这家公司的口号,正是「把前沿智能带到任何设备」。
图3: 手机端运行大模型的本地AI应用界面
端侧 AI 一直有个「不可能三角」:参数越多,模型越聪明,但内存装不下、速度跑不动。20B 参数塞进手机,过去想都不敢想。
Maple-Preview 的解法是组合拳:三值量化把权重压缩为 -1、0、1 三种取值,每个参数只需极少的比特表示,内存占用大幅下降;MoE(混合专家)架构则让每次推理只激活一小部分「专家」参数,计算量锐减。两头一省,旗舰手机也能流畅跑大模型。
需要说明的是,目前 Maple-Preview 还是预览版,跑分环境、具体实现细节尚未完全公开,实际体验有待验证。但方向已经足够清晰。
隐私是最大的卖点。数据不出手机,聊天记录、文档、照片都不用上传云端,从根上杜绝「隐私换便利」。
离线能力同样诱人:飞机上、地铁里、弱网环境,AI 助手照常工作,不再依赖信号。
还有成本——端侧推理不烧云端 API 费用,对高频使用的场景是实实在在的省钱。
当 20B 级模型跑进手机,语音助手可以真正理解长上下文,文档助手可以在本地完成复杂处理,甚至离线也能陪你头脑风暴。端侧 AI 的「iPhone 时刻」,或许比我们想象的更近。
这款预览版目前已在 DeepGrove 官网开放体验,开发者和极客们不妨先上手试试。
来源整理:AI智际编辑部
---
夜雨聆风