
最近看到智谱发布了 AutoGLM,也放出了相关 demo,我当时第一反应其实是:这个方向挺有意思,能不能自己本地部署试试看。毕竟手机 Agent 这种东西,光看演示和真正自己跑起来,感觉还是很不一样的。后来实际折腾了一下才发现,这类模型对普通个人用户来说,直接本地部署门槛其实不低:模型本身体量不小,对算力、内存和部署环境都有要求;而且真想在端侧稳定跑起来,也不只是把模型下载下来这么简单,还要处理量化、编译、适配、联调这些工程问题。也正因为这样,我后来就顺着这个方向尝试去把量化版 AutoGLM-Phone-9B 适配到端侧,最后顺利在安卓实机上跑通。
这件事之所以值得拿出来说,不只是因为“模型能跑了”,而是因为它对应的是手机 Agent 这个方向,一个很现实的问题——这类模型以前更多是在云端演示,或者停留在 PC、服务器环境里跑 Demo,但现在,已经开始往真实终端设备上落了。
先看看实际效果:
我们一直认为,手机 Agent 是这两年很值得关注的一条路线。原因很简单,它和传统聊天机器人不一样。以前的大模型更像“你问一句,我答一句”;但手机 Agent 想做的是另一件事:你直接说目标,它去看屏幕、理解当前页面、判断下一步该点哪里、该输入什么,然后一步一步把任务做完。
换句话说,它不是只负责“回答”,而是开始尝试“执行”。
像 AutoGLM-Phone-9B 这种模型,本质上就是在往这个方向走。它面向手机 GUI 场景做了优化,能够结合视觉理解、任务规划和设备控制来完成自动化操作。这个思路其实很有吸引力,因为它意味着以后很多手机上的重复操作,也许真的可以逐步交给 Agent 去做。
不过理想很美,现实也很直接。手机 Agent 真正难的地方,从来都不是“会不会点按钮”,而是它整个链路太长了。
它不是一次推理就结束,而是一个连续循环的过程:先看屏幕,再理解状态,再决定动作,再执行操作,然后根据新界面继续下一轮。每多一步,就多一层推理压力,也多一层延迟、功耗和系统复杂度。所以这类模型虽然看起来很酷,但如果一直放在云端跑,成本、时延和隐私问题都会越来越明显;如果要放到端侧跑,又马上会碰到模型体积、部署复杂度和硬件资源这些硬限制。
这也是为什么,这次安卓实机跑通会让我觉得挺关键。
因为它说明一件事:手机 Agent 这条路,正在从“能演示”慢慢走向“能部署”。
尤其是在做了量化之后,模型对算力、内存和带宽的要求会进一步下降,端侧运行的现实性也就更强了。对于这类需要频繁调用、强调实时反馈、最好还能保护本地隐私的应用来说,端侧能力不是锦上添花,而很可能是下一阶段真正决定体验的核心条件。
这次适配背后用到的是国产自研芯片平台,具体来说是后摩智能的 M50 方案。这个点我觉得也挺有意思。以前很多人一说大模型部署,默认想到的还是高功耗 GPU 或者云端推理,但现在越来越多工作开始尝试在国产端侧芯片上把整套链路跑通,包括量化、编译、部署、联调这些环节。如果这条路线能持续成熟下去,那对 Agent 类应用会很有意义。
因为 Agent 和普通单轮问答不一样,它更需要长期在线、低延迟响应、稳定执行,而且很多时候还会涉及个人数据、任务历史、使用习惯这类比较敏感的信息。放在本地,很多事情的逻辑会更顺:响应更直接,成本更可控,隐私也更容易保障。
所以在我看来,这次进展最有意思的地方,不只是“AutoGLM-Phone-9B 在安卓手机上跑起来了”,而是它给出了一个更具体的信号:手机 Agent 这件事,已经不再只是一个云端概念,而是在开始认真面对端侧落地这道题。
而一旦这道题开始被解出来,后面的想象空间其实很大。比如更低门槛的个人助理、更自然的手机自动操作、更长期在线的本地智能服务,甚至一些原来必须依赖云端的大模型能力,也有机会逐步往本地迁移。
对普通用户来说,也许最直观的一点就是:以后我们期待的,不只是一个“会聊天的 AI”,而是一个真的能在设备上持续帮你做事的 Agent。
这次安卓实机跑通,至少让我觉得,这件事离现实又近了一点。
夜雨聆风