ARTICLE · 1079622
安卓旧手机也能跑ai大模型了:OlliteRT 上手

安卓旧手机也能跑ai大模型了:OlliteRT 上手
想在自己设备上跑大模型,又不想买一张显卡、开一台几十瓦的服务器?OlliteRT 给了个更轻巧的答案:用你抽屉里那台旧 Android 手机,把它变成一个本地LLM服务器。它提供标准的 OpenAI 兼容接口,你的电脑、Home Assistant、各种客户端都能直接接,而且数据不出本机。
官方一句话形容很到位,它是 Android 上的 Ollama。挑个模型、点一下启动,手机就开始在本地提供大模型能力,全程没有云、没有 API key、没有订阅。
它到底是什么
OlliteRT 基于 Google 的 LiteRT-LM 运行时,在手机的 GPU 或 CPU 上跑大模型,再把模型包装成一个 OpenAI 兼容的 HTTP 接口,暴露在局域网里。底层 HTTP 服务用的是 Ktor,项目本身是 fork 自 Google AI Edge Gallery 再做出来的,采用 Apache 2.0 许可,完全开源。
也就是说,任何会跟 OpenAI 接口对话的客户端,都能直接连上它。你写的 Python 脚本、curl 命令、Open WebUI、Home Assistant,全都不用改代码。
上手只要四步
第一步,去 GitHub releases 下载 APK 装好。第二步,在应用里下模型,官方推荐大多数设备用 Gemma 4 E2B,体积 2.4 GB,8 GB 内存就能跑。第三步,在模型卡片上点启动服务器。第四步,把客户端指向状态页显示的地址,一般是 http://手机IP:8000/v1,就能像调 OpenAI 一样用了。
对硬件有要求:Android 12 以上、arm64-v8a 架构、最低 6 GB 内存,跑多模态建议 8 GB 以上。2017 年之后的安卓机基本都符合。
能跑哪些模型
应用内置了 HuggingFace 的一键下载,也能导入本地 .litertlm 文件,或通过 JSON 自定义模型源。可选模型包括 Gemma 4 E2B 和 E4B、Gemma 3n 系列、Qwen 2.5 1.5B、DeepSeek-R1 1.5B 等。E2B 适合多数设备,E4B 留给高配机。
能力覆盖文本、视觉、音频,还支持思考链、流式输出,以及对部分模型的工具调用(实验性)。
几个真正好用的点
功耗是它最大的卖点。一台旧手机常开大约只要 5 到 10 瓦,对比显卡服务器动辄 300 瓦以上,长期挂着当私有 AI 网关几乎没负担。内置基准测试能让你在同设备上横向比模型,挑出最适合硬件的那个。
监控也到位:有实时状态面板,可输出 Prometheus 指标接 Grafana,还能通过 Home Assistant 的 REST API 远程看状态、切模型。安全方面支持 bearer token 鉴权、客户端 IP 白名单、监听范围控制,配置相当细。
要接受的局限
它目前一次只加载一个模型,请求顺序排队,这是 LiteRT 的限制。只支持 .litertlm 格式,不能直接用常见的 GGUF,想换模型得用 Google 的工具转。logprobs、语法约束输出、LoRA 适配器这些进阶能力暂时没有,token 数是按字符长度估算的,对英文够准,代码或多语言会偏。
另外它只支持 arm64,模拟器基本跑不了。作者也幽默提醒:别把跑模型的手机塞枕头底下,电池鼓包概不负责。
适合谁
如果你在意隐私,不想让对话经过第三方云端,它是个干净的本地方案。想给 Home Assistant 接一个永远在线、零成本的语音大脑,或者只是想在开发时有个随手能调的本地模型,它都很合适。把吃灰的旧旗舰捡回来,比再买硬件划算得多。
一句话总结:OlliteRT 把大模型的门槛从一张显卡,降到了一台旧手机。开源、本地、兼容 OpenAI 接口,是低成本私有 AI 的一个值得一试的入口。
项目链接:
https://github.com/NightMean/OlliteRT