96GB显存跑32B模型,全本地运行,连邮件和PDF都加密存在设备里。Reddit上有个叫Liara的AI助手项目,直接把模型、推理和记忆全塞进了手机和电脑里。
- 完全本地运行,仅搜索或下载邮件时联网,数据用AES-256加密。
- 内置24个工具,支持视觉识图、读PDF总结、处理邮件和日程。
- 作者自己部署的API版本,使用RTX6000 PRO 96GB Vram跑qwen 32B FP8 VL。
靠AI接活处理客户私密文件,云端API总让人担心数据泄露。Liara把隐私做到极致,敏感工具需授权且随时撤销。它内置24个工具,支持视觉识图和PDF总结。你下半年处理私密项目,纯本地的安全感会明显不同。
定制大脑与硬件门槛
作者提到,他们正在为Liara构建定制大脑。通过数万条训练对话,由多个高端AI模型作为老师生成和验证,经过16个自动质量控制过滤。最终的结果是,模型把工具使用内部化到了训练里,足够小可以在手机上运行,但可靠性堪比大模型。它能瞬间判断你是要查邮件、看日程还是搜网页。
关于硬件和部署,作者分享了自己正在使用的API版本配置:
服务器配置:GPU RTX6000 PRO
显存:96GB Vram
运行模型:qwen 32B FP8 VL
怎么获取和部署

目前Liara提供了macOS、Windows和Android版本。如果你想直接体验作者部署的带外部API的版本,或者下载本地客户端,可以通过以下链接获取:
API版本地址:
本地客户端下载:
说实话,现在市面上能打的本地AI助手不多,大部分还是套个壳调云端API。Liara这种把视觉、文件处理、邮件和日程全打通,并且死磕本地加密的方案,确实戳中了接单党的痛点。特别是那个qwen 32B FP8 VL的视觉能力,配合本地PDF总结,用来做竞品分析或者整理客户素材非常顺手。不过96GB显存的门槛也不低,普通设计师想本地跑满血版,可能还得等量化版本或者更亲民的硬件。想复现的话,先把显存留到 96G 以上,不然跑不动这个 FP8 版本。
留言聊聊
你现在主力跑什么视觉模型?显存多少?速度多少?
往期推荐
- ·1000 GPU集群跑 GLM-5.1,网络升级吞吐+15%
- ·16GB显存跑35B:Luce Spark把MoE门槛砍下来了
- ·Whoop把AI医疗拆成2层
点击公众号头像 → 历史消息,可翻阅以上文章
夜雨聆风