今天,AI 圈集体把「能干活的大脑」塞进了你的电脑

我今早刷消息,刷着刷着愣了一下。
同一天里,好几家大厂像约好了似的,把自家的「能跑在你自己电脑上、不花钱、数据不出门」的 AI 甩了出来。不是那种点开网页聊两句的玩具,是真的能干活、能读你本地文件、能在你断网时还帮你干活的那种。
我琢磨了一阵,觉得这事比又发一个排行榜第一的模型重要得多。因为它第一次把门槛降到了「你手边这台电脑就行」。
下面这几条,每一条今天就能跟你自己的机器发生关系。
Meta 把 30B 模型塞进了 20GB,还允许免费商用
小扎今天亲自下场发了一篇万字长文,叫「未来属于每个人」,话里话外在怼把超级智能攥在少数公司手里的做法。跟他这篇檄文一起扔出来的,是个叫 Muse Glimmer 的开源模型。
几个数我盯着看了两遍。它是 30B 参数,正常精度得吃 55GB 以上显存,普通人的显卡根本够不着。Meta 用了 4bit 量化,硬把它压到 20GB 以内,而且官方说压缩对智能体任务的性能几乎没衰减。
这意味着什么。意味着你一台 M4 或 M5 Max 的 MacBook,或者一块 RTX 5090,就能让它完全离线跑起来。文件、私人代码都不用传去远端。协议是 Apache 2.0,能免费商用,随便造。
我第一反应是,这下出差高铁上没网也能调一个本地大脑了。
蚂蚁的模型更狠,1.3B 激活参数硬刚 31B
蚂蚁百灵大模型前天开源了 Ling-3.0-tiny。总参数 7.9B,但推理时只激活 1.3B。
别被数绕晕,说人话就是,它聪明得像一个大模型,但跑起来轻得像个小模型。官方在 36GB 内存的 MacBook Pro 上复刻了一个「无限百科」的体验,你读文章时点一个词,它就地生成解释卡片,所有推理都在本机,首 token 响应低于 100 毫秒,峰值内存才占 8.34GB。
这个 Demo 我挺心动。它等于一个长在你设备里的、随叫随到的知识引擎,还不用给任何云端付 API 钱。
英伟达也来凑热闹,专给多智能体用的
英伟达昨天发了 Nemotron 3.5 Lightning,30B 的 MoE 模型,专门为多智能体系统里的具体任务做。官方说输出速度能到同类 4 倍,把智能体任务整体完成速度拉快 30%。
它也能直接跑在本地 AI 系统上,RTX PC、DGX Spark 都行。
我理解它的定位跟前面两个不太一样,它不是给你聊天用的,是给你那一队智能体当底层引擎用的。你前面看我写的一人带一队 AI,底层很可能就是这类东西。
两个「AI 同事」也开源了,免费,住你电脑里
吴恩达和 Rohit Prasad 这个月开源了个叫 OpenWorker 的项目。它不像 ChatGPT 那样你问它答,而是你说个目标,它自己拆步骤、自己调工具、自己执行、自己汇报。本质是 Agent,不是嘴。
技术上也实在,前端 Tauri 加 React,后端 Python,支持接 GPT、Claude、DeepSeek,也能接你本地部署的开源模型,不绑任何一家。自带 25 个开箱即用的工具,读文件、写代码、搜网页、发邮件都覆盖。
国内这边,网易有道前几天把 LobsterAI(有道龙虾)开源了,被叫国版 OpenClaw。桌面级,不用命令行,自然语言就能让它在你电脑上跨软件干活,生成 PPT、Excel、做数据分析,完全免费。
今天就能试:三步在你自己电脑跑一个本地 AI
光看不过瘾,我给你一套今晚就能动手的。不用买显卡,大概率你现有的电脑就行。
第一步,装 Ollama。 去 ollama.com 下载对应系统的安装包,Win 和 Mac 都行,下一步到底,两分钟。装完它会在后台默默跑着一个服务。
第二步,拉一个模型跑起来。 打开终端(Mac 叫终端,Win 叫命令提示符或 PowerShell),输入:
``` ollama run qwen2.5:7b ```
它自动下载然后直接进对话。这条命令里的 7b 是 70 亿参数,最稳的入门款,普通笔记本就能带。
如果你机器好(32GB 内存或 8GB 以上显卡),想体验今天的新模型,去 ollama.com/search 搜 Muse Glimmer 或 Ling-3.0-tiny,能找到就换对应名字跑。今天这几个刚发,上架可能慢一两天,先拿 qwen2.5:7b 练手完全没问题。
第三步,想要 ChatGPT 那种界面。 终端聊着别扭的话,装个 Open WebUI,浏览器打开像聊天软件:
``` pip install open-webui open-webui serve ```
然后开 http://localhost:3000 ,第一次建个本地账号,数据全在你自己电脑上。
一个立马能用的玩法。 跑起来后,把公司报表、论文、合同往里一丢,用这段prompt让它基于你的文档答:
``` 你只能根据我提供的文档内容回答,不要编造。先列出你看到的 3 个核心结论,再回答我下面的问题:[你的问题] ```
这就等于你有了一个只认你材料的本地顾问,文件不出门。
避坑提醒。 内存是硬门槛,模型装不进内存就会掉到硬盘,慢到没法用。3B 大约吃 3GB,7B 大约 6 到 8GB,14 到 27B 要 12 到 20GB。先拿 7b 试,跑得动再往上加。苹果芯片的 Mac 因为内存统一,跑本地模型特别划算。
这波到底意味着什么
我个人的判断,今天这批发布加起来,等于本地 AI 从「极客玩具」跨进了「普通人的工具」。
以前想用强的模型,要么交月费,要么把数据交给别人。今天之后,免费、开源、能干活、数据留本地的选项一下子多了一大把。对在意隐私的人、对想省 API 钱的小团队、对想在自己机器上折腾智能体的人,都是实打实的好事。
你今天就可以动手跑一个,别等。
下期想看我深挖哪块,留言告诉我:是手把手教你用本地模型搭一个专属知识库,还是盘一盘这些新模型到底哪个最值得普通人的电脑跑?
来源: 1. 智东西/36氪《蚂蚁开源本地 Agent 新模型 Ling-3.0-tiny,MacBook 可跑》(2026-08-11) 2. IT之家《英伟达推出 30B 开源 AI 模型 Nemotron 3.5 Lightning》(2026-08-12) 3. 新智元/36氪《Meta 开源 30B 小钢炮 Muse Glimmer,一台 MacBook 就能跑》(2026-08-12) 4. 吴恩达 OpenWorker 开源项目报道(2026-08) 5. 网易有道 LobsterAI(有道龙虾)开源报道(2026-08-10) 6. Ollama 官方文档 ollama.com(安装与模型命令)
夜雨聆风