大家好,我是老宋。我专注研究企业 AI、AI Agent 和数字员工,帮老板把 AI 真正用到业务里。
昨晚我最强烈的一个信号是:Mac 上跑本地大模型这件事,门槛突然被“按 y 确认”这种级别的自动化压平了。以前折腾一小时起步,还可能翻车。现在用 Codex 桌面端,让它替你跑命令、装环境、下模型、配 API,30-60 分钟把本地 35B 跑通。
这件事值得关注,不是因为“又多了一个本地引擎”。而是因为:企业里那些高频、低风险、但特别吃 Token 的文本活,开始有了一个更现实的“本地算力底座”。隐私不外发、断网能用、成本可控,还能被流程自动化直接调用。
以前本地模型难在“流程”,不是难在“模型”
在 Mac 上跑本地大模型,过去的典型路径是:
装 Python、装 Homebrew、找模型、下 GGUF、改 config、配 API……中间任何一步出错,都会把你从“想用 AI”打回“先学环境配置”。
企业里更现实:老板不缺预算,团队也不缺聪明人,缺的是稳定可复用的安装交付。只要部署这一步不能标准化,就很难进入“部门级推广”,最多停留在极客自用。
这一轮变化的关键点是:把部署变成可委托的执行。你不需要亲自敲命令,你只需要像交代助理一样交代 Codex:做什么、怎么验收、我只负责确认。
这次的“三件套”:Codex + omlx + Qwen MoE
现在这套更顺的组合,我建议你把它理解成三层:
Codex 桌面 app:执行层。替你跑命令、装依赖、拉模型、做验证,过程中你只需要按 y 授权确认。
omlx:引擎层。Mac 本地模型运行引擎,走 Apple Silicon 的 MLX 体系,更贴近硬件。
Qwen3.6-35B-A3B(MoE):模型层。35B 总参数,但每次只激活 3B,目标就是“效果接近大模型,速度更像小模型”。
这三件套组合在一起,意义是:本地大模型第一次更像一个“可安装的软件”,而不是一套“需要工程师陪跑的项目”。

怎么装:把命令行交给 Codex,你只负责验收
我按“企业可交付”的方式,把流程讲成 4 步,你照这个给团队同事发也能复现。
第一步:装 Codex(Mac 桌面端)安装并登录后,先做一次权限测试:让它跑一个简单命令,比如列出下载目录文件。能跑通,说明授权 OK。
第二步:让 Codex 装 omlx直接把安装命令和验收条件写清楚交给 Codex:
用 brew 安装 omlx
装完启动菜单栏 app
验证 localhost:8000/admin 能打开
它会自动:检查 brew → 加源 → 安装 → 启动 → 验证。你只负责确认步骤。
第三步:让 Codex 下载并固定(pin)模型到内存根据内存选型号,别硬上:
8GB:Qwen3.54b(先体验流程,飞快)
16GB:Qwen3.59b(日常够用)
24GB:Qwen3.6-35B-A3B Q4(很甜的平衡点)
32GB:同上(长上下文更舒服)
48GB+:Q5(质量更上去)
下载通常 20-30 分钟,关键是:出差、上飞机、进客户现场之前,先把模型下好,不然离线你啥也用不了。
第四步:跑通 API 测试用本地 OpenAI 兼容接口跑一次 chat/completions,能正常回复,就说明:你的 Mac 已经能稳定跑本地大模型服务了。

为什么我更推荐 omlx:不是“更快”,是“更贴 Mac”
很多中文教程还停留在一条路:Ollama。它当然也能用,但对 Apple Silicon 来说,omlx 这套更“原生”。
你把它当成三个好处就够了:
性能更贴硬件:直接调用 MLX 框架,同模型在 Apple Silicon 上更有优势
内存更省:同样内存能跑更大的模型,企业里这点很关键(因为你不可能人人都配顶配)
体验更像软件:原生菜单栏形态,比“套壳 + 配一堆参数”更像交付品
还有一个很实用的细节:KV Cache 分层/Offload 的思路,会让长对话不那么容易把内存吃爆。对“合同、方案、产品资料”这种长文本场景,体感差异会更明显。
MoE 模型要抓住一个关键认知:文件按“大”,推理按“小”
Qwen3.6-35B-A3B 这种 MoE(Mixture of Experts)模型,最容易被误解的就是“35B 太大跑不动”。
但它的核心是:总参数 35B,每次只激活 3B。
企业翻译一下:
你需要为“模型体积/加载”付出成本(内存占用会按 35B 的量级考虑,量化后依然不小)
但你在“生成速度/推理”上,更多像在跑 3B 的活(所以速度很可观)
所以它特别适合当一个“本地高频文本工人”:写邮件、翻译、改写、总结、标准回复、代码 review(偏隐私的那种),这些任务强依赖吞吐,不一定要求云端最强智力。
跑通以后,企业里怎么用才划算
跑通只是开始,真正值钱的是“把本地模型接进工作流”。
我建议从两条路选一条:

方式一:浏览器直接聊(最快落地)打开本地管理页,选模型就能聊。适合个人/小团队先把使用习惯建立起来。
方式二:Codex 自动路由(更像企业用法)把规则讲清楚:
commit、翻译、摘要、邮件 这 4 类任务优先走本地
复杂推理、需要联网检索、超高质量输出的任务再走云端
这样你会得到三个结果:1)高频任务 Token 成本显著下降;2)隐私内容尽量不出本机;3)断网时也能继续产出(现场改文案、改报价邮件、改 SOP)。
最后给 3 个“交付层面”的提醒,一句就够:
16GB 别硬塞 35B,先用 9B 把流程跑顺;
离线前先把模型下载好;
MacBook Air 别长时间高负载跑推理,持续任务更适合 Pro 机型。
本地 AI 不一定比云端更强,但它更像企业需要的那种基础设施:便宜、稳定、可控、能被自动化调用。技术真正的进步,是让“技术本身”从交付里消失。
关注老宋,持续拆解企业 AI 落地、AI Agent 和数字员工。
我也在做企业 AI 部署和业务自动化,欢迎咨询:aicockpit.com.cn
想知道你的行业怎么用 AI 改造流程?评论区留下行业,我们会私信你。
夜雨聆风