乐于分享
好东西不私藏

纯CPU电脑本地部署AI模型全攻略:大模型/语音/OCR一站式

纯CPU电脑本地部署AI模型全攻略:大模型/语音/OCR一站式

没显卡就不能本地跑AI了?这事被带偏的人挺多。其实纯CPU的老机器也能跑一堆东西,关键不在模型多大,在量化压缩。这篇把能在低配和纯CPU电脑上跑的AI模型捋成一份清单——大模型Qwen、Phi、Llama,语音转文字Whisper,文字转语音CosyVoice,OCR识别PaddleOCR,离线翻译,还有Pinokio、Open WebUI、pyVideoTrans这些一键装好的整合软件。一台吃灰的旧电脑,能变成本地AI小工坊。


没显卡就不能本地跑AI了?被这话劝退的人不少。

前两天群里又有人问,我这破笔记本没独显能跑大模型吗,底下齐刷刷回"别想了"。看着挺无奈。能不能跑这事,跟机器贵不贵没多大关系,跟模型被没被压缩过有关系。

得先说个词,量化。

大模型原始权重十几个G,全是浮点数。CPU每吐一个字,就得把这堆权重从头到尾读一遍,累死。量化就是把这堆数压小,压到4-bit,一个3B的模型剩1.5G,CPU读着就不费劲了。格式叫GGUF,档位先记Q4_K_M,日常够了,内存富裕再往上调。

所以真不是显卡的事。是舍不舍得用压缩模型的事。

大模型:先按内存挑

内存
推荐
速度
2G老古董
Qwen2.5-0.5B、Gemma-3-1B
勉强能动
4G老CPU
Qwen2.5-1.5B、Gemma-2-2B
还行
8G(大多数)
Qwen2.5-3B、Phi-4-mini、Llama-3.2-3B
跟人打字差不多
16G纯CPU
Qwen2.5-7B、Mistral-7B
慢,但能用

量化后体积大概0.5到5G,跟参数量挂钩。

挑出来最稳的几个,脾气不一样:

模型
擅长
Qwen2.5
阿里的,中文和代码强,小号性价比最高,首推
Phi-4-mini
微软的,推理和写代码比看着强
Gemma
谷歌的,多语言、翻译、摘要
Llama-3.2
Meta的,聊天语气自然,写文案顺手

工具别纠结,Ollama一条命令的事,ollama run qwen2.5:1.5b,还开着个OpenAI兼容接口,写代码调它跟调云端一个样,换模型就改个名。

这些小模型能干啥

小模型是干碎活的,不是来跟GPT拼智商的。

能干
别指望
改写润色
复杂推理、数学题(算错跳步)
抠结构化信息
超长文档(上下文就两三千,长文截断)
分类打标签
事实准不准要求高的(幻觉多,数据别全信)
做摘要
写小段代码、正则
本地知识库问答

其实是助理的助理,脏活先过一遍。真要深度内容、要判断,还得靠云端或者人。

专项模型其实更香

除了大模型,还有一类专门干一件事的,比大模型轻,在CPU上也比大模型实用。

能力
推荐
语音转文字
Whisper。whisper.cpp纯C++不用Python连ARM都跑,faster-whisper加int8更快。small模型2G内存够
文字转语音
低配选CosyVoice-300M Lite,三百多兆纯CPU几秒出声。想要自然用ChatTTS,要克隆声音上GPT-SoVITS
翻译
Argos Translate,pip一行装,2G内存离线跑,英语中转40多种语言
OCR
PaddleOCR,2026最强,中文碾压Tesseract,轻量模型才一兆多参数

转会议录音、做字幕用Whisper;发票证件、截图文字用OCR;敏感合同用离线翻译。这些活专项模型利索多了。

串起来还能搭条流水线:录音用Whisper转文字,丢给本地大模型出纪要,再CosyVoice配音;截图用PaddleOCR抠字,再让大模型入库。全程不出本机。

不想自己装?有整合软件

一个个装确实劝退。整合软件现在挺成熟:

软件
干啥的
Pinokio
一键安装器,点一下装好Whisper/Ollama/TTS,环境依赖全配,免费。不想碰命令行上这个
Open WebUI
加Ollama就是本地ChatGPT,Docker一行起,能传文档问答、语音、多用户
AnythingLLM
文档问答向,桌面版免Docker,拖PDF进去就能聊
pyVideoTrans
国产开源,视频翻译配音一条龙,识别→翻译→配音→合成,有无显卡都能跑,解压双击用
LocalAI
全家桶后端,大模型/转写/配音/图像/向量化一个服务包了,OpenAI兼容接口,纯CPU也行

做内容的pyVideoTrans真得看,字幕、转文字、配音一个就够。

怎么搭

想要啥
这么搭
不折腾
Pinokio装Ollama+Open WebUI,加个pyVideoTrans做视频
统一接口写工具
LocalAI一个容器全搞定
就想聊天问答
Ollama + Open WebUI,最省心

纯CPU记住一条,别贪大。大模型1.5B到3B,Whisper用small,配音CosyVoice-300M Lite,OCR用PaddleOCR。这套老电脑都带得动。

那些吃灰的旧电脑,先别卖废铁。


下一篇真动手,在一台机器上把Ollama加个3B模型跑起来,再走一遍音频转文字加配音。光看不做,永远学不会。

关注小虾,一起成长,一起进化

往期推荐

当培训落到了我头上——推诿扯皮之后,我用龙虾智能体写了套考试系统

国外大模型现在卷成啥样了:GPT-5.5、Claude、Gemini三国杀

英伟达走后谁来喂饱中国大模型:算力卡脖全解析