看到英伟达特供芯片的新闻,很多人第一反应是:那我自己的电脑能跑多大的AI模型? 今天教你用3个步骤,5分钟内摸清自己电脑的"AI家底"——不用买新显卡,先看现有配置能跑什么。
前置条件:Windows/Linux/Mac皆可;Windows用户需先安装GPU驱动(NVIDIA官网自动检测安装)。
大模型推理时,模型权重必须整体装进显存(VRAM)。先看你的显卡有多少显存:
# NVIDIA显卡(Windows用命令提示符,Linux用终端)nvidia-smi看输出中 "Memory-Usage" 一栏,比如 4096MiB / 8192MiB 表示8GB显存。没有NVIDIA显卡的,用CPU也能跑小模型,只是慢——稍后再说。
成功验证:能看到GPU名称和显存大小。失败处理:提示找不到命令 → 更新驱动;提示无GPU → 跳过第2步,直接看第3步的CPU方案。
第2步:按显存对号入座,选模型
经验公式:模型显存 ≈ 参数量 × 每参数字节数。 量化后7B模型约需4GB,14B约需8GB,32B约需20GB。
# 一步验证:用Ollama拉一个7B模型并问它问题(自动选适配模型)curl -fsSL https://ollama.com/install.sh | shollama run qwen2.5:7b "你好,介绍一下你自己"成功验证:终端出现模型回复。失败处理:显存不够会报 out of memory → 换更小模型如 qwen2.5:3b;网速慢就等,Ollama支持断点续传。
第3步:没有NVIDIA显卡?CPU+内存方案照样玩
只有核显或AMD/苹果芯片的,用CPU跑模型依然可行,代价是速度:
# 苹果芯片(M系列)推荐用MLX框架,速度快3-5倍pip install mlx-lmmlx_lm.generate --model mlx-community/Qwen2.5-7B-4bit --prompt "写一首关于夏天的诗"# 普通CPU直接用Ollama,设好内存上限ollama run qwen2.5:7b --num-ctx 2048关键指标是内存(RAM):7B模型量化后约4-5GB,建议内存≥16GB;速度约每秒5-20字,写代码、总结文档够用,实时对话稍卡。
成功验证:能输出完整回答。失败处理:内存不足 → 关掉浏览器标签页再试;太慢 → 换 qwen2.5:3b 或 llama3.2:3b。
额外福利:测一下真实推理速度
ollama run qwen2.5:7b "1+1=?" # 看输出 token/s判定标准:≥20 token/s 很流畅;5-20 可接受;<5 建议换小模型。
小结
核心结论:显存决定模型上限,内存决定CPU方案下限。8GB显存 → 7B量化是甜点;没显卡 → 16GB内存+7B量化是甜点。这套流程10分钟跑完,买不买新显卡,先测了再说。
常见失败三连:Ollama安装失败(检查curl是否可用)、显存报错(换更小模型)、中文乱码(终端编码切UTF-8)。
进阶:显存不够时的两个省钱方案
方案一:量化再量化。 同一个模型用Q4量化版,显存需求能降到FP16的1/4。4GB显存跑7B量化版就是这样实现的。方案二:云端过渡。 短期用API按量付费(DeepSeek、通义等国内平台很便宜),攒够预算再上本地。两者组合,几乎覆盖所有"想本地跑但配置不够"的场景。
这套评估能帮你做什么决策
换显卡决策:测出当前瓶颈是显存还是内存,决定该加内存条还是换显卡,避免花冤枉钱。买云服务决策:知道自己的任务需要多大模型,就不会被云厂商"大模型套餐"忽悠,按需买最小档位。学习路线决策:新手先用7B模型跑通提示词工程,再逐步升级到更大模型,学习曲线最平滑。
一句话:先评估,再花钱——AI本地部署最大的坑不是技术,而是买了用不上的配置。
夜雨聆风