乐于分享
好东西不私藏

六百元的电脑,用开源软件玩转本地大模型Gemma-4-12B Q4量化版多模态应用

六百元的电脑,用开源软件玩转本地大模型Gemma-4-12B Q4量化版多模态应用
几百元的海鲜二手混合专家电脑,究竟能实现什么样的性能?跑本地大模型应用的天花板在哪里?今天一起来试试吧,先列一下从海鲜市场淘的主机配置清单:D1581-Q3为志强16核32线程支持AVX2,最大功耗64w,单核性能虽然比较差,但适合AI多线程计算的应用场景。
主板/CPU/内存/硬盘:D1581-Q3+32gb ddr3+128gb SSD=400元
显卡:索泰 P104-100 8gb GDDR5X 最大功耗180w=100
内存:增购两条16gb内存 =58
电源:半岛铁盒N500Plus 6p+2p显卡=35
总价格:593.00
1、首先安装系统和显卡驱动,系统选择Ubuntu26.04LTSC,完成后可以看到32个线程,GPU1是核显,GPU2就是P104-100已经运行(安驱动后)。
2、安装显卡驱动,驱动版本580.159.04,由于是矿卡PCIe是Gen1.1*4

https://github.com/dartraiden/NVIDIA-patcher

3、为了将模型分层调用,所以需要安装llama.cpp,安装后确认一下
4、从Kaggle下载q4量化版主模型和变体,也可以通过其他途径:

https://www.kaggle.com/api/1/models/google/gemma-4/transformers/gemma-4-12b-it-qat-q4_0-unquantized/2/download

https://www.kaggle.com/api/1/models/google/gemma-4/gguf/gemma-4-12b-it-qat-q4_0-gguf/1/download

5、测试加载模型,由于8gb显存不够,所以模型需要分层加载,经过反复测试显存中加载38层是合适的,其余加载至内存,留下部分显存加载上下文。用Python测试一下:

python3 -c "from llama_cpp import Llamallm = Llama(model_path='/home/ubuntu/models/gemma-4-12b-it-qat-q4_0.gguf', n_gpu_layers=38, n_ctx=4096, verbose=False)print('加载成功')"

6、为了方便调用gemma-4-12b的多模态能力,需要建个webui和模型对话,选用纯Python编写的Gradio 6.17.3 — Web UI 框架。

https://github.com/gradio-app/gradio,部署之后需要对程序做一些修改,过程比较复杂。

另外为了实现联网搜索的功能,还同时安装了duckduckgo,版本为ddgs 9.14.4,PyPI 官方源安装,pip install ddgs。deedy5 维护,GitHub github.com/deedy5/ddgs。

7、测试一下多模态能力,从新闻网站上选取了一张领导人出访的照片,国内AI模型一般识别后拒绝,呵呵。

图片从新闻网站copy出来比较小,约20s正确识别完毕。模型识别过程中GPU负载最高到40%,温度到53°C左右,180w的最大功耗只能到70w左右。这说明在PCIe和内存的瓶颈之下,GPU无法发挥最大计算能力,以后再试试小的专业数学和物理模型。

用llama.cpp自带的bench测试Gemma4-12B的Token生成速度,中等长度上下文下约为10Tokens/s,如果使用1.5b or 2b的模型约40-50Tokens。在模型运行过程中整机功耗约100w,待机运行状态下约35-40w。计算一下在家玩的成本,满负荷AI运算一天约2.5度电,大概1.5元,产生的Tokens数量约85万左右,和deepseek v4Flash的价格差不多。好处是不受内容限制,如果是生产使用还是效率太低了,如果是跑垂直领域的专业小模型,特别是数学、物理模型,每秒几十tokens的速度还是有一定的实用价值。

以上测试仅供参考,祝玩AI愉快~~~