


https://github.com/dartraiden/NVIDIA-patcher


https://www.kaggle.com/api/1/models/google/gemma-4/transformers/gemma-4-12b-it-qat-q4_0-unquantized/2/download
https://www.kaggle.com/api/1/models/google/gemma-4/gguf/gemma-4-12b-it-qat-q4_0-gguf/1/download

5、测试加载模型,由于8gb显存不够,所以模型需要分层加载,经过反复测试显存中加载38层是合适的,其余加载至内存,留下部分显存加载上下文。用Python测试一下:
python3 -c "from llama_cpp import Llamallm = Llama(model_path='/home/ubuntu/models/gemma-4-12b-it-qat-q4_0.gguf', n_gpu_layers=38, n_ctx=4096, verbose=False)print('加载成功')"

6、为了方便调用gemma-4-12b的多模态能力,需要建个webui和模型对话,选用纯Python编写的Gradio 6.17.3 — Web UI 框架。
https://github.com/gradio-app/gradio,部署之后需要对程序做一些修改,过程比较复杂。
另外为了实现联网搜索的功能,还同时安装了duckduckgo,版本为ddgs 9.14.4,PyPI 官方源安装,pip install ddgs。deedy5 维护,GitHub github.com/deedy5/ddgs。

7、测试一下多模态能力,从新闻网站上选取了一张领导人出访的照片,国内AI模型一般识别后拒绝,呵呵。


图片从新闻网站copy出来比较小,约20s正确识别完毕。模型识别过程中GPU负载最高到40%,温度到53°C左右,180w的最大功耗只能到70w左右。这说明在PCIe和内存的瓶颈之下,GPU无法发挥最大计算能力,以后再试试小的专业数学和物理模型。

用llama.cpp自带的bench测试Gemma4-12B的Token生成速度,中等长度上下文下约为10Tokens/s,如果使用1.5b or 2b的模型约40-50Tokens。在模型运行过程中整机功耗约100w,待机运行状态下约35-40w。计算一下在家玩的成本,满负荷AI运算一天约2.5度电,大概1.5元,产生的Tokens数量约85万左右,和deepseek v4Flash的价格差不多。好处是不受内容限制,如果是生产使用还是效率太低了,如果是跑垂直领域的专业小模型,特别是数学、物理模型,每秒几十tokens的速度还是有一定的实用价值。
以上测试仅供参考,祝玩AI愉快~~~
夜雨聆风