AI开发环境搭建好了,第一步该干什么?不要急着搞Pytorch开发,先易后难,不妨先装个本地大模型玩玩。本地化部署大模型也是FDE(Forward Deployed Engineer,前线部署工程师,简称 FDE)的第一板斧。
部署大模型需要看菜吃饭。硬件环境:神舟战神S9,CPU i7-13620,内存32G,显卡nvidia RTX5070,显存8G,软件环境:windows CSL(虚拟机版Ubuntu),python3 v3.14,pytorch v2.11,cuda toolkit 13.0,transformers v5.14 ,vllm v0.26,Visual Studio Code v1.131。
这样的配置只能跑14B以下的大模型,考虑到需要留点显存给RAG用,选7-8B的大模型会比较好。DeepSeek R1 Distill Llama 8B 正合适,逻辑推理能力和中文处理能力强,Q4量化仅需4.5G显存,以后可以实现全栈RAG本地部署。
DeepSeek-R1:8B可以用ollama部署,也可以用vllm部署。用ollama部署最简单,而且ollma在显存使用方面比较省心,可以自动释放和收集显存碎片。用vllm部署的好处则是后续用python编程方面。
我决定先从简单做起,用ollama部署。
第一步:安装ollama。在WSL中运行以下指令(注意:WSL与其他Linux一样,指令是区分大小写的。以下指令都要小写):
curl -fsSL https://ollama.com/install.sh| sh
但经常安装文件下载到一半就断掉。折腾了好几遍都不行。最后是先在ollama官网下载了安装脚本install.sh ,在WSL中使用以下指令安装成功:
chmod +x install.sh
./install.sh
第二步:用ollama部署DeepSeek R1:8B。在WSL中运行以下指令:
ollama pull deepseek-r1:8b
第三步:用ollama运行DeepSeek R1:8B。在WSL中运行以下指令:
ollama run deepseek-r1:8b
大约2-3秒后就出现了“>>>Send a message (/? for help)”表示deepseek-r1已经开始运行了。
第四步:验证deepseek能力。在>>>后随便输入一个问题,测试deepseek-r1:8b的能力。例如:请逐步推理:1+1等于几?输出结果如下:

第五步:连接DS和VS Code。启动VC Code。新建一个.py文件,输入以下代码:
import requests
import json
url='http://localhost:11434/api/generate'#ollama的服务端口是11434
payload={
'model':'deepseek-r1:8b',
'prompt':'请逐步推理:1+1等于几?',
'stream':False
}
response=requests.post(url,json=payload)
print(response.json()['response'])
在VS Code 中运行这段代码,会在屏幕下方的“终端”页签中显示DeepSeek的显示成果。

恭喜您,经过这么简单的几步,您已经把AI大模型成功塞进您的本本中了,从此可以跟吞金兽token说拜拜了。
夜雨聆风