夜雨聆风学习资料网

ARTICLE · 1159478

vLLM 私有化大模型部署实战指南:离线安装

vLLM 私有化大模型部署实战指南:离线安装

vLLM 私有化大模型部署实战指南:离线安装

最近不少同行问我,大模型怎么部署到自家服务器,离线环境又该怎么用。我干脆把步骤理了一遍,照着做就能跑起来。

这次挑了三个模型:DeepSeek-V4-Flash-0731 负责对话,Qwen3-Embedding-8B 管文本向量化,Qwen3.5-9B 扛小规模对话。它们能分开装,也能在不同 GPU 上同时跑。

硬件门槛得先卡准:DeepSeek 权重约 166.9GB,跑起来还得额外显存。我这套是四卡专家并行配置,千万别拿四张 24GB 的卡照搬。两个 Qwen 模型按 BF16 单卡加载,建议先用 32GB 或更大显存验证。只有一张卡的话,启动前改成 device=0,并停掉另一个占卡的服务。

离线迁移得带齐家当:先在联网机器上固定镜像版本,下载完整模型仓库,连着驱动和依赖一起打包。转移到内网后,先做哈希校验再导入。启动时记得加上离线变量,把网络边界彻底封死。

启动后别光看容器状态:首次启动要加载权重,容器显示 running 不代表就绪。得去查日志,再用 curl 挨个检查健康状态和模型名。最后拿 vllm bench 压一轮,从并发 2 开始慢慢往上加,首 token 延迟和吞吐量都得盯紧。

原文vLLM 私有化大模型部署实战指南:离线安装、接口调用与压测调优
作者提示: 个人观点,仅供参考
天津,7小时前,

相关学习资料