一、为什么要本地部署大模型
把数据传到云端大模型,隐私和合规是绕不开的坎。本地部署让你在自有服务器上跑模型,数据不出内网。本文从硬件到实战完整讲一遍。
二、硬件怎么选
1. 显存是核心
- 7B 模型(如 Qwen2.5-7B):量化后 4-6GB 显存,一张 4060/3060 够用。
- 14B 模型:需要 12-16GB 显存,建议 4070 Ti / 3090。
- 32B+ 模型:24GB+ 显存,4090 或 A100。
没有独显也能跑,用 CPU + 大内存(32GB+),只是慢。
2. 量化取舍
Q4_K_M 量化在体积和效果间最平衡,日常使用基本无损。
三、用 Ollama 五分钟起模型
# 安装
curl -fsSL https://ollama.com/install.sh | sh
# 拉取并运行
ollama run qwen2.5:7b
# 查看已装模型
ollama list
想持久服务,设开机自启:systemctl enable --now ollama。
四、生产级服务:vLLM
高并发场景用 vLLM,吞吐比原生高数倍:
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--tensor-parallel-size 1 \
--port 8000
它兼容 OpenAI API 格式,现有代码几乎不用改。
五、接入你自己的应用
import openai
client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none")
resp = client.chat.completions.create(
model="Qwen2.5-7B-Instruct",
messages=[{"role":"user","content":"用一句话解释反向代理"}]
)
print(resp.choices[0].message.content)
六、常见坑
- 中文乱码/截断:确认 tokenizer 和模型匹配,用官方 chat 模板。
- 显存溢出:降量化等级或减 max_model_len。
- 并发上不去:vLLM 开
--gpu-memory-utilization到 0.9。
结语
本地部署门槛比想象中低。先拿 7B 模型练手,跑通后再按需升级硬件和模型规模。




