本地部署大模型 LLM 完全指南:从硬件选型到 vLLM 实战

一、为什么要本地部署大模型

把数据传到云端大模型,隐私和合规是绕不开的坎。本地部署让你在自有服务器上跑模型,数据不出内网。本文从硬件到实战完整讲一遍。

二、硬件怎么选

1. 显存是核心

  • 7B 模型(如 Qwen2.5-7B):量化后 4-6GB 显存,一张 4060/3060 够用。
  • 14B 模型:需要 12-16GB 显存,建议 4070 Ti / 3090。
  • 32B+ 模型:24GB+ 显存,4090 或 A100。

没有独显也能跑,用 CPU + 大内存(32GB+),只是慢。

2. 量化取舍

Q4_K_M 量化在体积和效果间最平衡,日常使用基本无损。

三、用 Ollama 五分钟起模型

# 安装
curl -fsSL https://ollama.com/install.sh | sh
# 拉取并运行
ollama run qwen2.5:7b
# 查看已装模型
ollama list

想持久服务,设开机自启:systemctl enable --now ollama

四、生产级服务:vLLM

高并发场景用 vLLM,吞吐比原生高数倍:

pip install vllm
python -m vllm.entrypoints.openai.api_server \
  --model Qwen/Qwen2.5-7B-Instruct \
  --tensor-parallel-size 1 \
  --port 8000

它兼容 OpenAI API 格式,现有代码几乎不用改。

五、接入你自己的应用

import openai
client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none")
resp = client.chat.completions.create(
    model="Qwen2.5-7B-Instruct",
    messages=[{"role":"user","content":"用一句话解释反向代理"}]
)
print(resp.choices[0].message.content)

六、常见坑

  • 中文乱码/截断:确认 tokenizer 和模型匹配,用官方 chat 模板。
  • 显存溢出:降量化等级或减 max_model_len。
  • 并发上不去:vLLM 开 --gpu-memory-utilization 到 0.9。

结语

本地部署门槛比想象中低。先拿 7B 模型练手,跑通后再按需升级硬件和模型规模。

上一篇 2026 年 AI 开发者必备工具 TOP 20(按场景分类)
下一篇 Nginx 反向代理配置详解(附 5 种常见场景)