大于AI 博客

大模型本地部署入门:从 Ollama 到 vLLM

更新于 2026-10-05

为什么要在本地跑

把文档、代码、聊天记录喂给云端大模型,本质是把自己最私密的数据交给第三方。本地部署能换来三件事:数据不出门、推理成本可控、以及可以随便折腾。

三个阶段

  1. 玩具阶段:用 Ollama 一条命令拉起模型,适合个人问答和写稿。 ```bash ollama run qwen2.5:7b ```
  2. 开发阶段:用 Ollama 的 OpenAI 兼容接口接进自己的脚本,替换掉 API Key 即可平滑迁移。
  3. 服务阶段:并发一上来,Ollama 就不够看了,换成 vLLM 做批处理与显存复用,吞吐能翻几倍。

显存怎么算

经验公式:模型参数量(十亿) × 2(FP16)≈ 所需 GB 显存。7B 约 14GB,13B 约 26GB。量化到 4-bit 能砍掉一大半,但会牺牲一点质量。

结论:消费级 24GB 显卡(如 3090/4090)是本地部署的甜点区,7B~14B 量化模型体验最好。

评论(0)

验证码输入图中 4 个字符,不区分大小写;看不清就点图片换一张