大模型本地部署入门:从 Ollama 到 vLLM
为什么要在本地跑
把文档、代码、聊天记录喂给云端大模型,本质是把自己最私密的数据交给第三方。本地部署能换来三件事:数据不出门、推理成本可控、以及可以随便折腾。
三个阶段
- 玩具阶段:用 Ollama 一条命令拉起模型,适合个人问答和写稿。 ```bash ollama run qwen2.5:7b ```
- 开发阶段:用 Ollama 的 OpenAI 兼容接口接进自己的脚本,替换掉 API Key 即可平滑迁移。
- 服务阶段:并发一上来,Ollama 就不够看了,换成 vLLM 做批处理与显存复用,吞吐能翻几倍。
显存怎么算
经验公式:模型参数量(十亿) × 2(FP16)≈ 所需 GB 显存。7B 约 14GB,13B 约 26GB。量化到 4-bit 能砍掉一大半,但会牺牲一点质量。
结论:消费级 24GB 显卡(如 3090/4090)是本地部署的甜点区,7B~14B 量化模型体验最好。
评论(0)