---
title: "大模型本地部署入门：从 Ollama 到 vLLM"
slug: "20261005124422"
date: "2026-08-21 09:30"
updated: "2026-10-05T12:44:07+08:00"
category: "笔记"
tags: ["AI", "Ollama", "本地部署"]
description: "不想把数据交给云端？本地跑大模型已经足够平民化。这篇梳理从个人玩具到服务化部署的演进路线。"
url: https://blog.dayuai.com/20261005124422
---
## 为什么要在本地跑

把文档、代码、聊天记录喂给云端大模型，本质是把自己最私密的数据交给第三方。本地部署能换来三件事：数据不出门、推理成本可控、以及可以随便折腾。

## 三个阶段

1. **玩具阶段**：用 Ollama 一条命令拉起模型，适合个人问答和写稿。
   ```bash
   ollama run qwen2.5:7b
   ```
2. **开发阶段**：用 Ollama 的 OpenAI 兼容接口接进自己的脚本，替换掉 API Key 即可平滑迁移。
3. **服务阶段**：并发一上来，Ollama 就不够看了，换成 vLLM 做批处理与显存复用，吞吐能翻几倍。

## 显存怎么算

经验公式：模型参数量(十亿) × 2（FP16）≈ 所需 GB 显存。7B 约 14GB，13B 约 26GB。量化到 4-bit 能砍掉一大半，但会牺牲一点质量。

> 结论：消费级 24GB 显卡（如 3090/4090）是本地部署的甜点区，7B~14B 量化模型体验最好。
