DeepSeek 提供了强大的云端免费服务,但也开源了模型权重供本地部署。本地部署意味着:对话数据完全留在你的电脑上,无需联网也能使用,没有任何调用次数限制。本教程将带你用 Ollama 工具一键部署 DeepSeek 开源模型,即使你不是技术背景也能完成。如果你只是想快速使用,可以先看DeepSeek电脑版下载安装教程使用官方客户端。
为什么要本地部署?
在动手之前,先搞清楚本地部署是否适合你。以下是本地部署的核心优势:
- 🔒 数据隐私:所有对话数据存储在你的本地硬盘,不会被上传到任何服务器。适合处理敏感文档、商业机密、个人隐私信息
- 🌐 离线使用:部署完成后无需联网即可使用,出差、坐飞机、网络不稳定时照样用
- 💰 完全免费:开源模型永久免费,没有 API 调用费用,没有 token 限制
- 🔧 高度可控:可以调整模型参数(温度、上下文长度等),甚至可以微调模型适应你的特定需求
- 🚫 无审查限制:本地运行不受任何内容审核策略影响
硬件要求:你的电脑能跑吗?
DeepSeek 开源了多个规格的模型,不同模型对硬件的要求差异很大:
| 模型规格 | 参数量 | 最低显存 | 推荐显存 | 最低内存 | 适用场景 |
|---|---|---|---|---|---|
| DeepSeek-R1-1.5B | 15亿 | 2GB | 4GB | 8GB | 入门测试、嵌入式设备 |
| DeepSeek-R1-7B | 70亿 | 6GB | 8GB | 16GB | 日常使用、代码辅助 |
| DeepSeek-R1-8B | 80亿 | 6GB | 8GB | 16GB | 日常对话、文档处理 |
| DeepSeek-R1-14B | 140亿 | 10GB | 16GB | 32GB | 复杂推理、长文档 |
| DeepSeek-R1-32B | 320亿 | 20GB | 24GB | 32GB | 专业级推理分析 |
| DeepSeek-R1-70B | 700亿 | 40GB | 48GB+ | 64GB | 服务器/工作站 |
第一步:安装 Ollama
Ollama 是目前最简单的大模型本地运行工具,支持一键下载和运行各种开源模型,包括 DeepSeek 全系列。
Windows 安装
- 访问 ollama.com 官网
- 点击 "Download for Windows" 下载安装包(约 700MB)
- 双击运行安装程序,按提示完成安装
- 安装完成后,Ollama 会在系统托盘显示图标,后台自动运行
macOS 安装
- 访问 ollama.com 官网
- 点击 "Download for macOS" 下载 .dmg 文件
- 双击打开,将 Ollama 拖入 Applications 文件夹
- 首次打开时按提示完成设置
Linux 安装
curl -fsSL https://ollama.com/install.sh | sh
安装完成后验证:
ollama --version
第二步:拉取 DeepSeek 模型
Ollama 安装完成后,打开终端(Windows 用 PowerShell 或 CMD),执行以下命令拉取模型:
推荐:拉取 DeepSeek-R1 8B(最均衡的选择)
ollama pull deepseek-r1:8b
其他可选规格
# 轻量版(最低要求,速度最快) ollama pull deepseek-r1:1.5b # 7B 版本(经典选择) ollama pull deepseek-r1:7b # 14B 版本(需要 16GB 显存) ollama pull deepseek-r1:14b # 32B 版本(需要 24GB 显存) ollama pull deepseek-r1:32b
首次拉取需要下载模型文件(8B 版本约 4.9GB),下载速度取决于你的网络。下载完成后模型会自动加载到内存/显存中。
~/.ollama/models(Mac/Linux)或 %USERPROFILE%\.ollama\models(Windows)。如果系统盘空间不足,可以通过设置 OLLAMA_MODELS 环境变量修改存储路径。
第三步:运行和测试模型
命令行交互模式
ollama run deepseek-r1:8b
运行后会进入交互式对话界面,直接输入问题即可。输入 /bye 退出。
常用命令
# 查看已下载的模型列表 ollama list # 查看模型详细信息 ollama show deepseek-r1:8b # 删除模型(释放磁盘空间) ollama rm deepseek-r1:8b # 查看运行状态 ollama ps
API 模式调用
Ollama 默认在 http://localhost:11434 提供 REST API,兼容 OpenAI API 格式:
# 使用 curl 调用
curl http://localhost:11434/api/generate -d '{
"model": "deepseek-r1:8b",
"prompt": "解释一下量子计算的基本原理",
"stream": false
}'
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main,然后访问 http://localhost:3000。
第四步:本地版 vs 云端版全面对比
| 对比维度 | 云端版(官方客户端/网页) | 本地部署版(Ollama) |
|---|---|---|
| 模型能力 | 完整 671B 参数,最强效果 | 量化版,能力弱于云端 |
| 使用成本 | 免费 | 免费(但需电费和硬件) |
| 数据隐私 | 数据上传到 DeepSeek 服务器 | 数据完全本地,不出电脑 |
| 网络要求 | 需要稳定联网 | 离线可用 |
| 安装难度 | 一键安装,简单 | 需配置环境,有一定门槛 |
| 响应速度 | 取决于网络和服务器负载 | 取决于本地硬件 |
| 文件处理 | 支持上传多种格式文件 | 依赖前端工具支持 |
| 联网搜索 | 支持 | 不支持(需要额外配置) |
| 多设备同步 | 自动同步 | 每台设备独立部署 |
| 更新维护 | 自动更新 | 手动拉取新模型版本 |
本地部署常见问题与解决
模型加载失败 / OOM(内存不足)
如果提示 "CUDA out of memory" 或模型加载到一半就退出,说明显存不够。解决方案:换用更小的模型版本(如从 8B 降到 1.5B),或使用 CPU 推理(速度较慢但不需要显卡)。
生成速度太慢
如果回复一个字一个字地出,说明可能使用的是 CPU 推理。确认显卡驱动已正确安装,Ollama 能识别到 CUDA(NVIDIA)或 Metal(Mac)。可以用 ollama ps 查看模型是否加载到 GPU。
磁盘空间不足
模型文件占用的空间:1.5B 约 1GB,7B 约 4.5GB,8B 约 4.9GB,14B 约 9GB,32B 约 20GB。确保有足够的磁盘空间,或修改 OLLAMA_MODELS 指向大容量硬盘。