DeepSeek本地部署教程:在自己的电脑上运行大模型

D
DeepSeek教程组✓ 已验证
全部部署步骤在 Windows 11 + RTX 4060 / Mac M2 / Ubuntu 22.04 三平台实测通过,包含硬件选购建议。
文章封面图

DeepSeek 提供了强大的云端免费服务,但也开源了模型权重供本地部署。本地部署意味着:对话数据完全留在你的电脑上,无需联网也能使用,没有任何调用次数限制。本教程将带你用 Ollama 工具一键部署 DeepSeek 开源模型,即使你不是技术背景也能完成。如果你只是想快速使用,可以先看DeepSeek电脑版下载安装教程使用官方客户端。

🚀 不想折腾部署?直接用官方云端版

免费 · 即装即用 · 自动更新 · 手机电脑同步 · 无需配置

📥 下载 DeepSeek 官方客户端

为什么要本地部署?

在动手之前,先搞清楚本地部署是否适合你。以下是本地部署的核心优势:

  • 🔒 数据隐私:所有对话数据存储在你的本地硬盘,不会被上传到任何服务器。适合处理敏感文档、商业机密、个人隐私信息
  • 🌐 离线使用:部署完成后无需联网即可使用,出差、坐飞机、网络不稳定时照样用
  • 💰 完全免费:开源模型永久免费,没有 API 调用费用,没有 token 限制
  • 🔧 高度可控:可以调整模型参数(温度、上下文长度等),甚至可以微调模型适应你的特定需求
  • 🚫 无审查限制:本地运行不受任何内容审核策略影响
⚠️ 注意:本地部署的模型能力取决于你的硬件配置。普通消费级显卡运行的是量化版本,效果不如云端完整版(671B参数)。本地部署更适合对隐私有高要求、或需要离线使用的场景。

硬件要求:你的电脑能跑吗?

DeepSeek 开源了多个规格的模型,不同模型对硬件的要求差异很大:

模型规格参数量最低显存推荐显存最低内存适用场景
DeepSeek-R1-1.5B15亿2GB4GB8GB入门测试、嵌入式设备
DeepSeek-R1-7B70亿6GB8GB16GB日常使用、代码辅助
DeepSeek-R1-8B80亿6GB8GB16GB日常对话、文档处理
DeepSeek-R1-14B140亿10GB16GB32GB复杂推理、长文档
DeepSeek-R1-32B320亿20GB24GB32GB专业级推理分析
DeepSeek-R1-70B700亿40GB48GB+64GB服务器/工作站
💡 建议:大多数个人用户选择 7B 或 8B 量化版最合适。在 8GB 显存的显卡(如 RTX 3060/4060)上运行流畅,回答质量已经相当不错。14B 需要 16GB 显存(如 RTX 4080/4090),效果更好。

第一步:安装 Ollama

Ollama 是目前最简单的大模型本地运行工具,支持一键下载和运行各种开源模型,包括 DeepSeek 全系列。

Windows 安装

  1. 访问 ollama.com 官网
  2. 点击 "Download for Windows" 下载安装包(约 700MB)
  3. 双击运行安装程序,按提示完成安装
  4. 安装完成后,Ollama 会在系统托盘显示图标,后台自动运行

macOS 安装

  1. 访问 ollama.com 官网
  2. 点击 "Download for macOS" 下载 .dmg 文件
  3. 双击打开,将 Ollama 拖入 Applications 文件夹
  4. 首次打开时按提示完成设置

Linux 安装

curl -fsSL https://ollama.com/install.sh | sh

安装完成后验证:

ollama --version

第二步:拉取 DeepSeek 模型

Ollama 安装完成后,打开终端(Windows 用 PowerShell 或 CMD),执行以下命令拉取模型:

推荐:拉取 DeepSeek-R1 8B(最均衡的选择)

ollama pull deepseek-r1:8b

其他可选规格

# 轻量版(最低要求,速度最快)
ollama pull deepseek-r1:1.5b

# 7B 版本(经典选择)
ollama pull deepseek-r1:7b

# 14B 版本(需要 16GB 显存)
ollama pull deepseek-r1:14b

# 32B 版本(需要 24GB 显存)
ollama pull deepseek-r1:32b

首次拉取需要下载模型文件(8B 版本约 4.9GB),下载速度取决于你的网络。下载完成后模型会自动加载到内存/显存中。

💡 提示:Ollama 模型存储在 ~/.ollama/models(Mac/Linux)或 %USERPROFILE%\.ollama\models(Windows)。如果系统盘空间不足,可以通过设置 OLLAMA_MODELS 环境变量修改存储路径。

第三步:运行和测试模型

命令行交互模式

ollama run deepseek-r1:8b

运行后会进入交互式对话界面,直接输入问题即可。输入 /bye 退出。

常用命令

# 查看已下载的模型列表
ollama list

# 查看模型详细信息
ollama show deepseek-r1:8b

# 删除模型(释放磁盘空间)
ollama rm deepseek-r1:8b

# 查看运行状态
ollama ps

API 模式调用

Ollama 默认在 http://localhost:11434 提供 REST API,兼容 OpenAI API 格式:

# 使用 curl 调用
curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:8b",
  "prompt": "解释一下量子计算的基本原理",
  "stream": false
}'
💡 进阶建议:配合 Open WebUI(开源 ChatGPT 风格界面)使用体验更好。安装:docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main,然后访问 http://localhost:3000。

第四步:本地版 vs 云端版全面对比

对比维度云端版(官方客户端/网页)本地部署版(Ollama)
模型能力完整 671B 参数,最强效果量化版,能力弱于云端
使用成本免费免费(但需电费和硬件)
数据隐私数据上传到 DeepSeek 服务器数据完全本地,不出电脑
网络要求需要稳定联网离线可用
安装难度一键安装,简单需配置环境,有一定门槛
响应速度取决于网络和服务器负载取决于本地硬件
文件处理支持上传多种格式文件依赖前端工具支持
联网搜索支持不支持(需要额外配置)
多设备同步自动同步每台设备独立部署
更新维护自动更新手动拉取新模型版本
💡 最佳实践:很多用户采用双轨策略——日常使用云端版(方便、能力强),处理敏感文件时切换到本地部署版(隐私安全)。两种方式可以互补使用。

🔐 敏感数据处理?同时备好云端和本地两套方案

云端版处理日常对话 · 本地版保护隐私数据 · 互为备份

📥 下载官方客户端(云端版)

本地部署常见问题与解决

模型加载失败 / OOM(内存不足)

如果提示 "CUDA out of memory" 或模型加载到一半就退出,说明显存不够。解决方案:换用更小的模型版本(如从 8B 降到 1.5B),或使用 CPU 推理(速度较慢但不需要显卡)。

生成速度太慢

如果回复一个字一个字地出,说明可能使用的是 CPU 推理。确认显卡驱动已正确安装,Ollama 能识别到 CUDA(NVIDIA)或 Metal(Mac)。可以用 ollama ps 查看模型是否加载到 GPU。

磁盘空间不足

模型文件占用的空间:1.5B 约 1GB,7B 约 4.5GB,8B 约 4.9GB,14B 约 9GB,32B 约 20GB。确保有足够的磁盘空间,或修改 OLLAMA_MODELS 指向大容量硬盘。

常见问题

没有独立显卡能本地部署吗?
可以,但速度会慢很多。Ollama 支持纯 CPU 推理,7B/8B 模型在 CPU 上大约每秒 2-5 个 token(显卡上通常 30-80 token/s)。如果只是偶尔用,CPU 模式也能接受。Apple Silicon(M1/M2/M3)Mac 用 Metal 加速效果不错。
本地部署的 DeepSeek 和网页版回答质量一样吗?
不一样。网页版使用的是完整 671B 参数模型,能力最强。本地部署的是量化压缩版,能力有折扣。但 32B/70B 版本的推理能力已经接近云端版的 80-90%,日常使用差距不大。
Ollama 和 vLLM/Llama.cpp 有什么区别?
Ollama 最简单,适合个人使用。vLLM 适合服务器部署和高并发场景。Llama.cpp 是底层推理引擎,Ollama 内部也在使用它。对普通用户来说,Ollama 是最推荐的上手方案。
可以同时运行多个模型吗?
Ollama 支持同时加载多个模型,但显存是共享的。如果你的显卡显存够大(如 24GB),可以同时运行 7B + 1.5B。显存不够时会自动使用 CPU 推理,速度下降。建议一次只跑一个模型。