一、DeepSeek 本地部署教程(Ollama 方案)
DeepSeek 开源了全尺寸的推理权重。得益于量化蒸馏技术,开发者可以在消费级显卡(如 RTX 4060 / 4070 / 4090)乃至苹果 Apple Silicon Mac 上流畅离线运行 DeepSeek-R1。
1. 安装 Ollama 工具链
前往本地系统运行环境安装对应客户端,终端输入命令验证安装完成。
2. 推荐模型尺寸与硬件显存对照表
| 模型版本 |
参数量 |
推荐显存/内存 |
一键运行终端命令 |
| deepseek-r1:1.5b |
15亿 |
> 2GB 内存 (轻薄本可用) |
ollama run deepseek-r1:1.5b |
| deepseek-r1:7b |
70亿 |
> 8GB 显存 (推荐 3060/4060) |
ollama run deepseek-r1:7b |
| deepseek-r1:14b |
140亿 |
> 12GB 显存 (推荐 4070/4080) |
ollama run deepseek-r1:14b |
| deepseek-r1:32b |
320亿 |
> 24GB 显存 (推荐 4090/A5000) |
ollama run deepseek-r1:32b |
| deepseek-r1:671b |
满血 6710亿 |
多卡 H800 / 8×4090 集群 |
ollama run deepseek-r1:671b |
图 6 · Ollama 本地部署 DeepSeek-R1 命令行推演实录
二、vLLM 高性能企业集群推理
若需要在公司内网搭建高并发大模型推理服务,推荐采用 vLLM 作为推理后端,支持 PagedAttention 与连续批处理(Continuous Batching)。
vllm serve deepseek-ai/DeepSeek-R1 --tensor-parallel-size 4 --trust-remote-code --port 8000
服务启动后将暴露标准 OpenAI 兼容接口,可以直接通过 http://localhost:8000/v1 进行业务网关对接。
图 7 · vLLM 企业级微服务部署与分布式张量并行拓扑
三、DeepSeek api开放平台与价格计费
DeepSeek API 开放平台为广大开发者与企业客户提供超高性价比的云计算推演接口。注册即赠送免费测试额度,调用采用按量后付费方式。
| 模型名称 |
上下文长度 |
缓存命中输入 (每百万 Token) |
未命中输入 (每百万 Token) |
输出生成 (每百万 Token) |
| DeepSeek-V3 (通用对话) |
64K |
¥0.10 |
¥1.00 |
¥2.00 |
| DeepSeek-R1 (深度推理) |
64K - 128K |
¥1.00 |
¥4.00 |
¥16.00 |
图 8 · DeepSeek 开放平台 API Key 密钥管理与实时消费曲线
四、DeepSeek Harness 自动化评测套件
DeepSeek Harness 是深度求索开源的一整套大模型能力严格检验流水线。支持 GSM8K, MATH, HumanEval, SWE-bench 等数理编程基准自动评分。
git clone deepseek_harness && python -m harness.evaluate --model deepseek-r1 --tasks math_500
图 9 · Harness 全流程数学推导与代码生成严密性验证
五、常见问题排障与技术支持 (FAQ)
1. 本地部署 DeepSeek-R1 时显存溢出 (OOM) 怎么处理?
建议选择 4-bit 量化版本(例如通过 deepseek-r1:7b-q4_K_M),并在启动参数中调小 num_ctx 上下文窗口至 4096,或者启用 CPU 内存卸载共享(Offloading)。
2. DeepSeek API 调用时报错 401 Unauthorized 如何解决?
请检查请求头中的 Authorization: Bearer YOUR_KEY 是否正确填写,确保没有多余的空格或字符;同时确认账户余额是否充值激活。
3. DeepSeek-R1 输出内容中包含 <think> 标签是什么含义?
<think>...</think> 标签内展示的是模型在给出正式答案前自主生成的思维链(Chain of Thought)。您可以在前端将该部分折叠展示,以提供清爽的可读体验。
4. 如何在移动端(iOS / Android)使用 DeepSeek?
六、开源生态交流与求索招募
深度求索持续探索通用人工智能未至之境,我们欢迎全球对底层深度学习算法、分布式编译优化、前沿逻辑推理有热情的科研学者与系统工程师加入我们。