从 DeepSeek API 官方 GitHub README 翻译整理的快速上手指南。
DeepSeek-V2 是深度求索(DeepSeek)发布的新一代混合专家(MoE)大语言模型。它的特点是训练经济、推理高效——总参数量 236B,但每个 token 只激活 21B 参数。相比上一代 DeepSeek 67B,V2 在性能更强的同时,训练成本节省 42.5%,KV 缓存减少 93.3%,最大生成吞吐量提升至 5.76 倍。
模型基于 8.1 万亿 token 的高质量多源语料预训练,随后经过监督微调(SFT)和强化学习(RL)充分释放能力。
目前已发布两个版本:
pip install torch transformers accelerate
模型托管在 Hugging Face,国内访问受限时可使用镜像站或国产平台。
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "deepseek-ai/DeepSeek-V2-Lite"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_name,
trust_remote_code=True,
torch_dtype="auto",
device_map="auto"
)
完整版 DeepSeek-V2(236B)需要多卡 GPU 或量化部署,建议先试用 Lite 版。
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
# 加载模型和分词器
tokenizer = AutoTokenizer.from_pretrained(
"deepseek-ai/DeepSeek-V2-Lite-Chat",
trust_remote_code=True
)
model = AutoModelForCausalLM.from_pretrained(
"deepseek-ai/DeepSeek-V2-Lite-Chat",
trust_remote_code=True,
torch_dtype=torch.bfloat16,
device_map="auto"
)
# 构造对话
messages = [
{"role": "user", "content": "用 Python 写一个快速排序算法"}
]
input_ids = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt"
).to(model.device)
# 生成回复
outputs = model.generate(
input_ids,
max_new_tokens=512,
do_sample=True,
temperature=0.7,
top_p=0.9
)
response = tokenizer.decode(outputs[0][input_ids.shape[1]:], skip_special_tokens=True)
print(response)
from transformers import TextStreamer
streamer = TextStreamer(tokenizer, skip_prompt=True, skip_special_tokens=True)
model.generate(
input_ids,
max_new_tokens=512,
streamer=streamer,
do_sample=True,
temperature=0.7
)
翻译整理自 GitHub README,原文:https://github.com/deepseek-ai/DeepSeek-V2