从 Meta Llama 官方 GitHub README 翻译整理的快速上手指南。
Meta Llama 2 是 Meta(原 Facebook)推出的开源大语言模型系列,包含 7B、13B 和 70B 三种参数规模的预训练和对话微调版本。本项目提供模型权重和最小化推理示例代码,方便开发者本地加载模型并运行推理。
⚠️ 注意:本仓库已标记为废弃。Meta 已将 Llama 生态整合为统一的 Llama Stack,推荐使用以下新仓库:
- llama-models — 基础模型、模型卡、许可证
- PurpleLlama — 安全风险与推理时防护
- llama-toolchain — 推理/微调/安全/数据生成
- llama-agentic-system — 端到端智能体系统
- llama-cookbook — 社区脚本与集成
Llama 2 可以用于:
模型支持从单卡到多卡分布式推理,7B 模型可在消费级 GPU 上运行。
wget 和 md5sum(用于下载模型)# 1. 克隆仓库
git clone https://github.com/meta-llama/llama.git
cd llama
# 2. 安装依赖
pip install -e .
chmod +x download.sh
./download.sh
按提示粘贴邮件中的链接即可开始下载。
国内访问受限,推荐使用国产替代品或通过 Hugging Face 申请访问(需接受许可协议)。
下载完成后,运行对话示例:
torchrun --nproc_per_node 1 example_chat_completion.py \
--ckpt_dir llama-2-7b-chat/ \
--tokenizer_path tokenizer.model \
--max_seq_len 512 --max_batch_size 6
参数说明:
--ckpt_dir:模型检查点目录路径--tokenizer_path:分词器模型路径--nproc_per_node:并行进程数,7B 模型设为 1,13B 设为 2,70B 设为 8--max_seq_len:最大序列长度--max_batch_size:批处理大小翻译整理自 GitHub README,原文:https://github.com/meta-llama/llama