Llama 3.3 3.3
Llama系列 · Meta AI · 2024-12发布
模型介绍
Meta 在 Llama 3.1 基础上优化的 70B 模型,用更小规模达到接近 405B 的效果,推理成本大幅下降,是单卡 / 双卡可运行的顶级开源模型。
模型基础信息
免费额度与收费政策
免费规则详情
开源权重免费商用,遵守 Llama 社区许可即可。
收费标准简介
本地零成本;托管按 token 计费。
模型能力介绍
✅ 核心优势
- 70B 达到 405B 级别的能力
- 成本远低于同性能闭源
- 128K 长上下文
- 工具调用完善
⚠️ 短板与局限
- 72B 仍需较高显存
- 中文略逊于国产同尺寸
- 许可有附加条款
🎯 适用场景
- 企业私有化基座
- 长文档处理
- gent 工作流
- 高性价比自部署
模型使用教程
本章节整理 Llama 3.3 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
Llama 3.3 主打 70B 的成本获得接近 405B 的能力,适合作为企业私有化基座或省钱的自建方案。
- 指令版(Instruct):开箱即用对话。
- 基础版(Base):适合继续预训练 / 微调。
- 在 Hugging Face 同意 Llama 许可后下载:
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download meta-llama/Llama-3.3-70B-Instruct --local-dir ./llama33
ollama run llama3.3 "用中文写一段关于AI未来的话"
Llama 3.3 是 70B 的优化模型,用更小规模达到接近 405B 的效果,量化后双卡可跑。
- Ollama(需约 40GB+ 显存):
ollama pull llama3.3:70b(或先拉 8B 蒸馏版体验)
- vLLM 部署(70B):
pip install vllm && vllm serve meta-llama/Llama-3.3-70B-Instruct --port 8000 --tensor-parallel-size 2
- 低显存用 4bit/AWQ 量化版(社区 TheBloke 有现成权重)。
Tips:70B 全量约 140GB 显存,量化后约 35GB(2×24GB 或 1×48GB);推理成本低于 405B。
💡 使用小技巧
双卡 4090(Q4)即可运行 70B。
本地体验:ollama run llama3.3。
❓ 常见问题 FAQ
Q1:和 Llama 3.1 70B 比强多少?
A1:明显更强,接近 405B 水平。
Q2:显存要多大?
A2:Q4 量化约 40GB。
访问备注与注意事项
- 权重国内 hf-mirror 可下
- 需同意 Llama 许可
Aitishiku.com