10M 上下文LlamaMetaMoE 开源模型
Llama 4 Scout 4 Scout
Llama 4 Scout系列 · Meta AI · 2025-04发布
模型介绍
Meta Llama 4 系列中的超长上下文模型,17B 激活/109B 总参数 MoE,原生多模态,10M token 上下文,Int4 量化可单卡 H100 运行。
模型基础信息
模型系列Llama 4 Scout系列
开发机构Meta AI
发布时间2025-04
参数规模109B(17B 激活)MoE
上下文窗口10M
模型类型多模态(文本+图像)
中文能力良好
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
开源免费
免费规则详情
社区许可免费商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 10M 上下文
- MoE 高效
- 多模态
- 单卡可跑
⚠️ 短板与局限
- 中文一般
- 许可条款
🎯 适用场景
- 超长文档
- 多模态
- 本地部署
- 检索
模型使用教程
本章节整理 Llama 4 Scout 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地体验:
ollama run llama-4-scout或 Transformers / vLLM 加载。 - 云端:HF 托管模型可在线体验。
ollama run llama-4-scout "用中文介绍一下Llama 4 Scout"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Meta AI/Llama 4 Scout --local-dir ./llama-4-scout
或 ModelScope 国内直连下载。
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('Meta AI/Llama 4 Scout')
tok = AutoTokenizer.from_pretrained('Meta AI/Llama 4 Scout')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))
Llama 4 Scout 是 Meta 开源的高效 MoE 模型(109B 总参,激活 17B),10M 上下文,Apache-2.0,消费级单卡可跑。
- Ollama(GGUF 社区版):
ollama pull llama4-scout
- vLLM:
pip install vllm && vllm serve meta-llama/Llama-4-Scout-17B-16E-Instruct --port 8000
- 显存不足用 4bit 量化(约 20GB)。
Tips:MoE 激活仅 17B,24GB 卡量化后可跑;10M 上下文适合超长文档。
💡 使用小技巧
ollama pull llama4:scout 体验。
❓ 常见问题 FAQ
Q1:Scout 亮点?\nA1:10M 超长上下文。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com