GLM-4.1-Air / GLM-4-Air GLM-4-Air
GLM-4系列 · 智谱AI · 2024-07发布
模型介绍
智谱开源 GLM-4-Air,9B 尺寸轻量高效,128K 上下文,MIT 商用自由,性价比高的国产开源选择。
模型基础信息
免费额度与收费政策
免费规则详情
MIT 完全商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 轻量
- 中文强
- 128K
- MIT
⚠️ 短板与局限
- 能力小于旗舰
- 海外生态小
- 英文一般
🎯 适用场景
- 中文轻任务
- 本地部署
- gent
- 微调
模型使用教程
本章节整理 GLM-4.1-Air / GLM-4-Air 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地体验:
ollama run glm-4-air或 Transformers / vLLM 加载。 - 云端:HF 托管模型可在线体验。
ollama run glm-4-air "用中文介绍一下GLM-4.1-Air / GLM-4-Air"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 智谱AI/GLM-4-Air --local-dir ./glm-4-air
或 ModelScope 国内直连下载。
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('智谱AI/GLM-4-Air')
tok = AutoTokenizer.from_pretrained('智谱AI/GLM-4-Air')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))
GLM-4-Air 是智谱 9B 档的轻量模型(MIT),主打低成本高效果,量化后单卡可跑,适合本地部署。
- vLLM 部署:
pip install vllm && vllm serve THUDM/glm-4-air --trust-remote-code --port 8000
- transformers 直连:
python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('THUDM/glm-4-air', trust_remote_code=True, torch_dtype='float16').cuda(); t=AutoTokenizer.from_pretrained('THUDM/glm-4-air', trust_remote_code=True); print(t.decode(m.generate(t('你好', return_tensors='pt').to('cuda'), max_new_tokens=64)[0], skip_special_tokens=True))"
- 低显存用 4bit 量化加载。
Tips:Air 版比 9B 更省显存,性能接近,适合轻量业务;Ollama 也有 glm4 标签可用。
💡 使用小技巧
消费级显卡可跑。
❓ 常见问题 FAQ
Q1:GLM-4-Air 特点?\nA1:轻量高效中文。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com