MIT开源智谱轻量 开源模型

GLM-4.1-Air / GLM-4-Air GLM-4-Air

GLM-4系列 · 智谱AI · 2024-07发布

开源支持本地部署国内可直连有免费额度长上下文代码专用

模型介绍

智谱开源 GLM-4-Air,9B 尺寸轻量高效,128K 上下文,MIT 商用自由,性价比高的国产开源选择。

模型基础信息

模型系列GLM-4系列
开发机构智谱AI
发布时间2024-07
参数规模9B
上下文窗口128K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 完全商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 轻量
  • 中文强
  • 128K
  • MIT

⚠️ 短板与局限

  • 能力小于旗舰
  • 海外生态小
  • 英文一般

🎯 适用场景

  • 中文轻任务
  • 本地部署
  • gent
  • 微调

模型使用教程

本章节整理 GLM-4.1-Air / GLM-4-Air 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run glm-4-air 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run glm-4-air "用中文介绍一下GLM-4.1-Air / GLM-4-Air"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 智谱AI/GLM-4-Air --local-dir ./glm-4-air

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('智谱AI/GLM-4-Air')
tok = AutoTokenizer.from_pretrained('智谱AI/GLM-4-Air')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

GLM-4-Air 是智谱 9B 档的轻量模型(MIT),主打低成本高效果,量化后单卡可跑,适合本地部署。

  1. vLLM 部署:

pip install vllm && vllm serve THUDM/glm-4-air --trust-remote-code --port 8000

  1. transformers 直连:

python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; m=AutoModelForCausalLM.from_pretrained('THUDM/glm-4-air', trust_remote_code=True, torch_dtype='float16').cuda(); t=AutoTokenizer.from_pretrained('THUDM/glm-4-air', trust_remote_code=True); print(t.decode(m.generate(t('你好', return_tensors='pt').to('cuda'), max_new_tokens=64)[0], skip_special_tokens=True))"

  1. 低显存用 4bit 量化加载。

Tips:Air 版比 9B 更省显存,性能接近,适合轻量业务;Ollama 也有 glm4 标签可用。

💡 使用小技巧

消费级显卡可跑。

❓ 常见问题 FAQ

Q1:GLM-4-Air 特点?\nA1:轻量高效中文。

访问备注与注意事项