GLM-4.6MoE开源智谱 开源模型

智谱 GLM-4.6 4.6

GLM-系列 · 智谱AI · 2025-09发布

开源支持本地部署国内可直连有免费额度长上下文代码专用

模型介绍

智谱开源 GLM-4.6,总参 355B、激活 32B 的 MoE,200K 上下文,编程、长文本、推理与智能体应用全面提升,MIT 可商用。

模型基础信息

模型系列GLM-系列
开发机构智谱AI
发布时间2025-09
参数规模355B(MoE,激活 32B)
上下文窗口200K
模型类型文本
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费 API

免费规则详情

MIT 可自由商用。

收费标准简介

本地零成本(MoE 约 40GB+)。

模型能力介绍

✅ 核心优势

  • MoE 高效
  • 200K
  • MIT 商用
  • 智能体强

⚠️ 短板与局限

  • 部署需较高显存

🎯 适用场景

  • 编码
  • gent
  • 长文本
  • 私有化

模型使用教程

本章节整理 智谱 GLM-4.6 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run glm-4-6 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run glm-4-6 "用中文介绍一下智谱 GLM-4.6"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 智谱AI/GLM-4.6 --local-dir ./glm-4-6

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('智谱AI/GLM-4.6')
tok = AutoTokenizer.from_pretrained('智谱AI/GLM-4.6')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

GLM-4.6 是智谱开源 355B 总参/32B 激活的 MoE,200K 上下文,MIT 可商用。

  1. vLLM 部署(激活 32B,两卡 48GB 级可跑):

pip install vllm && vllm serve zai-org/GLM-4.6 --tensor-parallel-size 2 --port 8000

  1. Ollama:

ollama pull glm4.6

  1. 低显存用 AWQ 4bit 量化。

Tips:MoE 激活仅 32B,量化后 2×24GB 可部署;编码与 Agent 强。

💡 使用小技巧

ollama pull glm4.6 尝试。

❓ 常见问题 FAQ

Q1:与 GLM-4-32B 区别?\nA1:能力与上下文大幅提升。

访问备注与注意事项