Qwen3 3
Qwen系列 · 阿里巴巴通义千问 · 2025-04发布
模型介绍
阿里通义千问的第三代开源旗舰,引入混合推理(思考/非思考双模式)与 MoE 架构,全尺寸 0.6B 到 235B,中文与多语言能力强,Apache-2.0 可自由商用。
模型基础信息
免费额度与收费政策
免费规则详情
权重 Apache-2.0 完全免费商用;百炼云端按 token 计费,新用户有赠送额度。
收费标准简介
百炼 qwen3 系列按 token 计费(以百炼控制台价格页为准)。
模型能力介绍
✅ 核心优势
- 思考 / 非思考双模式混合推理
- MoE 架构成本效益好
- 256K 长上下文
- 中文开源能力第一梯队
⚠️ 短板与局限
- 235B MoE 自部署显存高
- 多模态需单独用 Qwen-VL
- 生态仍在建设
🎯 适用场景
- 开源基座与私有化部署
- 复杂推理任务
- 长文档处理
- gent 与工具调用
模型使用教程
本章节整理 Qwen3 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
Qwen3 支持「思考 / 非思考」两种模式,非思考模式响应快,思考模式推理深,可按需切换。
云端体验:通义 App / 网页版选择 Qwen3。
# 本地
ollama pull qwen3
# 或 HuggingFace
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Qwen/Qwen3-8B --local-dir ./qwen3-8b
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://dashscope.aliyuncs.com/compatible-mode/v1")
resp = client.chat.completions.create(
model="qwen3-8b",
messages=[{"role": "user", "content": "用中文介绍Qwen3"}],
)
print(resp.choices[0].message.content)
Qwen3 是阿里最新开源旗舰(0.6B~235B MoE),性能登顶开源榜,MoE 版吞吐高。
- Ollama 一键(小尺寸):
ollama pull qwen3:8b 或 ollama pull qwen3:30b
- 使用:
ollama run qwen3:8b
- MoE 生产(0.6B/4B 密集版或 30B-A3B MoE):
pip install vllm && vllm serve Qwen/Qwen3-8B --port 8000
Tips:235B-A22B 有高吞吐与低成本 MoE 优势,但需多卡;个人先上 8B/30B MoE。
💡 使用小技巧
本地轻量体验用 Qwen3-4B 或 8B。
深度推理场景开启 thinking 模式。
❓ 常见问题 FAQ
Q1:Qwen3 和 Qwen2.5 区别?
A1:Qwen3 引入混合推理与 MoE,整体能力更强。
Q2:可以商用吗?
A2:Apache-2.0,放心商用。
访问备注与注意事项
- 权重国内 ModelScope 可直连下载
- 注意区分 Instruct / Base 版本
Aitishiku.com