全模态开源端侧面壁 多模态模型

MiniCPM-Octoius Octoius

MiniCPM系列 · 面壁智能(OpenBMB) · 2024-09发布

开源支持本地部署多模态国内可直连有免费额度长上下文代码专用

模型介绍

面壁开源的 MiniCPM-Octoius,首个开源全模态模型,支持文字、图像、音频、视频输入输出,端侧可跑。

模型基础信息

模型系列MiniCPM系列
开发机构面壁智能(OpenBMB)
发布时间2024-09
参数规模8B
上下文窗口64K
模型类型多模态(文本+图像+音频+视频)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

Apache-2.0 完全商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 全模态开源
  • 端侧可跑
  • 中文强
  • pache

⚠️ 短板与局限

  • 能力有限
  • 生态较新
  • 玄幻硬件需�

🎯 适用场景

  • 语音对话
  • 视频理解
  • 全模态助手
  • 端侧

模型使用教程

本章节整理 MiniCPM-Octoius 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 本地体验:ollama run minicpm-o 或 Transformers / vLLM 加载。
  • 云端:HF 托管模型可在线体验。
ollama run minicpm-o "用中文介绍一下MiniCPM-Octoius"
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download 面壁智能(OpenBMB)/MiniCPM-Octoius --local-dir ./minicpm-o

或 ModelScope 国内直连下载。

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('面壁智能(OpenBMB)/MiniCPM-Octoius')
tok = AutoTokenizer.from_pretrained('面壁智能(OpenBMB)/MiniCPM-Octoius')
code = tok.apply_chat_template([{'role':'user','content':'你好'}], tokenize=False)
print(model.generate(**tok(code, return_tensors='pt')))

MiniCPM-Octoius 是 8B 的多模态模型(文+图+音+视),端侧可跑,与 Asuna/SAE 联动做说话 Agent。

  1. transformers 加载:

pip install -U transformers soundfile omagent-core

python -c "from transformers import AutoModelForCausalLM, AutoProcessor; m=AutoModelForCausalLM.from_pretrained('openbmb/MiniCPM-o-2_6', trust_remote_code=True, torch_dtype='float16').cuda(); p=AutoProcessor.from_pretrained('openbmb/MiniCPM-o-2_6', trust_remote_code=True)"

  1. 官方 Omni-SAE / Asuna 示例提供语音对话 WebUI。
  2. ComfyUI 亦可接入(社区支持)。

Tips:8B 约 16GB 显存;端侧语音交互是特色,适合智能体原型。

💡 使用小技巧

挑战全模态开源天花板。

❓ 常见问题 FAQ

Q1:Octoius 有什么特殊?\nA1:首个端侧全模态开源。

访问备注与注意事项