分布式开源本地部署集群 本地部署模型
Exo(分布式推理) v0.18
Exo系列 · Exo Labs(开源社区) · 2024-07发布
模型介绍
把家里多台闲置设备(笔记本/树莓派)组成分布式推理集群来跑大模型,无需高端显卡即可本地部署 70B+ 模型,创新玩法备受关注。
模型基础信息
模型系列Exo系列
开发机构Exo Labs(开源社区)
发布时间2024-07
参数规模框架(无固定参数)
上下文窗口分布式大模型推理
模型类型分布式推理框架
中文能力待评估
使用方式网页体验 / API调用 / 本地部署
免费额度与收费政策
完全免费开源
免费规则详情
开源免费。
收费标准简介
完全免费;复用闲置设备。
模型能力介绍
✅ 核心优势
- 多设备协作跑大模型
- 无需高端显卡
- 安装简单
- 支持主流开源模型
⚠️ 短板与局限
- 分布式推理速度一般
- 网络稳定性影响
- 适合实验与轻度使用
🎯 适用场景
- 闲置设备再利用
- 本地大模型体验
- 分布式推理实验
- 隐私敏感场景
模型使用教程
本章节整理 Exo(分布式推理) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 每台设备安装 exo 并启动,自动发现组成集群。
- 界面(默认 GUI)选择模型温度与并发。
- 亦可命令行
exo run或 curl 调用 OpenAI 兼容接口。
pip install exo
启动后提供 OpenAI 兼容 API(默认 localhost:8000),可对接 ChatGPT-Next-Web 等:
curl http://localhost:8000/v1/chat/completions -d '{"model":"llama-3.3-70b","messages":[{"role":"user","content":"你好"}]}'
pip install exo
exo
启动后其他设备也运行 exo,同一网络自动组网;在界面选择模型(如 Llama-3.3-70B)即可。
💡 使用小技巧
多台设备同一局域网即可组网。
exo run 一键启动。
❓ 常见问题 FAQ
Q1:Exo 能跑多大模型?
A1:多设备聚合后可跑 70B+(视设备总内存)。
Q2:要特殊硬件吗?
A2:不需要 GPU,普通设备即可。
访问备注与注意事项
- 实验性项目迭代快
- 中文资料较少
Aitishiku.com