HuggingFace TGI TGI 3.x
Text Generation Inference系列 · HuggingFace · 2023-01发布
模型介绍
HF 官方文本生成推理服务器,生产级大模型部署,支持量化、批处理与流式输出,OpenAI 兼容 API。
模型基础信息
免费额度与收费政策
免费规则详情
Apache-2.0 免费自托管。
收费标准简介
完全免费(自托管)。
模型能力介绍
✅ 核心优势
- 生产级
- 流式输出
- 量化与批处理
- HF 生态
⚠️ 短板与局限
- 配置较复�
- 资源要求高
- 新手上手难
🎯 适用场景
- 生产推理
- PI 服务
- 企业部署
- 量化加速
模型使用教程
本章节整理 HuggingFace TGI 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 本地工具,安装后即可使用。
- 支持对接主流模型与本地推理引擎。
启动服务后按提示操作即可。
export HF_ENDPOINT=https://hf-mirror.com
模型权重通过 HuggingFace 镜像或 ModelScope 下载。
提供 HTTP API:
curl http://localhost:PORT/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"default","messages":[{"role":"user","content":"你好"}]}'
TGI(Text Generation Inference)是高吞吐推理服务器,支持许多开源模型,Docker 一条命令部署。
- Docker 部署(示例 Llama 3.1):
docker run --gpus all -p 8080:80 ghcr.io/huggingface/text-generation-inference:latest --model-id meta-llama/Llama-3.1-8B-Instruct
- 调用 OpenAI 兼容接口:
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"meta-llama/Llama-3.1-8B-Instruct","messages":[{"role":"user","content":"你好"}]}'
Tips:国内下载权重先 export HF_ENDPOINT=https://hf-mirror.com;支持量化加速与批处理。
💡 使用小技巧
docker run 一行启动。
❓ 常见问题 FAQ
Q1:TGI 是干嘛的?\nA1:生产级推理服务器。
访问备注与注意事项
- Docker 部署友好
Aitishiku.com