Florence-2(微软视觉) Florence-2
Florence-系列 · Microsoft · 2024-06发布
模型介绍
微软 Florence-2 统一视觉模型,用文本指令完成检测、分割、描述、OCR 等任务,小体积高效,MIT 商用。
模型基础信息
免费额度与收费政策
免费规则详情
MIT 完全商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 任务统�
- 检测分割强
- 小体积
- MIT
⚠️ 短板与局限
- 文本生成弱
- 中文弱
- 复杂场景一般
🎯 适用场景
- 目标检测
- 图像分割
- OCR
- 图像描述
模型使用教程
本章节整理 Florence-2(微软视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
上传图片/表格/文档,进行视觉问答、OCR 与图表理解。
# 多模态输入:图片 base64 + 文本问题
注册 Microsoft 账号获取 API Key。
export API_KEY=sk-xxxx
curl -F image=@test.png -F prompt="图片里有什么?"
Florence-2 模型小(0.23B/0.77B),CPU 即可运行,非常适合本地部署。
- 安装依赖:
pip install transformers accelerate timm。 - 直接推理(权重 hf-mirror 可下):
python -c "from transformers import AutoProcessor, AutoModelForCausalLM; m=AutoModelForCausalLM.from_pretrained('microsoft/Florence-2-base', trust_remote_code=True); p=AutoProcessor.from_pretrained('microsoft/Florence-2-base', trust_remote_code=True); i=p(text='<CAPTION>', images=Image.open('x.jpg'), return_tensors='pt'); print(p.batch_decode(m.generate(**i), skip_special_tokens=True))"
- 任务切换只改 prompt 前缀:
<CAPTION>、<OD>(检测)、<OCR>、<DENSE_REGION_CAPTION>等。
Tips:base 版更轻更快,large 版精度更高;适合服务端图像自动标注/OCR。
💡 使用小技巧
单模型搞定多视觉任务。
❓ 常见问题 FAQ
Q1:Florence-2 特点?\nA1:统一视觉指令模型。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com