多任务开源微软视觉 多模态模型

Florence-2(微软视觉) Florence-2

Florence-系列 · Microsoft · 2024-06发布

开源支持本地部署多模态国内可直连有免费额度

模型介绍

微软 Florence-2 统一视觉模型,用文本指令完成检测、分割、描述、OCR 等任务,小体积高效,MIT 商用。

模型基础信息

模型系列Florence-系列
开发机构Microsoft
发布时间2024-06
参数规模0.23B / 0.77B
上下文窗口视觉任务统一
模型类型视觉(检测/分割/描述/OCR)
中文能力良好
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

开源免费

免费规则详情

MIT 完全商用。

收费标准简介

本地零成本。

模型能力介绍

✅ 核心优势

  • 任务统�
  • 检测分割强
  • 小体积
  • MIT

⚠️ 短板与局限

  • 文本生成弱
  • 中文弱
  • 复杂场景一般

🎯 适用场景

  • 目标检测
  • 图像分割
  • OCR
  • 图像描述

模型使用教程

本章节整理 Florence-2(微软视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

上传图片/表格/文档,进行视觉问答、OCR 与图表理解。

# 多模态输入:图片 base64 + 文本问题

注册 Microsoft 账号获取 API Key。

export API_KEY=sk-xxxx
curl  -F image=@test.png -F prompt="图片里有什么?"

Florence-2 模型小(0.23B/0.77B),CPU 即可运行,非常适合本地部署。

  1. 安装依赖:pip install transformers accelerate timm
  2. 直接推理(权重 hf-mirror 可下):

python -c "from transformers import AutoProcessor, AutoModelForCausalLM; m=AutoModelForCausalLM.from_pretrained('microsoft/Florence-2-base', trust_remote_code=True); p=AutoProcessor.from_pretrained('microsoft/Florence-2-base', trust_remote_code=True); i=p(text='<CAPTION>', images=Image.open('x.jpg'), return_tensors='pt'); print(p.batch_decode(m.generate(**i), skip_special_tokens=True))"

  1. 任务切换只改 prompt 前缀:<CAPTION><OD>(检测)、<OCR><DENSE_REGION_CAPTION> 等。

Tips:base 版更轻更快,large 版精度更高;适合服务端图像自动标注/OCR。

💡 使用小技巧

单模型搞定多视觉任务。

❓ 常见问题 FAQ

Q1:Florence-2 特点?\nA1:统一视觉指令模型。

访问备注与注意事项