PaliGemma(Google 视觉) PaliGemma
PaliGemma系列 · Google · 2024-05发布
模型介绍
Google 开源 PaliGemma,基于 Gemma 的视觉语言模型,3B 轻量,支持图文问答、检测与分割,端侧友好。
模型基础信息
免费额度与收费政策
免费规则详情
Gemma 许可免费商用。
收费标准简介
本地零成本。
模型能力介绍
✅ 核心优势
- 轻量
- 检测分割
- Gemma 生态
- 端侧友好
⚠️ 短板与局限
- 中文一般
- 3B 能力有限
- 生态较新
🎯 适用场景
- 视觉问答
- 目标检测
- 图像分割
- 端侧
模型使用教程
本章节整理 PaliGemma(Google 视觉) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
上传图片/表格/文档,进行视觉问答、OCR 与图表理解。
# 多模态输入:图片 base64 + 文本问题
注册 Google 账号获取 API Key。
export API_KEY=sk-xxxx
curl -F image=@test.png -F prompt="图片里有什么?"
PaliGemma 3B 轻量,约 8GB 显存即可跑,端侧也可用。
- 安装依赖:
pip install transformers==4.44.2 torchvision(需匹配 transformers 版本)。 - 下载权重(google/paligemma-3b-mix-224,hf-mirror 可下)并推理:
python -c "from transformers import AutoProcessor, PaliGemmaForConditionalGeneration; m=PaliGemmaForConditionalGeneration.from_pretrained('google/paligemma-3b-mix-224', torch_dtype='float16').cuda(); p=AutoProcessor.from_pretrained('google/paligemma-3b-mix-224'); i=p(text='caption', images=Image.open('x.jpg'), return_tensors='pt').to('cuda'); print(p.decode(m.generate(**i, max_new_tokens=64)[0], skip_special_tokens=True))"
- 任务由 prompt 决定:caption / detect / segment / VQA 等(mix 版本已内置多任务权重)。
Tips:mix-224 通用,需更高精度可选 448 版本;CPU 也能跑只是慢。
💡 使用小技巧
轻量视觉多模态首选。
❓ 常见问题 FAQ
Q1:PaliGemma 特点?\nA1:Gemma 系轻量视觉。
访问备注与注意事项
- 权重 hf-mirror 可下
Aitishiku.com