Hugging Face Blog·· 2024-06-24AI 评分38
微调 Florence-2:微软的前沿视觉语言模型
Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models
AI 导读
Hugging Face 博客展示了如何微调微软 6 月发布的 Florence-2 视觉语言模型,使其具备 DocVQA 视觉问答能力。该模型有 0.2B 和 0.7B 两个小尺寸版本,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。
来源:Hugging Face Blog · huggingface.co