跳到正文
原文
Hugging Face Blog·· 2025-04-11AI 评分36

Visual Salamandra 发布:将 7B 多模态理解扩展至图像与视频

Visual Salamandra: Pushing the Boundaries of Multimodal Understanding

AI 导读

Language Technologies Lab 发布 Visual Salamandra,将 Salamandra 大语言模型扩展至图像和视频,基于 7B 基础模型,集成 Google SigLIP-So400m 编码器与 2 层 MLP projector,采用四阶段训练和 late-fusion 架构。

来源:Hugging Face Blog · huggingface.co