LAVE:用 LLM 在 Docmatix 上做零样本 VQA 评测,我们还需要微调吗?
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现,LAVE 得分 0.58,而 CIDER 仅 0.1411、BLEU 0.0032、ANLS 0.002。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现,LAVE 得分 0.58,而 CIDER 仅 0.1411、BLEU 0.0032、ANLS 0.002。
Mistral AI 发布新一代 Mistral Large 2,拥有 128k 上下文窗口和 123B 参数,可在单节点上以较大吞吐运行,支持包括中文、日文、韩文在内的数十种语言和 80 多种编程语言。
推荐理由:官方给出 Mistral Large 2 的 128k 上下文、123B 参数与多项基准对比,可据此判断其单节点部署的成本位置。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并给出完整训练教程。示例使用 Idefics2-8b 模型和 openbmb/RLAIF-V-Dataset(含超 83,000 条标注数据),TRL 的 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 博客展示了如何微调微软 6 月发布的 Florence-2 视觉语言模型,使其具备 DocVQA 视觉问答能力。该模型有 0.2B 和 0.7B 两个小尺寸版本,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。
Prezi 加入 Hugging Face Expert Support Program,将更小更高效的开源模型整合进其 ML 工作流。其旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM 生成演示文稿,专家建议在检索流程中加入开源 re-ranker 模型,比 LLM 更便宜、更快、更好地匹配图文素材。
Color Health 与 OpenAI 合作推出 Cancer Copilot,利用 GPT-4o 识别缺失的诊断项目并生成个性化检查方案,帮助医疗人员就癌症筛查和治疗做出循证决策,从而加速癌症患者获得治疗。
TII 发布 Falcon 2 系列首批模型,包括 11B 基座语言模型和 11B 视觉语言模型(VLM),后者在 LLM 基础上接入 CLIP ViT-L/14 视觉编码器,支持图像问答。
推荐理由:官方给出 Falcon 2 11B 的架构、训练数据与多语言评测,可对照同尺寸开源模型判断其定位。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。
推荐理由:OpenAI 官方发布新旗舰模型,读者可据此了解其在音频、视觉与文本上的实时推理定位。
OpenAI 发布 GPT-4o,并在 ChatGPT 中免费开放更多能力。
推荐理由:OpenAI 发布 GPT-4o 并扩大 ChatGPT 免费能力,读者可据此了解模型与产品开放策略的同步变化。
OpenAI 发布最新旗舰模型 GPT-4o,同时为 ChatGPT 免费用户开放更多能力。官方称这是其最新旗舰模型,免费用户将获得更多工具。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并首次把更多能力开放给 ChatGPT 免费用户。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的通用多模态模型,可处理任意文本与图像序列并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,读者可据此判断多模态微调的门槛变化。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影与文本解码器的常见结构,并盘点 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,通过组合 OWL-ViT、Mobile Sam 和 RAM 等模型输出物体的 (x, y, z) 坐标,无需训练即可开箱使用。
Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。
加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。
OpenAI 发布研究,探索在视频数据上大规模训练生成模型,联合在可变时长、分辨率和宽高比的视频与图像上训练文本条件扩散模型,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果表明扩展视频生成模型是构建通用物理世界模拟器的一条有前景的路径。
推荐理由:OpenAI 首次公开 Sora 的技术路线,说明视频生成模型可扩展为物理世界模拟器。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。
推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。
Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。
推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速、相比 H100 实现 1.4 倍加速。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在许多真实场景中能力不及人类,但在多项专业和学术基准上达到人类水平。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解这一代模型的能力边界。
Be My Eyes 借助 GPT-4 改造视觉无障碍体验。该应用利用 GPT-4 为视障用户提供视觉辅助能力。
GPT-4 被用于 Duolingo,以填补关键的语言学习空白。OpenAI 与 Duolingo 深化对话,将 GPT-4 引入语言学习场景。
OpenAI 发布 GPT-4,可生成、编辑并与用户迭代完成创意与技术写作任务,例如创作歌曲、撰写剧本,或学习用户的写作风格。
推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑与迭代能力。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验这些最新进展。
Hugging Face 公布其计算机视觉生态现状:Hub 上已支持 8 项核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖 ViT、Swin、DETR 等 Transformer 架构以及 ConvNeXt、ResNet、RegNet 等卷积架构。
Hugging Face 博客"AI for Game Development"系列第 3 天聚焦 3D 资产生成,结论是 text-to-3D 目前还无法实际用于游戏开发。文章梳理了 DreamFusion、Point-E、CLIP-NeRF 等近期方案,指出它们多基于 NeRF 视图合成,生成的 mesh 需大量人工后处理才能达到游戏可用标准。作者因此在本作中改用不同颜色的立方体代表农作物。
Hugging Face 与百度 PaddlePaddle 达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub,目前已有超 75 个模型上线,包括 UIE、ERNIE 3.0、Ernie-Layout 等。
OpenAI 发布 Point-E,一个可根据复杂提示词生成 3D 点云的系统。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。
Hugging Face 为 🤗 Datasets 补充了音频和图像数据集的文档,Quickstart 新增端到端加载与处理示例,并引入 to_tf_dataset 函数,可将数据集转换为 tf.data.Dataset 供 TensorFlow 或 Keras 训练。
Hugging Face 在 Transformers 库中加入 Perceiver IO,这是首个可处理文本、图像、音频、视频、点云等多种模态及其组合的 Transformer 类模型。
推荐理由:Hugging Face 把 Perceiver IO 集成进 Transformers,读者可了解其跨模态架构与各模态实现细节。
一个跨 12 个时区的团队用 RSICD、UCM 和 Sydney 三个遥感数据集微调了 OpenAI 的 CLIP,让模型支持用文本查询检索卫星图像。RSICD 约含 10,000 张来自 Google Earth、百度地图等的图像,每张最多 5 条描述;训练采用对比学习,并用图像增强与 Marian MT 回译文本增强抑制过拟合。模型已开放下载,并提供在线 demo。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以文字、符号还是概念形式呈现,这些神经元都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的概念视觉变体,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。
推荐理由:OpenAI 在 CLIP 中发现对同一概念的多模态神经元,为理解其分类准确性与习得偏见提供线索。