Hugging Face TRL 库新增 VLM 直接偏好优化(DPO)支持
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并给出完整训练教程。示例使用 Idefics2-8b 模型和 openbmb/RLAIF-V-Dataset(含超 83,000 条标注数据),TRL 的 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并给出完整训练教程。示例使用 Idefics2-8b 模型和 openbmb/RLAIF-V-Dataset(含超 83,000 条标注数据),TRL 的 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Hugging Face 用户现可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Banque des Territoires(CDC 集团)、Polyconseil 与 Hugging Face 合作,为法国校园环保改造项目 EduRénov 构建基于 RAG 的主权数据方案,第一阶段已完成。
Hugging Face 为 Dataset Hub 的数据集搜索新增四项筛选功能:按模态(文本、图像、音频、表格、时间序列、3D、视频、地理空间)、按行数大小、按格式(如 Parquet、WebDataset)以及按兼容库(如 Pandas、Dask、Datasets)搜索。
Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个规模,各有基础版与指令微调版,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:文章梳理了 Gemma 2 的滑动窗口注意力、软上限与蒸馏等训练改动,并给出与 Llama 3、Qwen 1.5 的基准对比。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 多人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布并接入 Diffusers。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 宣布将重新设计 Transformers 文档,以解决内容割裂、导航困难和过时的问题。新文档将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的方式,并用灵活结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三种微调入口:开源微调代码库 mistral-finetune、平台上的 serverless 微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此判断自建与托管两条路径的成本差异。
Hugging Face 发布 NPC-Playground,一个可在浏览器中与 LLM 驱动的 NPC 互动的 3D 演示,由 Cubzh 与 Gigax 联合打造。
Mistral AI 发布首款代码模型 Codestral,这是一个 22B 开放权重生成式模型,训练数据覆盖 80+ 编程语言,上下文窗口 32k,可通过指令与补全 API 端点使用。
推荐理由:Mistral 首款代码模型给出 22B 开放权重、32k 上下文和 80+ 语言支持,可对照其与既有代码模型的定位差异。
Mistral AI 发布非生产许可证 MNPL,允许开发者将技术用于非商业用途并支持研究工作,Codestral 于同日在该许可证下发布。Mistral 表示会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。该许可证要求基于其成果开展商业业务的开发者以公平可持续的方式与各方合作。
推荐理由:Mistral 推出非生产许可证,读者可据此理解开源模型商业授权收紧对开发者使用边界的影响。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入模型以提升特定任务表现,也可从零训练新模型。
TII 发布 Falcon 2 系列首批模型,包括 11B 基座语言模型和 11B 视觉语言模型(VLM),后者在 LLM 基础上接入 CLIP ViT-L/14 视觉编码器,支持图像问答。
推荐理由:官方给出 Falcon 2 11B 的架构、训练数据与多语言评测,可对照同尺寸开源模型判断其定位。
Hugging Face 宣布用户可从 Hub 直接部署模型到 AWS Inferentia2,覆盖超 10 万个公开模型,新增 albert、bert、roberta、vit 等 14 种模型架构和 text-classification、text-generation 等 6 类任务。
Hugging Face 宣布 AMD Instinct MI300 已在其平台实现一等公民级集成,transformers 和 text-generation-inference 无需改代码即可在 Azure ND MI300x V5 上运行。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源大模型加入 Azure 模型目录的 Hugging Face Collection,支持从 Azure AI Studio 一键部署。
Hugging Face 与 Dell 推出 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署 Llama 3、Mixtral、Gemma 等开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过将键值缓存压缩为低精度格式降低长上下文生成的内存占用,且对生成质量影响极小。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调流程,读者可据此判断它适合哪些视觉语言任务。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),用于评测和对比阿拉伯语大语言模型性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之外新增两类可基于历史观察迭代的 agent,并加入共享功能。
推荐理由:官方给出 Agents 2.0 的模块划分与 GAIA 榜单成绩,可据此判断开源智能体框架的可用边界。
Hugging Face 发布希伯来语 LLM 开放排行榜,用于评估和提升希伯来语语言模型。该排行榜包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式,模型通过 HuggingFace Inference Endpoints 部署、由 lighteval 库评估。
Hugging Face 通过自定义 inference handler,在 Inference Endpoints 上将 Whisper 的 ASR、基于 Pyannote 的说话人分离(diarization)与推测解码整合到单一 API 端点。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码 LLM,用 StarCoder2-15B 自生成指令-响应对微调自身,无需人工标注或 GPT-4 蒸馏数据。
推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸的 base 与 instruct 版本,并同步发布基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:官方给出 Mixtral 8x22B 的激活参数、上下文窗口与多语言、数学编码基准,便于判断其成本效率定位。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的通用多模态模型,可处理任意文本与图像序列并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步开源指令微调数据集,读者可据此判断多模态微调的门槛变化。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影与文本解码器的常见结构,并盘点 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型。
Hugging Face 推出 Deploy on Google Cloud,可将数千个开源模型通过 Vertex AI 或 GKE 部署为自有 Google Cloud 账户内的 API Endpoint。
Google 发布代码专用模型系列 CodeGemma,基于预训练的 2B 和 7B Gemma checkpoint,额外用 5000 亿 token 的英文、数学和代码数据训练,包含 2B base、7B base 和 7B instruct 三个版本,均保持 8K token 上下文。
推荐理由:Google 与 Hugging Face 联合发布三款代码专用 Gemma 模型,读者可据此了解其规格、基准表现与部署方式。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
MotherDuck 与 Numbers Station 推出 DuckDB-NSQL-7B,一个专为 DuckDB SQL 打造的大语言模型,基于 Meta Llama-2-7b 微调并进一步用 DuckDB text-to-SQL 数据对精调,可生成包括官方文档和扩展在内的多种有效 DuckDB SQL 语句。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。该量化基于 Intel Neural Compressor,只需约 100 条无标注校准样本、无需训练,即可在保持精度的同时降低内存占用与延迟,Optimum Intel 版本需不低于 1.14.0。
Hugging Face 与 Cloudflare 合作推出 Deploy on Cloudflare Workers AI,让开发者以无服务器 API 方式调用 Hugging Face 上的开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 和 Text Generation Inference 提供支持,按请求付费。
Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。
推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。