Hugging Face 社区发布文本到图像生成开放偏好数据集
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。
Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,每种均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。
推荐理由:PaliGemma 2 给出 3B 到 28B 三种规模与三种分辨率组合,读者可据此判断视觉语言模型的微调选型空间。
Hugging Face 发布面向阿拉伯语 LLM 的生成式任务基准与榜单 AraGen,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度由 LLM-as-judge 打分。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 与 Argilla,用 Llama 3.1 生成标注并经人工复核,再微调小模型完成金融新闻的命名实体识别。
Hugging Face 发布开源开发者指南,解读已正式生效的欧盟《人工智能法案》。该法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接约束,训练算力超 10^25 FLOPs 的模型需按系统性风险处理。指南建议开发者提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具以准备合规。
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。
推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式测试。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译,旨在为日语 LLM 提供集中、开放的比较平台。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 评审模型的评分和理由进行投票对比的平台,结果汇总为按 Elo 分数每小时更新的公开榜单。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Hugging Face 与 PyCharm 完成集成,开发者可在 IDE 内右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接在 UI 中从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开 Hub 数据集,默认部署启用 Hugging Face OAuth,方便社区或团队协作标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,仍保留 Python SDK 供进一步定制。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评测体系,用于衡量 RAG 回答的质量。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:Google DeepMind 与 Hugging Face 把文本水印做成 Transformers 里的生成配置,读者可据此了解其接入方式与检测流程。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼方法进行改进。CinePile 初版于 2024 年 5 月推出,包含约 30 万训练样本和 5000 测试样本,人类在该基准上比最好的商业视觉模型高 25%、比开源模型高 65%。CinePile 2.0 与 Hugging Face 合作完成,同时开源了对抗式精炼方法的实现。
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、LM、TTS 级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可用 auto 标志自动检测语言。
Hugging Face 宣布与 Protect AI 合作,将后者的 Guardian 扫描器集成进 Hub 的扫描套件,所有公开模型仓库在推送文件后会自动被扫描。Guardian 可检测 pickle 任意代码执行及 Keras Lambda 层等漏洞,前端也新增了扫描结果展示。目前已有超过 100 万个模型仓库、数亿个文件被扫描。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,并引入 fp32、fp16、q8、q4 等 dtype 量化选项。
推荐理由:官方给出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。
Keras 已支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 Llama-3.2-1B-Instruct,无需等待转换,必要时在加载时即时完成。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积时,token 级任务(如 causal LM)的损失按各批次损失取平均,而非按全部非 padding token 总数加权,导致与全批量训练结果不一致。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
AMD 发布基于 Zen5 架构的第五代服务器级 EPYC CPU(代号 Turin),最高 192 核 384 线程。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
Hugging Face 与 Dask 结合,可将 TB 级数据集处理从本地 pandas 扩展到云端多 GPU 并行推理。示例用 FineWeb-Edu 分类器处理 FineWeb 数据集,从本地 100 行扩展到 2.11 亿行、432 GB 的 250 个 Parquet 文件,并支持多节点 GPU 推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。
Hugging Face 发布 Open FinLLM Leaderboard,专门评测大语言模型在金融任务上的表现,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类。该榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集聚焦真实金融场景,如信用评分、欺诈检测和股价走势预测。
Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并手工设计至少 5 组提示词以记录最佳表现与方差。
Hugging Face 发布教程,介绍如何将 InstantMesh 等生成式 3D 模型输出的顶点着色网格转换为 UV 贴图纹理网格,并提供 InstantTexture 库实现一键转换。该库通过 xatlas 生成 UV 映射,结合重心坐标插值填充纹理,再用修复、中值滤波、高斯模糊和 LANCZOS 降采样消除空洞与噪点,最终输出 .glb 网格。
Meta 发布 Llama 3.2,共 10 个开放权重模型,包括 5 个多模态模型和 5 个纯文本模型,均已上线 Hugging Face。多模态的 Llama 3.2 Vision 提供 11B 和 90B 两个尺寸,另有可在设备端运行的 1B 和 3B 文本模型,支持 128k 上下文和 8 种语言。
推荐理由:Hugging Face 与 Meta 合作发布 Llama 3.2,给出多模态与端侧小模型的能力、许可限制和上手方式。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、共 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤,并用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
Hugging Face 的 Daily Papers 页面已收录超 3,700 篇论文、订阅者超 12k,作者可一键认领论文并关联到自己的账号。用户还能提交论文、在评论区与作者直接对话,并用 @librarian-bot 获取相似论文推荐。页面支持多语言评论与翻译,并可将论文关联的模型、数据集和 demo 集中展示。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。