Hugging Face 与 Argilla 回顾 Data Is Better Together 计划并公布后续方向
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 多人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 多人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Prezi 加入 Hugging Face Expert Support Program,将更小更高效的开源模型整合进其 ML 工作流。其旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM 生成演示文稿,专家建议在检索流程中加入开源 re-ranker 模型,比 LLM 更便宜、更快、更好地匹配图文素材。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均含 5.6 个测试用例、分支覆盖率 99%。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布并接入 Diffusers。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。
Hugging Face 宣布将重新设计 Transformers 文档,以解决内容割裂、导航困难和过时的问题。新文档将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的方式,并用灵活结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Hugging Face 发布 NPC-Playground,一个可在浏览器中与 LLM 驱动的 NPC 互动的 3D 演示,由 Cubzh 与 Gigax 联合打造。
Hugging Face 将 assisted generation(基于 Speculative Sampling 的加速解码方法)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法用草稿模型生成 K 个 token 再由目标模型评估,对大 Transformer 模型通常可带来约 2x 加速,且采样质量与自回归采样相当。
Mistral AI 发布首款代码模型 Codestral,这是一个 22B 开放权重生成式模型,训练数据覆盖 80+ 编程语言,上下文窗口 32k,可通过指令与补全 API 端点使用。
推荐理由:Mistral 首款代码模型给出 22B 开放权重、32k 上下文和 80+ 语言支持,可对照其与既有代码模型的定位差异。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入模型以提升特定任务表现,也可从零训练新模型。
TII 发布 Falcon 2 系列首批模型,包括 11B 基座语言模型和 11B 视觉语言模型(VLM),后者在 LLM 基础上接入 CLIP ViT-L/14 视觉编码器,支持图像问答。
推荐理由:官方给出 Falcon 2 11B 的架构、训练数据与多语言评测,可对照同尺寸开源模型判断其定位。
Hugging Face 宣布用户可从 Hub 直接部署模型到 AWS Inferentia2,覆盖超 10 万个公开模型,新增 albert、bert、roberta、vit 等 14 种模型架构和 text-classification、text-generation 等 6 类任务。
Hugging Face 宣布 AMD Instinct MI300 已在其平台实现一等公民级集成,transformers 和 text-generation-inference 无需改代码即可在 Azure ND MI300x V5 上运行。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源大模型加入 Azure 模型目录的 Hugging Face Collection,支持从 Azure AI Studio 一键部署。
Hugging Face Spaces 上线 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地改动。该功能目前处于 beta 阶段,仅向 PRO 订阅用户开放,改完代码可在 Space 内直接刷新测试,满意后再 commit 和 merge 持久化。
Hugging Face 与 Dell 推出 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署 Llama 3、Mixtral、Gemma 等开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过将键值缓存压缩为低精度格式降低长上下文生成的内存占用,且对生成质量影响极小。
Hugging Face 与 LangChain 联合发布合作包 langchain_huggingface,这是一个由双方共同维护的 Python 包,用于将 Hugging Face 最新能力接入 LangChain 并保持同步更新。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调流程,读者可据此判断它适合哪些视觉语言任务。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),用于评测和对比阿拉伯语大语言模型性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之外新增两类可基于历史观察迭代的 agent,并加入共享功能。
推荐理由:官方给出 Agents 2.0 的模块划分与 GAIA 榜单成绩,可据此判断开源智能体框架的可用边界。
Hugging Face 现已支持通过 AWS 账户将组织升级至 Enterprise Hub,订阅入口为 AWS Marketplace,定价与 Hugging Face 公开价格一致,但账单由 AWS 账户结算。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Hugging Face 发布希伯来语 LLM 开放排行榜,用于评估和提升希伯来语语言模型。该排行榜包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式,模型通过 HuggingFace Inference Endpoints 部署、由 lighteval 库评估。
Artificial Analysis 将其覆盖 100 多个 serverless LLM API 端点的 LLM 性能排行榜带到 Hugging Face,综合对比模型的质量、价格、吞吐与延迟。
Hugging Face 通过自定义 inference handler,在 Inference Endpoints 上将 Whisper 的 ASR、基于 Pyannote 的说话人分离(diarization)与推测解码整合到单一 API 端点。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在两种格式下准确率分别为 22.9% 和 51.2%,且模型排名也会随格式变化。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码 LLM,用 StarCoder2-15B 自生成指令-响应对微调自身,无需人工标注或 GPT-4 蒸馏数据。
推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,读者可据此了解不依赖 GPT-4 蒸馏的代码模型训练路径。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无思维链提示时的准确率增益 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,目前实现 Classic 和 Reflect 两种思维链生成策略,Mixtral-8x7B-Instruct-v0.1 已参与测试。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸的 base 与 instruct 版本,并同步发布基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Hugging Face 上线 LiveCodeBench 排行榜,该基准由 UC Berkeley、MIT 和 Cornell 研究者开发,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
Gradio 推出 reload mode,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Ryght 正式公开发布面向生命科学知识工作者的生成式 AI 平台 Ryght Preview,免费且安全。