Hugging Face 与 LLM-jp 联合推出日语 LLM 开放排行榜
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式测试。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译,旨在为日语 LLM 提供集中、开放的比较平台。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式测试。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译,旨在为日语 LLM 提供集中、开放的比较平台。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开源权重多模态模型,由 123B 多模态解码器和 1B 参数视觉编码器组成,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 在 MathVista、DocVQA 等基准上的对比数据,可据此判断开源多模态模型的当前水平。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Hugging Face 与 PyCharm 完成集成,开发者可在 IDE 内右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接在 UI 中从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开 Hub 数据集,默认部署启用 Hugging Face OAuth,方便社区或团队协作标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,仍保留 Python SDK 供进一步定制。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:Google DeepMind 与 Hugging Face 把文本水印做成 Transformers 里的生成配置,读者可据此了解其接入方式与检测流程。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。
Hugging Face 宣布与 Protect AI 合作,将后者的 Guardian 扫描器集成进 Hub 的扫描套件,所有公开模型仓库在推送文件后会自动被扫描。Guardian 可检测 pickle 任意代码执行及 Keras Lambda 层等漏洞,前端也新增了扫描结果展示。目前已有超过 100 万个模型仓库、数亿个文件被扫描。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。
Keras 已支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 Llama-3.2-1B-Instruct,无需等待转换,必要时在加载时即时完成。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积时,token 级任务(如 causal LM)的损失按各批次损失取平均,而非按全部非 padding token 总数加权,导致与全批量训练结果不一致。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。
非凡研究 6 月报告显示,全球 1500 家活跃 AI 公司中有 751 家位于中国,其中 103 家已在拓展海外市场。华为、腾讯、阿里聚焦云计算与 AI 基础设施,字节跳动七个月内推出 11 款海外应用,CapCut 月活超 3 亿、截至 2024 年 7 月累计移动端收入 1.25 亿美元。
Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并手工设计至少 5 组提示词以记录最佳表现与方差。
Meta 发布 Llama 3.2,共 10 个开放权重模型,包括 5 个多模态模型和 5 个纯文本模型,均已上线 Hugging Face。多模态的 Llama 3.2 Vision 提供 11B 和 90B 两个尺寸,另有可在设备端运行的 1B 和 3B 文本模型,支持 128k 上下文和 8 种语言。
推荐理由:Hugging Face 与 Meta 合作发布 Llama 3.2,给出多模态与端侧小模型的能力、许可限制和上手方式。
Hugging Face 的 Daily Papers 页面已收录超 3,700 篇论文、订阅者超 12k,作者可一键认领论文并关联到自己的账号。用户还能提交论文、在评论区与作者直接对话,并用 @librarian-bot 获取相似论文推荐。页面支持多语言评论与翻译,并可将论文关联的模型、数据集和 demo 集中展示。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 和 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,可据此判断其 API 成本与部署选择。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,128k token 上下文窗口内可处理任意数量图片。
推荐理由:官方给出架构、评测口径与本地部署方式,可据此判断这一 12B 多模态模型在开源阵营中的位置。
HuggingChat 发布 Community Tools,用户可把 Hugging Face 上任意公开 Space 转成模型可直接调用的工具,并借此扩展了图像理解、视频生成和文本转语音等多模态能力。
推荐理由:HuggingChat 把任意 Space 变成可调用工具,读者可据此判断多模态与自定义工具如何接入对话流程。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与压缩图像相当,连续多帧解码仅为压缩图像的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万公开模型、每月新增约 5 万个,但 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 这 5 项工具常被忽视。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使免 padding 的指令微调打包与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍且收敛质量不变。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
阿布扎比 TII 发布 Falcon Mamba 7B,采用纯 Mamba 架构并加入额外 RMS 归一化层以保证大规模训练稳定,模型以 TII Falcon Mamba 7B License 1.0 开放,可在 Hugging Face 生态中使用。
推荐理由:TII 发布首个纯 Mamba 架构的 7B 开源模型,读者可据此了解无注意力架构在长序列上的取舍。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,无需或只需极少模型专属改动。
推荐理由:Hugging Face 把工具调用统一进 chat template,读者可据此判断跨模型复用同一套代码的可行边界。
Hugging Face 宣布收购西雅图公司 XetHub,其创始团队此前在 Apple 构建并扩展内部 ML 基础设施,XetHub 的技术可让 Git 扩展到 TB 级仓库。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、GPG commit signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化恶意软件、pickle 与密钥扫描。
Meta 发布 Llama 3.1,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,全部支持 128K token 上下文和 8 种语言,并新增 Llama Guard 3 与 Prompt Guard 两个安全模型。
推荐理由:Hugging Face 官方给出 Llama 3.1 三个尺寸的显存需求、量化方案与工具调用格式,便于评估部署成本。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,预训练基座与指令微调 checkpoint 均以 Apache 2.0 许可开源。
推荐理由:Mistral 与 NVIDIA 合作的 12B 模型以 Apache 2.0 开源,128k 上下文和 FP8 推理对部署选型有直接参考。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Mistral AI 发布 Codestral Mamba,这是继 Mixtral 系列之后对 Mamba 架构的又一次探索,采用 Apache 2.0 许可,可自由使用、修改和分发。
推荐理由:Mistral 发布基于 Mamba 架构的代码模型,给出参数规模、256k 检索测试与多种部署方式,可据此判断非 Transformer 架构在代码场景的可用性。
Hugging Face 博客展示了如何用 distilabel 生成合成数据、微调领域专用嵌入模型,并为 Argilla 2.0 构建能理解技术文档的聊天机器人。流程包括将文档按约 256 token 分块、构建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。
推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。
Hugging Face 与 KerasHub 宣布共享模型保存格式,Hugging Face Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub。首批支持 Gemma 1/2、Llama 3 和 PaliGemma,模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换。需升级 keras-hub 及 keras>=3.3.3。