Keras 中的 Llama 3.2:从第一天起就可用
Keras 已支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 Llama-3.2-1B-Instruct,无需等待转换,必要时在加载时即时完成。
Keras 已支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 Llama-3.2-1B-Instruct,无需等待转换,必要时在加载时即时完成。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
AMD 发布基于 Zen5 架构的第五代服务器级 EPYC CPU(代号 Turin),最高 192 核 384 线程。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
Hugging Face 与 Dask 结合,可将 TB 级数据集处理从本地 pandas 扩展到云端多 GPU 并行推理。示例用 FineWeb-Edu 分类器处理 FineWeb 数据集,从本地 100 行扩展到 2.11 亿行、432 GB 的 250 个 Parquet 文件,并支持多节点 GPU 推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。
OpenAI 在 API 中推出提示词缓存(Prompt Caching),对模型近期已见过的输入自动提供折扣。官方说明该机制为自动生效,无需额外配置。
Mercado Libre 推出 AI 开发平台 Verdi,由 GPT-4o 驱动。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署。
Hugging Face 团队基于微软 BitNet 架构,成功将 Llama3 8B 微调到 1.58bit,每个参数只用 -1、0、1 三个值表示,模型已发布在 HF1BitLLM 组织下。
推荐理由:Hugging Face 团队公开了把已有 Llama3 8B 微调到 1.58bit 的完整流程与踩坑记录,可迁移到其他模型的极低比特量化。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face Hub 拥有超 85 万公开模型、每月新增约 5 万个,但 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 这 5 项工具常被忽视。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上用 Text Generation Inference(TGI)和 Hugging Face 深度学习容器(DLC)部署 Meta Llama 3.1 405B。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Mistral AI 宣布在 La Plateforme 上支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行定制,可通过基础提示词、few-shot 提示或微调实现,并支持自带数据集。
OpenAI 在 API 中推出结构化输出,模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,开发者可据此判断 JSON Schema 约束对下游解析流程的影响。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化至 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟仅小幅上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 上以标准化 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全与用户访问管理。
Hugging Face 与 KerasHub 宣布共享模型保存格式,Hugging Face Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub。首批支持 Gemma 1/2、Llama 3 和 PaliGemma,模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换。需升级 keras-hub 及 keras>=3.3.3。
Hugging Face 用户现可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
XLSCOUT 发布专为专利与知识产权打造的嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Prezi 加入 Hugging Face Expert Support Program,将更小更高效的开源模型整合进其 ML 工作流。其旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM 生成演示文稿,专家建议在检索流程中加入开源 re-ranker 模型,比 LLM 更便宜、更快、更好地匹配图文素材。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Mistral AI 于 2024 年 6 月 5 日至 30 日举办线上微调黑客松,参赛项目必须使用其全新微调 API。前三名各获 2500 欧元 Mistral API 额度,入选者可申请 100 美元免费额度,需在 6 月 10 日前提交表单。评审按影响力、技术实现、创意和展示各占 25% 打分,团队最多 4 人。
Hugging Face 将 assisted generation(基于 Speculative Sampling 的加速解码方法)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法用草稿模型生成 K 个 token 再由目标模型评估,对大 Transformer 模型通常可带来约 2x 加速,且采样质量与自回归采样相当。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。
Hugging Face 宣布用户可从 Hub 直接部署模型到 AWS Inferentia2,覆盖超 10 万个公开模型,新增 albert、bert、roberta、vit 等 14 种模型架构和 text-classification、text-generation 等 6 类任务。
Hugging Face 宣布 AMD Instinct MI300 已在其平台实现一等公民级集成,transformers 和 text-generation-inference 无需改代码即可在 Azure ND MI300x V5 上运行。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源大模型加入 Azure 模型目录的 Hugging Face Collection,支持从 Azure AI Studio 一键部署。
Hugging Face Spaces 上线 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地改动。该功能目前处于 beta 阶段,仅向 PRO 订阅用户开放,改完代码可在 Space 内直接刷新测试,满意后再 commit 和 merge 持久化。
Hugging Face 与 Dell 推出 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署 Llama 3、Mixtral、Gemma 等开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过将键值缓存压缩为低精度格式降低长上下文生成的内存占用,且对生成质量影响极小。
Hugging Face 现已支持通过 AWS 账户将组织升级至 Enterprise Hub,订阅入口为 AWS Marketplace,定价与 Hugging Face 公开价格一致,但账单由 AWS 账户结算。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Artificial Analysis 将其覆盖 100 多个 serverless LLM API 端点的 LLM 性能排行榜带到 Hugging Face,综合对比模型的质量、价格、吞吐与延迟。