Hugging Face 发布 Accelerate 1.0.0 首个候选版本
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Hugging Face Hub 拥有超 85 万公开模型、每月新增约 5 万个,但 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 这 5 项工具常被忽视。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上用 Text Generation Inference(TGI)和 Hugging Face 深度学习容器(DLC)部署 Meta Llama 3.1 405B。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Mistral AI 宣布在 La Plateforme 上支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行定制,可通过基础提示词、few-shot 提示或微调实现,并支持自带数据集。
OpenAI 在 API 中推出结构化输出,模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,开发者可据此判断 JSON Schema 约束对下游解析流程的影响。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化至 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟仅小幅上升。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 上以标准化 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全与用户访问管理。
Hugging Face 与 KerasHub 宣布共享模型保存格式,Hugging Face Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub。首批支持 Gemma 1/2、Llama 3 和 PaliGemma,模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换。需升级 keras-hub 及 keras>=3.3.3。
Hugging Face 用户现可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
XLSCOUT 发布专为专利与知识产权打造的嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Prezi 加入 Hugging Face Expert Support Program,将更小更高效的开源模型整合进其 ML 工作流。其旗舰产品 Prezi AI 结合视觉模型、文本模型和 VLM 生成演示文稿,专家建议在检索流程中加入开源 re-ranker 模型,比 LLM 更便宜、更快、更好地匹配图文素材。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Mistral AI 于 2024 年 6 月 5 日至 30 日举办线上微调黑客松,参赛项目必须使用其全新微调 API。前三名各获 2500 欧元 Mistral API 额度,入选者可申请 100 美元免费额度,需在 6 月 10 日前提交表单。评审按影响力、技术实现、创意和展示各占 25% 打分,团队最多 4 人。
Hugging Face 将 assisted generation(基于 Speculative Sampling 的加速解码方法)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法用草稿模型生成 K 个 token 再由目标模型评估,对大 Transformer 模型通常可带来约 2x 加速,且采样质量与自回归采样相当。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。
Hugging Face 宣布用户可从 Hub 直接部署模型到 AWS Inferentia2,覆盖超 10 万个公开模型,新增 albert、bert、roberta、vit 等 14 种模型架构和 text-classification、text-generation 等 6 类任务。
Hugging Face 宣布 AMD Instinct MI300 已在其平台实现一等公民级集成,transformers 和 text-generation-inference 无需改代码即可在 Azure ND MI300x V5 上运行。
Hugging Face Spaces 上线 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space 编辑代码,无需再用 git 推送本地改动。该功能目前处于 beta 阶段,仅向 PRO 订阅用户开放,改完代码可在 Space 内直接刷新测试,满意后再 commit 和 merge 持久化。
Hugging Face 与 Dell 推出 Dell Enterprise Hub,可在 Dell 平台上本地训练和部署 Llama 3、Mixtral、Gemma 等开源模型,将原本数周的工程工作缩短至几分钟。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Artificial Analysis 将其覆盖 100 多个 serverless LLM API 端点的 LLM 性能排行榜带到 Hugging Face,综合对比模型的质量、价格、吞吐与延迟。
Hugging Face 通过自定义 inference handler,在 Inference Endpoints 上将 Whisper 的 ASR、基于 Pyannote 的说话人分离(diarization)与推测解码整合到单一 API 端点。
OpenAI 为 API 客户新增更多安全功能与控制项,并更新 Assistants API,同时提供更好地管理成本的工具。
Gradio 推出 reload mode,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Ryght 正式公开发布面向生命科学知识工作者的生成式 AI 平台 Ryght Preview,免费且安全。
Hugging Face 推出 Deploy on Google Cloud,可将数千个开源模型通过 Vertex AI 或 GKE 部署为自有 Google Cloud 账户内的 API Endpoint。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。该量化基于 Intel Neural Compressor,只需约 100 条无标注校准样本、无需训练,即可在保持精度的同时降低内存占用与延迟,Optimum Intel 版本需不低于 1.14.0。
Hugging Face 与 Cloudflare 合作推出 Deploy on Cloudflare Workers AI,让开发者以无服务器 API 方式调用 Hugging Face 上的开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 和 Text Generation Inference 提供支持,按请求付费。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,通过组合 OWL-ViT、Mobile Sam 和 RAM 等模型输出物体的 (x, y, z) 坐标,无需训练即可开箱使用。
Hugging Face 发布面向非技术读者的 Transformers 入门指南,从零讲解这一开源 Python 库如何调用数千个预训练 Transformer 模型,并区分了 Hub 与 Spaces 的用途。
JetBrains 借助 OpenAI 的 API 打造出公司史上增长最快的产品,将 AI 嵌入开发者软件。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成本地推理。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可在 Hub 内通过 AutoTrain 无代码创建训练任务,直接使用 NVIDIA DGX Cloud 的 H100 GPU。