在 Hugging Face Endpoints 上运行隐私保护推理
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影与文本解码器的常见结构,并盘点 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型。
MotherDuck 与 Numbers Station 推出 DuckDB-NSQL-7B,一个专为 DuckDB SQL 打造的大语言模型,基于 Meta Llama-2-7b 微调并进一步用 DuckDB text-to-SQL 数据对精调,可生成包括官方文档和扩展在内的多种有效 DuckDB SQL 语句。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。该量化基于 Intel Neural Compressor,只需约 100 条无标注校准样本、无需训练,即可在保持精度的同时降低内存占用与延迟,Optimum Intel 版本需不低于 1.14.0。
Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。
推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。
Hugging Face 发布面向非技术读者的 Transformers 入门指南,从零讲解这一开源 Python 库如何调用数千个预训练 Transformer 模型,并区分了 Hub 与 Spaces 的用途。
Hugging Face 博客介绍 GaLore 优化器,通过将梯度投影到低秩子空间,可把优化器状态显存占用降低 82.5% 以上,从而在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 70 亿参数的 Llama 架构模型。
推荐理由:原文给出 GaLore 与 8-bit 优化器结合的训练流程和可运行代码,读者可据此在消费级显卡上复现大模型训练。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成本地推理。
Hugging Face 发布教程,展示如何用 Optimum Intel 与 fastRAG 在基于 Xeon 的 CPU 上加速嵌入模型并接入现有 RAG 流程。
Hugging Face 展示了如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成,只需几行代码即可完成端到端推理。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印和生成后添加水印两种主要方法,并盘点 Hub 上的相关工具。文中还提及 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案。
Hugging Face 发布 Matryoshka 嵌入模型入门指南,这类模型可将嵌入截断到多种维度而性能损失不大,灵感来自俄罗斯套娃。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行 LoRA 微调。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的合并方法,包括 cat、linear、svd、TIES、DARE 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
推荐理由:PEFT 新增多种 LoRA 合并方法并给出选型顺序,读者可据此判断不同适配器组合该用哪种策略。
Hugging Face 博客给出用开源 LLM 生成合成数据、再蒸馏出专用小模型的完整流程,并以金融新闻投资者情绪识别为案例。
推荐理由:用开源 LLM 生成合成数据再蒸馏小模型的完整流程,附可复用 notebook 与成本、延迟、碳排放对比。
Hugging Face 博客给出 PatchTST 的上手示例,先在 Electricity 数据集上做预测,再用预训练模型对 ETTh1 数据集做零样本预测,随后进行线性探测与微调。PatchTST 由 Yuqi Nie 等人提出、发表于 ICLR 2023,通过将时间序列切分为 patch 作为输入 token,并采用通道独立设计,在保留局部语义的同时二次方降低注意力计算与内存开销。
Hugging Face 发布了一套用开源模型实现 Constitutional AI 的端到端配方,并开源了 llm-swarm 工具,用于在 Slurm 集群上基于 TGI 和 vLLM 做可扩展的合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可迁移到自定义对齐流程。
Hugging Face 在 Intel 第四代 Xeon 上通过 8bit/4bit 量化结合辅助生成,让 StarCoder-15B 推理加速超过 7 倍。
Hugging Face 发布博客,介绍如何用新集成的 ChatHuggingFace 在 LangChain 中把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,读者可据此判断哪些模型适合驱动智能体工作流。
Hugging Face 发布教程,演示如何用 🤗 Transformers 将 facebook/w2v-bert-2.0 微调至低资源 ASR 任务。
Hugging Face 在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个 7B 模型上,用 MT-Bench 对比了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法,并扫描 β 等关键超参数。结果显示其中一种方法明显优于其他两种,但需调好关键超参数才能达到最佳效果;相关代码已在 alignment-handbook 开源。
Hugging Face 发布经 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime CUDA 与 TensorRT 执行提供程序加速推理,吞吐量最高较 PyTorch 提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 官方博客给出教程,把 ComfyUI 工作流转成 Gradio 应用并部署到 Spaces 的 ZeroGPU 上免费运行。
推荐理由:完整给出从 ComfyUI 工作流导出 Python、包成 Gradio 应用并部署到 ZeroGPU 的步骤,可照着复现。
Vectara 基于 Hugging Face 开源的排行榜模板,搭建了全新的 HHEM 幻觉评测排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜支持动态提交新模型评测请求并自动更新结果,相关源码已公开在其 Hugging Face Space 仓库中。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
Hugging Face 发布新的 diffusers 训练脚本,把 Pivotal Tuning 与 Prodigy 优化器结合,用于 SDXL 的 Dreambooth LoRA 微调。
推荐理由:汇总社区 SDXL Dreambooth LoRA 微调的 SOTA 实践,并给出可直接运行的 diffusers 训练脚本与参数。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,同时保证输出与单独使用主模型完全一致。
推荐理由:给出 Whisper 投机解码的完整实现与基准数据,读者可据此在现有管线中获得约 2 倍加速且输出不变。
Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。
推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。
Hugging Face 在 Hub 的 Inference API 中实现 LoRA 动态加载,保持基础模型常驻、按请求即时加载和卸载 LoRA 适配器,把冷启动时间从 25s 降到 3s,用户请求响应时间从 35s 降到 13s。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文二分类任务上评测性能。实验统一设置 MAX_LEN=512,在单张 A6000(48GB)上完成训练,并使用 Weights & Biases 做超参数调优与实验记录。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 作为演示模型。
Hugging Face 博客介绍如何基于 huggingface GitHub 组织公开仓库的代码,微调出名为 HugCoder 的代码补全模型。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,以及本地部署路径,可迁移到自有代码库。
Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可交互式可视化数据集。它支持加载模型预测与嵌入向量,通过相似度图、混淆矩阵等定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查布局。
Hugging Face 博客复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化时显存占用 28GB、延迟 72.2 秒,使用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 各项推理优化的实测数据,读者可据此按显存和延迟取舍配置。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
Hugging Face Diffusers 现已支持在 Cloud TPU v5e 上通过 JAX 运行 Stable Diffusion XL 推理。该方案借助 JAX 的 jit 编译与 XLA 并行能力,在多个 TPU v5e-4 实例上约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3s。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。