用 KVPress 掌握 LLM 长上下文:NVIDIA 的 KV Cache 压缩工具包
NVIDIA 推出 Python 工具包 KVPress,通过一系列压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
NVIDIA 推出 Python 工具包 KVPress,通过一系列压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具可用约 5 行代码通过 BitsAndBytesConfig 完成 8bit 量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后的模型还能回到 timm 使用。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1(英文检索)和 static-similarity-mrl-multilingual-v1(多语言相似度),在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此评估 CPU 端检索与相似度任务的落地成本。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练时的 GPU 显存占用。文章以 Qwen2.5-1.5B 为例拆解模型参数、优化器状态、激活值、梯度和优化器中间值各占多少显存,并给出总显存估算公式和激活值随参数量线性变化的启发式。作者还提供了一个显存估算小工具。
推荐理由:原文用可视化快照拆解训练各阶段显存占用,并给出可复用的显存估算公式与启发式。
NVIDIA 推出 LogitsProcessorZoo,一组模块化 logits 处理器,可控制序列长度、强制关键短语或引导多选题答案,并与 Hugging Face 的 generate 方法完全兼容。该库通过 pip install logits-processor-zoo 安装,示例基于 meta-llama/Llama-3.2-1B-Instruct 模型演示。
Hugging Face 在 Google Cloud 的 N2(第三代 Xeon)与 C4(第五代 Xeon)实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 与 Argilla,用 Llama 3.1 生成标注并经人工复核,再微调小模型完成金融新闻的命名实体识别。
Hugging Face 博客通过逐步迭代改进位置编码方案,最终推导出被 Llama 3.2 及多数现代 Transformer 采用的旋转位置编码(RoPE)。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评测体系,用于衡量 RAG 回答的质量。
Hugging Face 的 Speech-to-Speech(S2S)项目通过 VAD、STT、LM、TTS 级联流水线实现语音对话,支持英语、法语、西班牙语、中文、日语和韩语,可用 auto 标志自动检测语言。
Keras 已支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 Llama-3.2-1B-Instruct,无需等待转换,必要时在加载时即时完成。
Hugging Face 修复了 Transformers Trainer 中梯度累积的损失计算错误:此前开启梯度累积时,token 级任务(如 causal LM)的损失按各批次损失取平均,而非按全部非 padding token 总数加权,导致与全批量训练结果不一致。
Hugging Face 与 Dask 结合,可将 TB 级数据集处理从本地 pandas 扩展到云端多 GPU 并行推理。示例用 FineWeb-Edu 分类器处理 FineWeb 数据集,从本地 100 行扩展到 2.11 亿行、432 GB 的 250 个 Parquet 文件,并支持多节点 GPU 推理。
Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与压缩图像相当,连续多帧解码仅为压缩图像的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万公开模型、每月新增约 5 万个,但 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 这 5 项工具常被忽视。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使免 padding 的指令微调打包与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍且收敛质量不变。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上用 Text Generation Inference(TGI)和 Hugging Face 深度学习容器(DLC)部署 Meta Llama 3.1 405B。
Hugging Face 复现 Google 的 Infini-attention 实验发现,随着记忆压缩次数增加,模型性能反而持续下降。团队尝试将 Llama 3 8B 的 8k 上下文扩展至 100 万 token,但结论是 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案。训练好的 checkpoint 已公开,代码按原样提供。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 与 Albumentations AI 合作推出 TextImage 数据增强流程,可同时修改文档图像及其文本标注,用于视觉语言模型(VLM)微调。该流程支持随机插入、删除、交换和停用词替换等文本增强,并配合图像黑化与修复,保持文本质量。初始版本中的同义词替换因耗时过高已被移除。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化至 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟仅小幅上升。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:Hugging Face 团队给出把 Mistral 7B 转成 Core ML 并跑在 Mac 上的完整步骤,可据此复现端侧 LLM 部署流程。
Hugging Face 博客展示了如何用 distilabel 生成合成数据、微调领域专用嵌入模型,并为 Argilla 2.0 构建能理解技术文档的聊天机器人。流程包括将文档按约 256 token 分块、构建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并给出完整训练教程。示例使用 Idefics2-8b 模型和 openbmb/RLAIF-V-Dataset(含超 83,000 条标注数据),TRL 的 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。
Hugging Face 博客展示了如何微调微软 6 月发布的 Florence-2 视觉语言模型,使其具备 DocVQA 视觉问答能力。该模型有 0.2B 和 0.7B 两个小尺寸版本,原生支持 captioning、目标检测、OCR 等任务,但发布的模型不含 VQA 能力。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。
Hugging Face 宣布将重新设计 Transformers 文档,以解决内容割裂、导航困难和过时的问题。新文档将面向构建 AI 产品的开发者,采用代码优先、解决方案导向的方式,并用灵活结构替代 Diátaxis 的刚性框架,让内容自然生长与整合。
Hugging Face 将 assisted generation(基于 Speculative Sampling 的加速解码方法)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法用草稿模型生成 K 个 token 再由目标模型评估,对大 Transformer 模型通常可带来约 2x 加速,且采样质量与自回归采样相当。
Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。
Hugging Face 发布博客,介绍如何用 Python 库 Sentence Transformers 微调嵌入模型以提升特定任务表现,也可从零训练新模型。
Intel 展示了基于 OPEA 平台、用 Intel Gaudi 2 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,嵌入模型跑在 Granite Rapids CPU 上,LLM 跑在 Gaudi 2 上。
Hugging Face 通过自定义 inference handler,在 Inference Endpoints 上将 Whisper 的 ASR、基于 Pyannote 的说话人分离(diarization)与推测解码整合到单一 API 端点。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在两种格式下准确率分别为 22.9% 和 51.2%,且模型排名也会随格式变化。
Gradio 推出 reload mode,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。