跳到正文

#教程/实践

今日 4 条
12月3日周二
11月25日周一
11月20日周三
10月28日周一
10月22日周二
10月21日周一
10月16日周三
10月9日周三
10月8日周二
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍

    Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。

8月27日周二
8月22日周四
8月19日周一
8月14日周三
  1. Hugging Face Blog34

    Hugging Face 复现 Infini-Attention 失败:压缩次数越多性能越差

    Hugging Face 复现 Google 的 Infini-attention 实验发现,随着记忆压缩次数增加,模型性能反而持续下降。团队尝试将 Llama 3 8B 的 8k 上下文扩展至 100 万 token,但结论是 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案。训练好的 checkpoint 已公开,代码按原样提供。

8月13日周二
8月6日周二
  1. Hugging Face Blog28

    Hugging Face 与 Albumentations AI 推出面向文档图像的 TextImage 数据增强

    Hugging Face 与 Albumentations AI 合作推出 TextImage 数据增强流程,可同时修改文档图像及其文本标注,用于视觉语言模型(VLM)微调。该流程支持随机插入、删除、交换和停用词替换等文本增强,并配合图像黑化与修复,保持文本质量。初始版本中的同义词替换因耗时过高已被移除。

7月30日周二
7月22日周一
7月16日周二
  1. Hugging Face Blog22

    如何用 distilabel 打造 Argilla 2.0 聊天机器人

    Hugging Face 博客展示了如何用 distilabel 生成合成数据、微调领域专用嵌入模型,并为 Argilla 2.0 构建能理解技术文档的聊天机器人。流程包括将文档按约 256 token 分块、构建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。

7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。

7月10日周三
7月3日周三
6月24日周一
6月13日周四
6月7日周五
6月4日周二
5月29日周三
  1. Hugging Face Blog34

    Hugging Face 如何用 TGI Benchmarking 工具评测文本生成推理

    Hugging Face 发布博客介绍 Text Generation Inference(TGI)配套的 TGI Benchmarking 工具,可在 Hugging Face Space 中部署模型并通过 CLI 运行,同时测量吞吐量与延迟。该工具提供 pre-fill 统计与直方图、吞吐量对延迟散点图,并按 batch size 展示结果,帮助用户在 TTFT 与吞吐之间权衡调优部署。

5月28日周二
5月9日周四
5月1日周三
4月30日周二
4月16日周二
4月11日周四
4月4日周四
4月3日周三
  1. Hugging Face Blog36

    在 Intel Xeon 上用 🤗 Optimum Intel 实现极速 SetFit 推理

    借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化(PTQ),可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。该量化基于 Intel Neural Compressor,只需约 100 条无标注校准样本、无需训练,即可在保持精度的同时降低内存占用与延迟,Optimum Intel 版本需不低于 1.14.0。

3月22日周五
  1. Hugging Face Blog62

    Hugging Face 发布二值与标量嵌入量化方法,检索提速最高 45 倍

    Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。

    推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。

3月20日周三
  1. Hugging Face Blog62

    Hugging Face 博客介绍 GaLore:在消费级硬件上训练大模型

    Hugging Face 博客介绍 GaLore 优化器,通过将梯度投影到低秩子空间,可把优化器状态显存占用降低 82.5% 以上,从而在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 70 亿参数的 Llama 架构模型。

    推荐理由:原文给出 GaLore 与 8-bit 优化器结合的训练流程和可运行代码,读者可据此在消费级显卡上复现大模型训练。

3月15日周五