跳到正文

#教程/实践

今日 4 条
4月4日周五
4月3日周四
4月2日周三
  1. Hugging Face Blog38

    高效请求排队:优化 LLM 推理性能的公平调度策略

    TNG Technology Consulting 分享了自托管 LLM 服务中请求排队导致"重度用户"阻塞其他用户的问题,提出在 LLM-Server 层为每个用户和模型建立独立队列并采用轮询调度实现公平分配。由于 vLLM 不支持限制后端队列长度,方案通过抓取 vLLM /metrics 端点的 Prometheus 指标动态调节请求发送速率,将后端队列长度控制在 3 以下以降低新用户延迟。

3月31日周一
3月26日周三
3月20日周四
3月7日周五
3月4日周二
2月28日周五
2月13日周四
2月12日周三
2月4日周二
1月31日周五
1月30日周四
1月27日周一
1月23日周四
1月16日周四
12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录并可视化 PyTorch 训练时的 GPU 显存占用。文章以 Qwen2.5-1.5B 为例拆解模型参数、优化器状态、激活值、梯度和优化器中间值各占多少显存,并给出总显存估算公式和激活值随参数量线性变化的启发式。作者还提供了一个显存估算小工具。

    推荐理由:原文用可视化快照拆解训练各阶段显存占用,并给出可复用的显存估算公式与启发式。

12月23日周一
12月17日周二
12月5日周四
  1. Hugging Face Blog22

    LLM 修复自身错误的能力如何?基于 Keras 和 TPU 的聊天机器人竞技场实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。

12月3日周二
11月25日周一
11月20日周三
10月28日周一
10月22日周二
10月21日周一
10月16日周三
10月9日周三
10月8日周二
  1. Hugging Face Blog42

    Intel Labs 与 Hugging Face 推出动态推测解码,文本生成最高提速 2.7 倍

    Intel Labs 与 Hugging Face 提出动态推测解码方法,根据助手模型每次预测的置信度动态调整推测前瞻长度,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 等测试中均优于启发式方法,后者在 codegen-6B-mono 上甚至出现减速。

9月30日周一
  1. Hugging Face Blog28

    Hugging Face 教程:如何将顶点着色网格转换为 UV 贴图纹理网格

    Hugging Face 发布教程,介绍如何将 InstantMesh 等生成式 3D 模型输出的顶点着色网格转换为 UV 贴图纹理网格,并提供 InstantTexture 库实现一键转换。该库通过 xatlas 生成 UV 映射,结合重心坐标插值填充纹理,再用修复、中值滤波、高斯模糊和 LANCZOS 降采样消除空洞与噪点,最终输出 .glb 网格。

9月23日周一
  1. Hugging Face Blog22

    Hugging Face Daily Papers 页面功能全解析

    Hugging Face 的 Daily Papers 页面已收录超 3,700 篇论文、订阅者超 12k,作者可一键认领论文并关联到自己的账号。用户还能提交论文、在评论区与作者直接对话,并用 @librarian-bot 获取相似论文推荐。页面支持多语言评论与翻译,并可将论文关联的模型、数据集和 demo 集中展示。

9月20日周五
9月18日周三
8月27日周二
8月22日周四
8月19日周一
8月14日周三
  1. Hugging Face Blog34

    Hugging Face 复现 Infini-Attention 失败:压缩次数越多性能越差

    Hugging Face 复现 Google 的 Infini-attention 实验发现,随着记忆压缩次数增加,模型性能反而持续下降。团队尝试将 Llama 3 8B 的 8k 上下文扩展至 100 万 token,但结论是 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案。训练好的 checkpoint 已公开,代码按原样提供。

8月13日周二
8月6日周二
  1. Hugging Face Blog28

    Hugging Face 与 Albumentations AI 推出面向文档图像的 TextImage 数据增强

    Hugging Face 与 Albumentations AI 合作推出 TextImage 数据增强流程,可同时修改文档图像及其文本标注,用于视觉语言模型(VLM)微调。该流程支持随机插入、删除、交换和停用词替换等文本增强,并配合图像黑化与修复,保持文本质量。初始版本中的同义词替换因耗时过高已被移除。