跳到正文

全部动态

今日 7 条
7月28日周三
7月15日周四
  1. Hugging Face Blog62

    Hugging Face 提出 DeDLOC:40 名志愿者协作预训练孟加拉语模型 sahajBERT

    Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 协作式分布式训练方法,可自适应参与者的网络与硬件条件,并通过 40 名志愿者在互联网上预训练出孟加拉语模型 sahajBERT。

    推荐理由:Hugging Face 团队用 40 名志愿者在互联网上预训练出孟加拉语模型,给出了分布式协作训练在真实场景中的可行路径。

7月13日周二
7月8日周四
6月28日周一
6月10日周四
6月3日周四
5月25日周二
  1. Hugging Face Blog60

    Gradio 2.0 发布:一行代码加载并混用 Hugging Face 模型

    Gradio 2.0 发布,可用一行代码为 Hugging Face 模型加载 GUI,默认调用 Hugging Face 托管的 Inference API,也可本地运行 transformers。该版本支持把多个模型并联对比或串联组合,例如用 3 行代码搭建翻译并摘要芬兰语新闻的应用,安装方式为 pip install gradio。

    推荐理由:原文给出 Gradio 2.0 一行代码加载 Hugging Face 模型并串联、并联组合的方式,读者可据此判断搭建模型演示的成本变化。

5月10日周一
5月3日周一
4月20日周二
4月16日周五
  1. Hugging Face Blog60

    Hugging Face 发布 Accelerate 库,让原始 PyTorch 训练脚本适配分布式与混合精度

    Hugging Face 发布 Accelerate 库,面向希望完全掌控训练循环、又不愿编写分布式训练和混合精度样板代码的 PyTorch 用户。只需在标准训练脚本中加入约五行代码,即可在单机多卡、多节点、TPU 等分布式环境以及有无混合精度的情况下运行,并自动处理设备放置。

    推荐理由:官方给出五处代码改动即可切换分布式与混合精度的具体做法,便于评估对现有 PyTorch 训练脚本的改造成本。

4月8日周四
3月31日周三
  1. Hugging Face Blog31

    深入理解 BigBird 的块稀疏注意力机制

    Hugging Face 发文详解 BigBird 的块稀疏注意力机制,该模型以块稀疏注意力替代 BERT 的完整注意力,可处理最长 4096 的序列,计算成本远低于 BERT,并已在长文档摘要、长上下文问答等任务上取得 SOTA。BigBird 的 RoBERTa 类模型现已上线 🤗Transformers,其注意力是对 BERT 完整注意力的近似,目标是在更长序列上更高效而非超越 BERT。

3月25日周四
3月23日周二
3月18日周四
3月12日周五
3月9日周二
3月4日周四
  1. OpenAI News60

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以文字、符号还是概念形式呈现,这些神经元都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的概念视觉变体,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。

    推荐理由:OpenAI 在 CLIP 中发现对同一概念的多模态神经元,为理解其分类准确性与习得偏见提供线索。

2月25日周四
  1. Hugging Face Blog22

    Hugging Face 工程师谈构建神经网络时的调试思路

    Hugging Face 工程师分享构建和调试神经网络的思考流程,核心观点是先放下机器学习、专注理解数据,再像初学者一样从简单基线做起,并敢于拆解那些"5 行代码"模板。文中建议通过在小批量样本(如 16 条)上过拟合、观察是否达到 0 loss 来验证实现是否正确,并强调要建立合理的对比基线。

2月10日周三
2月9日周二
1月26日周二
1月25日周一
1月19日周二
1月18日周一
1月5日周二
  1. OpenAI News80

    OpenAI 发布 CLIP:用自然语言连接文本与图像

    OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 介绍 CLIP 用自然语言监督学习视觉概念,读者可了解零样本视觉分类的思路来源。

12月29日周二
11月9日周一
  1. Hugging Face Blog28

    如何用预训练语言模型检查点热启动编码器-解码器模型

    Hugging Face 发布教程,介绍如何用 BERT、GPT2 等预训练检查点热启动编码器-解码器模型,从而跳过昂贵的预训练。基于 Rothe et al. (2020) 的方法,这类热启动模型在多个序列到序列任务上可达到 T5、Pegasus 等大型预训练模型的竞争力,训练成本仅为后者一小部分。教程包含理论、分析及基于 🤗Transformers 的完整代码示例。

11月3日周二
11月2日周一
10月10日周六
  1. Hugging Face Blog22

    基于 Transformer 的编码器-解码器模型详解

    Hugging Face 发布博客,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列问题,并说明其在推理中的使用方式。文章将架构拆解为编码器与解码器两部分,结合大量图示建立理论与 🤗Transformers 实际推理用法的联系,并回顾神经编码器-解码器模型的历史。

9月22日周二
9月10日周四
9月4日周五
7月9日周四
7月3日周五
6月20日周六

最多提供 50 页,更早的内容请使用搜索或主题页。