跳到正文

#Hugging Face

今日 0 条
8月19日周五
8月18日周四
8月12日周五
  1. Hugging Face Blog22

    Hugging Face 的 TensorFlow 哲学

    Hugging Face 阐述了其 transformers 库在 TensorFlow 上的设计哲学:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。库通过 TFAutoModel 等类一行代码加载预训练模型,并强调应保留 Keras 高层 API 而非绕开它。

8月11日周四
8月10日周三
8月5日周五
8月3日周三
8月2日周二
  1. Hugging Face Blog22

    Nyströmformer:用 Nyström 方法以线性时间与内存近似自注意力

    Nyströmformer 通过 Nyström 方法近似标准自注意力,将时间和内存复杂度从 O(n²) 降至 O(n)。它不直接对 softmax 矩阵采样,而是从 query 和 key 中选取 landmark,用分段均值构造 Q̃、K̃,并据此构建三个矩阵完成近似。实验显示仅选 32 或 64 个 landmark 即可在 n=4096 或 8192 的长序列上取得有竞争力的性能。

8月1日周一
  1. Hugging Face Blog15

    Hugging Face 就美国国家 AI 研究资源(NAIRR)中期报告提交建议

    Hugging Face 于 2022 年 6 月下旬就美国国家 AI 研究资源(NAIRR)中期报告提交了回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准、为非技术专家提供低代码或无代码工具。其还建议 NAIRR 监测开源与开放科学的高风险滥用,并通过多语言工具与资源支持多元研究者视角。

7月28日周四
7月27日周三
7月25日周一
7月22日周五
7月16日周六
  1. Hugging Face Blog26

    如何用对抗数据动态训练你的模型

    Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用千奇百怪的手写数字骗过模型,再把骗成功的样本存下来继续训练,循环多轮以提升鲁棒性。教程以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制收集对抗样本。

7月14日周四
  1. Hugging Face Blog48

    BLOOM 训练背后的技术:176B 参数模型如何用 Megatron-DeepSpeed 完成训练

    Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 GPT3 架构,使用 Megatron-DeepSpeed 框架在 384 张 80GB A100 GPU 上训练,耗时约 3.5 个月。训练数据为 59 种语言、350B token,模型词表大小 250,680,采用 3D 并行(数据、张量、流水线并行)方案。

7月13日周三
7月12日周二
  1. Hugging Face Blog82

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点与优化器状态,为研究大模型内部行为提供了少见的开放样本。

7月7日周四
  1. Hugging Face Blog28

    Hugging Face 指南:如何在 Twitter 上进行情感分析

    Hugging Face 发布 Twitter 情感分析入门指南,面向开发者和非开发者分别给出方案。开发者可用 Tweepy 抓取推文、通过 Inference API 几行代码完成情感分类,并用 Matplotlib 和 WordCloud 可视化结果;非开发者则可借助无代码工具 Zapier 抓取推文、调用 Inference API 分析并将结果发送至 Google Sheets。

6月30日周四
6月29日周三
  1. Hugging Face Blog22

    如何用 Sentence Transformers 开启你的第一个机器学习项目

    Hugging Face 发文介绍如何以 Sentence Transformers(ST)为例从零上手一个新 ML 库并完成首个自驱项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目和包依赖它。

6月28日周二
  1. Hugging Face Blog60

    Hugging Face 发布 Evaluation on the Hub,可在 Hub 上零代码评测任意模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集评测任意模型。评测结果会以 PR 形式写入模型卡元数据,并可在数据集排行榜上比较不同模型的表现。官方已用该工具在多个关键数据集上评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集示例。

    推荐理由:Hugging Face 把模型评测做成 Hub 上的零代码流程,读者可据此了解评测结果如何进入模型卡与排行榜。

6月23日周四
6月22日周三
6月15日周三
6月7日周二
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程:用 Deep Q-Learning 玩 Space Invaders

    Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning:不再维护 Q-table,而是用神经网络根据状态逼近每个动作的 Q 值,并训练智能体玩 Space Invaders 等 Atari 环境。输入为 4 帧堆叠、缩放至 84x84 的灰度画面,经三层卷积和全连接层输出各动作 Q 值,训练借助基于 Stable-Baselines 的 RL-Zoo 完成。

  2. Hugging Face Blog62

    图解扩散模型:用 PyTorch 逐步实现 DDPM

    Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现去噪扩散概率模型,代码参考 Phil Wang 的实现。

    推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,并梳理后续关键改进方向,适合想理解扩散模型原理的读者。

5月26日周四
5月25日周三
5月23日周一
5月20日周五
5月19日周四
  1. Hugging Face Blog20

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息、在医疗、法律、金融和移民等高风险领域的不谨慎使用,以及各类歧视性内容。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间有时会相互冲突,需逐案权衡。

5月18日周三
5月17日周二
5月16日周一
5月13日周五