跳到正文

#开源生态

今日 0 条
8月1日周一
  1. Hugging Face Blog15

    Hugging Face 就美国国家 AI 研究资源(NAIRR)中期报告提交建议

    Hugging Face 于 2022 年 6 月下旬就美国国家 AI 研究资源(NAIRR)中期报告提交了回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准、为非技术专家提供低代码或无代码工具。其还建议 NAIRR 监测开源与开放科学的高风险滥用,并通过多语言工具与资源支持多元研究者视角。

7月28日周四
7月27日周三
7月16日周六
  1. Hugging Face Blog26

    如何用对抗数据动态训练你的模型

    Hugging Face 博客介绍动态对抗数据收集(DADC):让用户用千奇百怪的手写数字骗过模型,再把骗成功的样本存下来继续训练,循环多轮以提升鲁棒性。教程以 MNIST 手写数字识别为例,用 🤗 Spaces 搭建交互 demo,模型训练 20 个 epoch 后在测试集上达到 89% 准确率,并通过 flag 机制收集对抗样本。

7月14日周四
  1. Hugging Face Blog48

    BLOOM 训练背后的技术:176B 参数模型如何用 Megatron-DeepSpeed 完成训练

    Hugging Face 披露了 176B 参数多语言模型 BLOOM 的训练技术细节,该模型基于 GPT3 架构,使用 Megatron-DeepSpeed 框架在 384 张 80GB A100 GPU 上训练,耗时约 3.5 个月。训练数据为 59 种语言、350B token,模型词表大小 250,680,采用 3D 并行(数据、张量、流水线并行)方案。

7月12日周二
  1. Hugging Face Blog82

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点与优化器状态,为研究大模型内部行为提供了少见的开放样本。

6月28日周二
  1. Hugging Face Blog60

    Hugging Face 发布 Evaluation on the Hub,可在 Hub 上零代码评测任意模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集评测任意模型。评测结果会以 PR 形式写入模型卡元数据,并可在数据集排行榜上比较不同模型的表现。官方已用该工具在多个关键数据集上评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集示例。

    推荐理由:Hugging Face 把模型评测做成 Hub 上的零代码流程,读者可据此了解评测结果如何进入模型卡与排行榜。

6月22日周三
6月15日周三
6月7日周二
  1. Hugging Face Blog22

    Hugging Face 深度强化学习课程:用 Deep Q-Learning 玩 Space Invaders

    Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning:不再维护 Q-table,而是用神经网络根据状态逼近每个动作的 Q 值,并训练智能体玩 Space Invaders 等 Atari 环境。输入为 4 帧堆叠、缩放至 84x84 的灰度画面,经三层卷积和全连接层输出各动作 Q 值,训练借助基于 Stable-Baselines 的 RL-Zoo 完成。

  2. Hugging Face Blog62

    图解扩散模型:用 PyTorch 逐步实现 DDPM

    Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现去噪扩散概率模型,代码参考 Phil Wang 的实现。

    推荐理由:从 DDPM 论文出发逐步用 PyTorch 复现扩散模型,并梳理后续关键改进方向,适合想理解扩散模型原理的读者。

5月25日周三
5月19日周四
  1. Hugging Face Blog20

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息、在医疗、法律、金融和移民等高风险领域的不谨慎使用,以及各类歧视性内容。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间有时会相互冲突,需逐案权衡。

5月18日周三
5月17日周二
5月16日周一
5月13日周五
5月10日周二
5月9日周一
  1. Hugging Face Blog62

    Hugging Face 完成 1 亿美元 C 轮融资

    Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参投。官方称平台已托管 10 万个预训练模型和 1 万个数据集,超过 1 万家公司使用其产品与服务,团队在过去 12 个月从 30 人扩展到 120 多人。新资金将投入研究、开源、产品以及 AI 的负责任普及。

    推荐理由:Hugging Face 官方披露 C 轮融资规模与投资方,并给出平台模型、数据集和客户体量,可据此判断开源机器学习平台的商业化进展。

5月6日周五
5月4日周三
4月28日周四
4月25日周一
4月13日周三
  1. Hugging Face Blog15

    Hugging Face 工程师 Lewis Tunstall 谈 transformers 库与 ONNX 导出优化

    Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了他为 transformers 库开发的功能:将 PyTorch 模型导出为 ONNX 格式,只需一行代码即可完成转换,从而获得更低的延迟和更高的吞吐量。他还与 Leandro von Werra 合著了《NLP with Transformers》一书,并谈到大规模模型评估等话题。

4月12日周二
4月5日周二
  1. Hugging Face Blog22

    Hugging Face Transformers 为何不遵循 DRY 原则:单一模型文件策略解析

    Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用"单一模型文件策略":模型前向传播所需的全部代码只放在一个模型文件中,注意力机制代码在不同模型文件里被复制超过 50 次。官方给出的理由包括该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快,以及模型发布后基本静态不变。

3月23日周三
3月22日周二
3月16日周三
3月11日周五
2月2日周三
2月1日周二
1月12日周三
12月21日周二
  1. Hugging Face Blog62

    Gradio 加入 Hugging Face

    Hugging Face 收购机器学习初创公司 Gradio,Gradio 联合创始人发文确认这一消息。Gradio 自 2019 年发布以来已有超过 30 万个 demo 用它构建,用于让非技术用户也能使用和反馈机器学习模型。作者表示加入 Hugging Face 后会继续发展 Gradio,让任何有浏览器和网络连接的人都能用上机器学习。

    推荐理由:Gradio 创始人以当事方身份讲述被 Hugging Face 收购的经过,读者可了解这次收购的来龙去脉与双方在开源机器学习可及性上的共同目标。

12月8日周三
11月30日周二
11月15日周一
10月26日周二
  1. Hugging Face Blog22

    大语言模型:新的摩尔定律?

    Hugging Face 发文质疑微软与 NVIDIA 发布的 Megatron-Turing NLG 530B 这类超大模型趋势,指出复现该实验需花费近 1 亿美元,且训练 BERT 的碳排放已相当于一次跨美飞行。文章主张改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解能力、体积小 40%、速度快 60%)和微调等务实方案。