跳到正文

#开源生态

今日 0 条
9月24日周四
9月21日周一
8月28日周五
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别基准优化现象如何测量

    Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

  2. Microsoft Research42

    微软 Skala 1.1 发布:训练数据增至 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。

8月13日周四
  1. Hugging Face Blog72

    Hugging Face 复盘 ICML 2026 论文复现活动:19 天复现 2226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占大会论文总数的 34%。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体分工。

6月30日周二
6月24日周三
  1. Hugging Face Blog36

    Hugging Face 与 Treble 推出 FFASR 远场 ASR 排行榜

    Hugging Face 与 Treble Technologies 联合发布 FFASR Leaderboard,这是首个开放的远场 ASR 基准,覆盖 14 个模拟房间并经过真实测量验证。所有提交模型在低 SNR 远场下的 WER 均比同内容近场高出数倍,榜单同时报告基于 NVIDIA L4 GPU 的 RTFx,用于权衡准确率与速度。多说话人、麦克风阵列与回声消除已在路线图中。

4月21日周二
3月31日周二
  1. Hugging Face Blog22

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月24日周二
3月7日周六
  1. Google Research60

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的开放语音数据集

    Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。

1月27日周二
  1. Hugging Face Blog22

    Hugging Face 发布 Alyah 基准,评估阿拉伯语 LLM 的阿联酋方言能力

    Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。

10月17日周五
10月14日周二
10月1日周三
  1. Hugging Face Blog34

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估嵌入模型在真实应用中的检索准确率。RTEB 采用开放与私有数据集混合策略,私有部分由 MTEB 维护者评测,以暴露模型在未见数据上的过拟合。基准覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10,每个数据集至少含 1k 文档和 50 条查询。

9月22日周一
8月21日周四
7月23日周三
6月6日周五
5月28日周三
3月11日周二
  1. Hugging Face Blog67

    LeRobot 与 Yaak 发布全球最大开源自动驾驶数据集 L2D

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。

    推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。

2月14日周五
  1. Hugging Face Blog62

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。

    推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。

2月11日周二
  1. Hugging Face Blog67

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。

1月9日周四
11月20日周三
  1. Hugging Face Blog38

    让大模型辩论:首届多语言 LLM 辩论赛 FlagEval Debate 举办

    BAAI 推出 FlagEval Debate 辩论平台,让大模型直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言的辩论赛。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义功能,可调整模型参数、策略与对话风格。2024 年 Q3 的实验显示,当前大多数模型都能参与辩论。

10月1日周二
7月18日周四
7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段全量微调,先学自然语言链式推理,再学工具集成推理,配合 SC-TIR 解码生成 N=48、深度 M=4 的候选并多数投票。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理任务。

7月1日周一
  1. Hugging Face Blog62

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。

5月5日周日
3月20日周三
  1. Hugging Face Blog62

    Cosmopedia:如何为 LLM 预训练构建大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。

    推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。

2月20日周二
12月1日周五
  1. Hugging Face Blog34

    Open LLM Leaderboard 的 DROP 基准深度排查

    Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。

10月19日周三
  1. Hugging Face Blog62

    Hugging Face 发布 MTEB:大规模文本嵌入基准

    Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于在多种嵌入任务上衡量文本嵌入模型性能,包含 56 个数据集、8 类任务,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。

    推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总成统一榜单,读者可据此理解文本嵌入模型的评测口径与选型依据。

7月15日周四
  1. Hugging Face Blog62

    Hugging Face 提出 DeDLOC:40 名志愿者协作预训练孟加拉语模型 sahajBERT

    Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 协作式分布式训练方法,可自适应参与者的网络与硬件条件,并通过 40 名志愿者在互联网上预训练出孟加拉语模型 sahajBERT。

    推荐理由:Hugging Face 团队用 40 名志愿者在互联网上预训练出孟加拉语模型,给出了分布式协作训练在真实场景中的可行路径。

7月9日周一
  1. OpenAI News62

    OpenAI 发布可逆生成模型 Glow

    OpenAI 发布可逆生成模型 Glow,采用可逆 1x1 卷积,在简化此前可逆生成模型架构的同时支持生成高分辨率图像和高效采样,并能发现可用于操控数据属性的特征。OpenAI 同时开放该模型的代码和一个在线可视化工具,供人们探索并在此基础上继续开发。

    推荐理由:OpenAI 介绍可逆生成模型 Glow 的架构简化思路,并开放代码与可视化工具供复现探索。

7月20日周四
  1. OpenAI News75

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都更简单。PPO 因易用且性能良好,已成为 OpenAI 的默认强化学习算法。

    推荐理由:OpenAI 发布 PPO 强化学习算法,读者可了解它为何成为 OpenAI 默认算法及相比已有方法的简化之处。