跳到正文

#数据/训练

今日 0 条
9月24日周四
  1. Latent Space34

    Foundries vs Navigators:AI 如何降低科学研究的成本

    AI 让写代码和数据分析变得极快,但科学研究的瓶颈仍是需要数天到数周验证的物理实验,"思考变便宜了,动手没有"。生物技术行业由此分化为两类:Foundries 用下一代测序、高通量显微镜和物理自动化把实验测量成本降低一个数量级,差异化资产是实验数据本身;Navigators 则把 AI 嵌入公司日常流程,用更快的决策和流程改进实验迭代,无需专有模型或大规模数据集。

9月23日周三
  1. Latent Space40

    Radical Numerics CEO Eric Nguyen 谈生物安全:AI 军备竞赛与基因组语言模型

    Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为生物安全正成为 AI 军备竞赛,防御能力需要跟上前沿模型的攻击能力。其团队构建的基因组语言模型(GLM)已能处理 RNA 和蛋白质,并在 aptamer 数据集上展现出类似链式推理的"用 DNA 思考"能力,可自行推演出未见过的高分序列。

9月21日周一
8月14日周五
  1. Hugging Face Blog68

    Hugging Face 发布 2026 夏季开源模型观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型累计下载不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,可看到中美实验室规模路线与下载依赖的分野。

7月30日周四
  1. Hugging Face Blog22

    GPU 管理:为什么闲置 GPU 正在成为新的停飞飞机

    Hugging Face 博客指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称即便集群 GPU 满载也可能浪费大部分潜力,因为 GPU 全天运行而需求并非如此,基础设施必须按峰值配置。

7月7日周二
5月18日周一
5月4日周一
3月18日周三
3月9日周一
  1. Google DeepMind22

    AlphaGo 十周年:从围棋到生物学,DeepMind 回顾其对 AI 与科学的深远影响

    十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。

1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

10月29日周三
  1. Hugging Face Blog65

    Hugging Face 博客:全球算力格局正在如何变化

    Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。

6月24日周一
12月18日周一
  1. Hugging Face Blog38

    2023:开源大语言模型之年

    Hugging Face 回顾 2023 年开源 LLM 进展,指出公众对开源与闭源之争的关注度大幅上升。文章梳理了预训练大模型的构成要素,包括架构、训练数据、tokenizer、训练超参数与模型权重,并回顾 2022 年的代表模型:176B 参数的 BLOOM、175B 参数的 OPT 以及 GLM-130B。

12月23日周五
6月14日周二
5月17日周二
10月26日周二
  1. Hugging Face Blog22

    大语言模型:新的摩尔定律?

    Hugging Face 发文质疑微软与 NVIDIA 发布的 Megatron-Turing NLG 530B 这类超大模型趋势,指出复现该实验需花费近 1 亿美元,且训练 BERT 的碳排放已相当于一次跨美飞行。文章主张改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解能力、体积小 40%、速度快 60%)和微调等务实方案。