跳到正文

#开源生态

今日 0 条
3月9日周一
3月7日周六
  1. Google Research60

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的开放语音数据集

    Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。

3月5日周四
  1. Hugging Face Blog36

    Hugging Face 发布嵌入式机器人 AI 指南:数据集录制、VLA 微调与端侧优化

    Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。

  2. Hugging Face Blog62

    Hugging Face 推出 Modular Diffusers,用可组合块搭建扩散流水线

    Hugging Face 发布 Modular Diffusers,用可复用的块组合扩散流水线,作为现有 DiffusionPipeline 类的更灵活替代方案。每个块自带输入输出,可独立运行或增删替换,并支持自定义块发布到 Hub 供他人以 trust_remote_code=True 加载。该功能还与节点式可视化界面 Mellon 集成,可从块定义自动生成节点 UI。

    推荐理由:Hugging Face 官方介绍 Modular Diffusers 的可组合块机制,读者可据此判断扩散流水线搭建方式的改动。

3月4日周三
2月26日周四
2月20日周五
2月13日周五
  1. Hugging Face Blog66

    Hugging Face 发布 CUDA kernel Agent Skill,Claude 与 Codex 可自动生成并基准测试

    Hugging Face 构建了一个 Agent Skill,教编码智能体编写生产级 CUDA kernel,并让 Claude 和 Codex 分别针对 diffusers 的 LTX-Video 和 transformers 的 Qwen3-8B 生成可用 kernel,包含正确的 PyTorch 绑定与基准测试。

    推荐理由:Hugging Face 把 CUDA kernel 开发知识封装成 Agent Skill,并给出两个真实模型的端到端基准数据,可据此判断这类技能包的实际收益。

2月12日周四
2月5日周四
2月4日周三
2月3日周二
1月28日周三
1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

  2. Hugging Face Blog22

    Hugging Face 发布 Alyah 基准,评估阿拉伯语 LLM 的阿联酋方言能力

    Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。

1月22日周四
1月20日周二
1月15日周四
  1. Hugging Face Blog62

    Open Responses 开放推理标准发布:基于 Responses API 面向智能体

    OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API,面向智能体场景设计。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 试用早期访问版本。

    推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解 Responses API 开源化后的关键变化与迁移路径。

1月14日周三
  1. Google Research62

    Google 发布 MedGemma 1.5 4B 与医疗语音识别模型 MedASR

    Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。官方称其在 CT 病变分类上绝对准确率较 MedGemma 1 提升 3%(61% vs. 58%),MRI 提升 14%(65% vs. 51%),MedQA 提升 5%(69% vs. 64%)。

    推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。

1月6日周二
12月19日周五
12月18日周四
12月16日周二
12月12日周五
12月11日周四
  1. Hugging Face Blog62

    llama.cpp 新增模型管理功能:router 模式支持动态加载与切换模型

    llama.cpp server 新增 router 模式,可在不重启服务的情况下动态加载、卸载和切换多个模型。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;支持从 llama.cpp 缓存或 --models-dir 目录自动发现 GGUF 文件,按需加载,并在达到 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

    推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型动态切换与显存管理方式。

  2. Hugging Face Blog62

    Hugging Face 教程:用 Codex 与 HF Skills 端到端微调开源模型

    Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。

    推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。

12月9日周二
  1. Mistral AI82

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。

12月4日周四
12月3日周三
12月1日周一
11月25日周二
11月21日周五
11月20日周四
11月19日周三
  1. Mistral AI38

    Mistral AI 与 SAP、Helsing 达成合作,将在德国开设办公室

    Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 提供完全自主的 AI 技术栈,并联合开发面向欧洲复杂行业与政府机构的行业解决方案。Mistral AI 同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。该公司还计划在未来数月内于德国开设办公室,并大幅扩充本地团队。

11月17日周一