跳到正文

#开源生态

今日 1 条
6月3日周二
  1. Hugging Face Blog71

    H Company 发布 Holo1 系列 GUI 自动化 VLM 与 WebClick 基准

    H Company 发布 Holo1 系列动作视觉语言模型(含 Holo1-3B 与 Holo1-7B)以及 WebClick 多模态定位基准,模型已在 Hugging Face 开源。

    推荐理由:Holo1 开源了面向 GUI 自动化的动作 VLM 家族,并给出 WebClick 基准与 Surfer-H 智能体的组合方式,读者可据此评估网页自动化方案的成本与精度取舍。

  2. Hugging Face Blog62

    Hugging Face 发布 SmolVLA:450M 开源视觉-语言-动作模型

    Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。

    推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。

5月28日周三
5月25日周日
5月23日周五
5月21日周三
  1. Mistral AI76

    Mistral AI 发布编码智能体模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。

5月19日周一
5月15日周四
5月14日周三
5月13日周二
5月12日周一
5月11日周日
  1. Hugging Face Blog34

    LeRobot 社区数据集:机器人领域的“ImageNet”何时到来、如何实现?

    Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。

4月30日周三
  1. Hugging Face Blog62

    如何用 Gradio 构建 MCP Server

    Hugging Face 发布教程,介绍如何用 Gradio 在几行 Python 代码内把应用变成 MCP Server,供 LLM 作为工具调用。只需在 launch() 中设置 mcp_server=True,Gradio 就会自动把函数转成 MCP 工具,并用 docstring 生成工具描述和参数,MCP 端点位于 /gradio_api/mcp/sse。

    推荐理由:原文给出用 Gradio 把 Python 函数变成 MCP 工具的完整步骤,读者可据此把自有应用接入 LLM 工具调用。

4月29日周二
4月25日周五
4月16日周三
4月14日周一
4月5日周六
  1. Hugging Face Blog88

    Llama 4 Maverick 与 Scout 上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持多模态,已在 Hugging Face Hub 上线。

    推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的参数、上下文长度与架构细节,可据此判断部署门槛。

4月4日周五
4月3日周四
3月31日周一
3月28日周五
3月27日周四
3月26日周三
3月20日周四
3月19日周三
  1. Hugging Face Blog22

    Hugging Face 就白宫 AI 行动计划 RFI 提交回应:力挺开源与开放科学

    Hugging Face 于 3 月 14 日向白宫 OSTP 提交了对白宫 AI 行动计划的回应,主张开源与开放科学是 AI 性能、普及与安全的基础。文中以 7B 参数的 OlympicCoder 在复杂编码任务上超越 Claude 3.7、AI2 全开放 OLMo 2 匹配 o1-mini 为例,并提出承认开源开放科学、优先效率与可靠性、以开放可追溯系统保障 AI 安全三项建议。

3月18日周二
3月17日周一
  1. Mistral AI71

    Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,并以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并给出多模态与长上下文能力,读者可据此判断小模型在端侧与智能体场景的可用性。

3月12日周三
  1. Hugging Face Blog78

    Google 发布 Gemma 3 开源模型:多模态、多语言、128k 上下文

    Google 发布 Gemma 家族新成员 Gemma 3,提供 1B、4B、12B、27B 四种参数规模,含预训练和指令微调版本。4B、12B、27B 支持图像与文本输入、140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。

    推荐理由:梳理了 Gemma 3 的四种参数规模、多模态与 128k 上下文变化,并给出 transformers 与端侧推理的可用入口。

3月11日周二
  1. Hugging Face Blog67

    LeRobot 与 Yaak 发布全球最大开源自动驾驶数据集 L2D

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。

    推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。

3月4日周二
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Vision 8B 与 32B 多语言多模态模型

    Cohere For AI 发布 Aya Vision 系列开源权重视觉语言模型,包含 8B 和 32B 两个版本,覆盖 23 种语言,支持图像描述、视觉问答、文本生成以及文本与图像翻译等任务。

    推荐理由:原文给出 8B 与 32B 两个开源权重的多语言视觉语言模型,并公开训练方法与评测基准,便于读者判断小参数模型在多语言多模态上的位置。