跳到正文

全部动态

今日 2 条
6月3日周二
  1. Hugging Face Blog71

    H Company 发布 Holo1 系列 GUI 自动化 VLM 与 WebClick 基准

    H Company 发布 Holo1 系列动作视觉语言模型(含 Holo1-3B 与 Holo1-7B)以及 WebClick 多模态定位基准,模型已在 Hugging Face 开源。

    推荐理由:Holo1 开源了面向 GUI 自动化的动作 VLM 家族,并给出 WebClick 基准与 Surfer-H 智能体的组合方式,读者可据此评估网页自动化方案的成本与精度取舍。

  2. Hugging Face Blog62

    Hugging Face 发布 SmolVLA:450M 开源视觉-语言-动作模型

    Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。

    推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。

5月28日周三
  1. Mistral AI62

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。

5月21日周三
  1. Mistral AI76

    Mistral AI 发布编码智能体模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。

5月16日周五
  1. OpenAI News62

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明:Codex

    OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。

    推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。

5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。

5月7日周三
4月30日周三
  1. OpenAI News70

    OpenAI 回滚 GPT-4o 更新以解决谄媚行为

    OpenAI 已回滚上周的 GPT-4o 更新,ChatGPT 用户现在使用行为更平衡的早期版本。被移除的更新过度奉承或顺从,常被描述为谄媚。

    推荐理由:OpenAI 官方说明回滚 GPT-4o 更新的原因,读者可了解模型行为调整的决策过程。

4月29日周二
4月16日周三
  1. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 和 o4-mini 系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。

    推荐理由:官方系统卡披露 o3 与 o4-mini 的推理与工具调用组合,可据此了解新模型的能力边界。

  2. OpenAI News82

    OpenAI 发布 o3 与 o4-mini 推理模型

    OpenAI 发布 o3 和 o4-mini 两款模型,称其为目前最智能、能力最强的模型,并具备完整的工具调用能力。

    推荐理由:OpenAI 发布 o3 与 o4-mini 两款推理模型,并首次给出完整工具调用能力,读者可据此了解其推理产品线的最新分层。

4月14日周一
  1. OpenAI News80

    OpenAI 在 API 中推出 GPT-4.1 系列模型

    OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解方面均有提升。该系列同时包含 OpenAI 首个 nano 模型,即日起面向全球开发者开放。

    推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的能力变化与可用范围。

4月11日周五
4月5日周六
  1. Hugging Face Blog88

    Llama 4 Maverick 与 Scout 上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持多模态,已在 Hugging Face Hub 上线。

    推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的参数、上下文长度与架构细节,可据此判断部署门槛。

3月27日周四
3月25日周二
  1. OpenAI News62

    OpenAI 发布 GPT-4o 系统卡增补:4o 图像生成

    OpenAI 发布 GPT-4o 系统卡增补,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级写实输出,也能接收图像作为输入并对其进行变换。

    推荐理由:GPT-4o 图像生成系统卡增补说明,交代了它相对 DALL·E 3 的能力变化与图像输入输出方式。

3月20日周四
  1. OpenAI News62

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如像有同理心的客服人员那样说话,为语音智能体带来新的定制能力。

    推荐理由:OpenAI 在 API 中开放语音风格指令,开发者可据此判断语音智能体的定制空间。

3月18日周二
3月17日周一
  1. Mistral AI71

    Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,并以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 3.1 以 Apache 2.0 开源并给出多模态与长上下文能力,读者可据此判断小模型在端侧与智能体场景的可用性。

3月12日周三
  1. Hugging Face Blog78

    Google 发布 Gemma 3 开源模型:多模态、多语言、128k 上下文

    Google 发布 Gemma 家族新成员 Gemma 3,提供 1B、4B、12B、27B 四种参数规模,含预训练和指令微调版本。4B、12B、27B 支持图像与文本输入、140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。

    推荐理由:梳理了 Gemma 3 的四种参数规模、多模态与 128k 上下文变化,并给出 transformers 与端侧推理的可用入口。

3月4日周二
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Vision 8B 与 32B 多语言多模态模型

    Cohere For AI 发布 Aya Vision 系列开源权重视觉语言模型,包含 8B 和 32B 两个版本,覆盖 23 种语言,支持图像描述、视觉问答、文本生成以及文本与图像翻译等任务。

    推荐理由:原文给出 8B 与 32B 两个开源权重的多语言视觉语言模型,并公开训练方法与评测基准,便于读者判断小参数模型在多语言多模态上的位置。

2月27日周四
  1. OpenAI News75

    OpenAI 发布 GPT-4.5 研究预览

    OpenAI 发布 GPT-4.5 的研究预览,称其为目前规模最大、知识最广的模型。该发布以系统卡形式公布。

    推荐理由:OpenAI 发布 GPT-4.5 研究预览,读者可了解其作为当前规模最大、知识最广模型的基本定位。

2月21日周五
  1. Hugging Face Blog62

    Google 发布 SigLIP 2 多语言视觉语言编码器

    Google 发布 SigLIP 2 系列多语言视觉语言编码器,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local loss 与 Masked Prediction loss 等训练目标,在零样本分类、图文检索及为 VLM 提取视觉表征等核心能力上全面优于旧版 SigLIP。

    推荐理由:梳理 SigLIP 2 相比前代新增的训练目标与 naflex 动态分辨率变体,便于理解视觉编码器的演进方向。

2月20日周四
2月19日周三
2月17日周一
  1. Mistral AI60

    Mistral 发布区域语言模型 Mistral Saba

    Mistral AI 发布首款区域语言模型 Mistral Saba,24B 参数,基于中东和南亚数据集训练,支持阿拉伯语及多种印度语系语言,在泰米尔语等南印度语言上表现突出。官方称其回答比体量大 5 倍以上的模型更准确,速度更快、成本更低,可通过 API 调用,也能在客户本地单 GPU 系统部署,速度超过 150 tokens/s。

    推荐理由:Mistral 首款区域语言模型,24B 参数却对标 5 倍体量模型,并支持单卡本地部署,可据此判断区域化模型的落地路径。

2月4日周二
1月31日周五
  1. OpenAI News62

    OpenAI 发布 o3-mini 系统卡

    OpenAI 发布 o3-mini 系统卡,说明该模型的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。

    推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,便于了解其安全验证流程。

1月30日周四
1月23日周四
1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 编码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。

1月10日周五
  1. Hugging Face Blog42

    Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索嵌入模型

    Hugging Face 推出多语言嵌入模型 vdr-2b-multi-v1,可将文档页面截图编码为单向量,无需 OCR 即可跨语言检索视觉丰富的文档。该模型基于 MrLight/dse-qwen2-2b-mrl-v1,与 LlamaIndex 合作开发,覆盖意大利语、西班牙语、英语、法语和德语,并开源了 50 万样本的 vdr-multilingual-train 数据集。

12月19日周四
  1. Hugging Face Blog71

    Answer.AI 与 LightOn 发布 ModernBERT,为 BERT 提供现代替代方案

    Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作为 BERT 类模型的直接替代。

    推荐理由:ModernBERT 用现代 LLM 技术重做编码器,给出 8k 上下文与速度数据,可据此判断它能否替换现有 BERT 类模型。

12月18日周三
  1. Hugging Face Blog60

    IBM 等联合发布混合 Mamba2 模型 Bamba-9B

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。

12月17日周二