TRL 支持 vLLM 共置:训练与推理共享同一批 GPU
Hugging Face 的 TRL 通过 PR #3394 支持 vLLM 的 external launcher,让训练与推理共置在同一批 GPU 上,不再需要单独的 vLLM 服务器进程。
推荐理由:原文给出同卡共置训练与推理的实现方式和多组吞吐对比,读者可据此判断 GRPO 训练的成本变化。
Hugging Face 的 TRL 通过 PR #3394 支持 vLLM 的 external launcher,让训练与推理共置在同一批 GPU 上,不再需要单独的 vLLM 服务器进程。
推荐理由:原文给出同卡共置训练与推理的实现方式和多组吞吐对比,读者可据此判断 GRPO 训练的成本变化。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在消费级硬件甚至 CPU 上运行,仅用 lerobot 标签下的社区共享数据集预训练。
推荐理由:450M 的 VLA 模型仅用社区数据预训练就能在仿真和真机上超过更大模型,读者可据此判断开源机器人模型的成本门槛。
OpenAI 封禁了一批与公开归因于中国的威胁行为者相关的账号,这些账号利用 AI 辅助漏洞研究、脚本编写、翻译和行动排障。
OpenAI 封禁了一批利用 AI 在多个社交平台生成菲律宾政治及公职人员相关评论的账号。该行动代号为 "High Five",针对的是将 AI 用于政治舆论操纵的账号。
OpenAI 封禁了一批中国来源账号,这些账号使用 AI 生成美国政治内容,并用于研究人物、运动和在线社群。该行动被命名为 Operation “Uncle Spam”,指向美国政治极化相关的舆论影响活动。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 支持针对英国用户的任务诈骗流程。
OpenAI 封禁了一批利用 AI 生成帖文、批评一名台湾社交媒体网红及相关美国话题的账号。该行动被命名为“Sneer Review”,指向中国来源的影响力活动。
OpenAI 封禁了一批与疑似伊朗关联的 STORM-2035 行动有关的账号,该行动利用 AI 生成针对美国、英国、爱尔兰和委内瑞拉政治的影响力内容。
OpenAI 封禁了一批俄语账号,这些账号利用 AI 构建恶意软件、改进加载器并排查网络工具问题。此次行动代号 "ScopeCreep",针对的是俄语恶意软件开发活动。
OpenAI 封禁了一批与疑似欺诈就业活动相关的账号,这些账号利用 AI 生成远程职位申请材料。OpenAI 称相关活动涉嫌以欺骗性手段获取就业机会。
OpenAI 封禁了一批利用 AI 从事社会工程、监控主题研究和针对批评者的影响力行动的账号。该行动代号为 Operation VAGue Focus。
推荐理由:OpenAI 披露封禁账号的三类滥用场景,可了解平台对 AI 社会工程与影响力行动的处置边界。
OpenAI 封禁了一批疑似源自俄罗斯的账号,这些账号利用 AI 生成德语政治内容,涉及乌克兰、NATO 及德国国内议题。
Wix 的 AI Website Builder 由 OpenAI 提供支持,用户只需在对话中描述想法,即可在几分钟内创建完整网站。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。
推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。
Hugging Face 分享研究,将 CodeAgent 的思考与代码强制以结构化 JSON 生成,在 GAIA、MATH、SimpleQA、Frames 等基准上比普通 CodeAgent 平均高出 2-7 个百分点。
推荐理由:通过 15724 条 agent trace 量化解析错误对成功率的影响,并给出结构化 CodeAgent 的适用模型门槛。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、web search 等内置连接器及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,以及带 web search 的 SimpleQA 对比数据,可据此判断企业级智能体平台的落地方式。
用户反馈在 TRL 中使用 Liger GRPO loss 配合 DeepSpeed ZeRO3 训练 Qwen/Qwen2.5-0.5B-Instruct(bf16)时出现形状不匹配错误,报错栈指向 liger_kernel 的 chunked_loss/grpo_loss.py 与 fused_linear_ppo.py。
Hugging Face 在 huggingface_hub 中新增 MCPClient,并基于它实现 Python 版 Tiny Agents,用约 70 行代码即可搭建连接 MCP 服务器的智能体。
推荐理由:原文给出约 70 行 Python 代码实现 MCP 智能体的完整方法,读者可据此复用并接入自有工具。
OpenAI 将 Operator 的底层模型从 GPT-4o 版本替换为基于 OpenAI o3 的版本,API 版本仍基于 4o。该变动作为 OpenAI o3 与 o4-mini 系统卡增补内容公布。
Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供可直接部署的模型与应用目录,支持 Meta Llama 4 Maverick。
CodeRabbit 采用 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改造代码审查流程,提升准确率并加快 PR 合并速度。该方案帮助开发者更快交付代码,减少 bug 并提高投资回报率。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 首次把 Stargate 基础设施平台部署到美国以外,读者可据此观察其算力布局的国际化节奏。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Mistral 与 All Hands AI 联合发布开源编码智能体模型,给出 SWE-Bench Verified 分数与本地部署门槛,便于判断其可用性。
Falcon-LLM 团队发布 Falcon-H1 系列六个开源模型,参数规模从 0.5B 到 34B,每个都提供 base 和 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用混合注意力与 SSM 架构覆盖 0.5B 到 34B,读者可据此判断小模型在长上下文与端侧场景的取舍。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及最多 4 倍大的阿拉伯语 LLM,覆盖阿拉伯语 MMLU、Exams、MadinahQA 等任务。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,灵感来自 nanoGPT,可在免费 Colab 上启动训练。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
微软在 Build 大会上宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现已提供 10,000+ 个可一键部署的开源模型,覆盖文本、音频和图像任务。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。
OpenAI 发布 Codex。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 表示,未来目标是让 Transformers 成为各框架之间的枢纽:只要模型架构被 Transformers 支持,就能在生态其他工具中获得支持。
推荐理由:Hugging Face 说明 Transformers 将作为跨框架模型定义中枢,读者可了解其对训练、推理与本地部署工具链互通的影响。
Expedia Group 首席营销官 Jochen Koedijk 与 OpenAI 对话,讲述 AI 如何推动 Expedia 的营销演进。
Kaggle 上线与 Hugging Face 的集成,可直接在 Kaggle 上发现和使用 Hugging Face 模型。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较上一版最高提升 8 倍。
OpenAI 发布医疗 AI 评估基准 HealthBench,用于在真实场景中评测模型表现。该基准由 250 多名医生参与构建,旨在为医疗领域模型性能与安全性提供统一标准。
Hugging Face 发文回顾过去一年视觉语言模型(VLM)的关键变化,涵盖 any-to-any 模型、推理模型、小尺寸模型、MoE 解码器、视觉语言动作模型、多模态 RAG 与智能体、视频语言模型等新趋势。
Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。
OpenAI 任命 Fidji Simo 加入领导层,Sam Altman 当天向公司内部发布了这一消息。
OpenAI 就 AI 基础设施议题向美国能源部提交回应,主张基础设施决定命运,并阐述美国应如何把握这一机遇。