Hugging Face 与 JFrog 合作提升 AI 模型安全扫描透明度
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,减少误报,覆盖 pickle 和 Keras Lambda 层等多种格式的漏洞利用。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,减少误报,覆盖 pickle 和 Keras Lambda 层等多种格式的漏洞利用。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
OpenAI 与九家国家实验室联合举办首届 1,000 Scientist AI Jam Session,汇聚顶尖科学家参与。
Hugging Face 发布教程,演示如何用 Arize Phoenix 配合 OpenTelemetry 与 OpenInference 追踪和评估基于 smolagents 构建的 Agent。
Mercari 借助 GPT-4o mini 和 GPT-4 简化卖家的商品上架流程并提升销量,推出了 AI Listing Support 和 Mercari AI Assistant 等功能。这些功能用于优化商品信息、改善在线交易体验。
OpenAI 发布 GPT-4.5 的研究预览,称其为目前规模最大、知识最广的模型。该发布以系统卡形式公布。
推荐理由:OpenAI 发布 GPT-4.5 研究预览,读者可了解其作为当前规模最大、知识最广模型的基本定位。
Endex 基于 OpenAI 的 o1 和 o3-mini 推理模型构建自主金融分析师。该平台将 OpenAI 推理模型用于金融分析场景,目标是实现自主化的财务分析能力。
Hugging Face 与印度科学研究所(IISc)及 ARTPARK 达成合作,旨在提升印度多模态多语言数据集 Vaani 的可访问性与易用性。Vaani 由 IISc/ARTPARK 与 Google 于 2022 年发起,目标采集超 150,000 小时语音和 15,000 小时转写文本,覆盖全印 773 个地区、100 万人。
OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评测,以及针对关键风险领域构建的缓解措施概览。
推荐理由:OpenAI 公开 deep research 发布前的安全评估流程,可了解其外部红队与 Preparedness Framework 风险评测的做法。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于构建实时音频和视频 AI 应用。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以缓解高分辨率图像和视频合成中解码器的显存占用问题。
Google 发布 SigLIP 2 系列多语言视觉语言编码器,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local loss 与 Masked Prediction loss 等训练目标,在零样本分类、图文检索及为 VLM 提取视觉表征等核心能力上全面优于旧版 SigLIP。
推荐理由:梳理 SigLIP 2 相比前代新增的训练目标与 naflex 动态分辨率变体,便于理解视觉编码器的演进方向。
Uber 客户至上 AI 与产品负责人 Jai Malkani 分享了 Uber 如何借助 AI 支撑其按需服务体验。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三种参数规模,官方称 500M 与 256M 是目前最小的视频语言模型。
推荐理由:Hugging Face 官方发布三档小尺寸视频理解模型,并给出 MLX 与 iPhone 本地运行方案,可据此判断端侧视频理解的可行边界。
Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的微调视觉语言模型,覆盖 OCR、长短描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已开放演示。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实世界的自由职业软件工程任务并赚取 100 万美元。该基准以真实报酬的软件工程任务为评测对象。
推荐理由:OpenAI 推出面向真实自由职业软件工程任务的基准,读者可了解前沿 LLM 在真实报酬任务上的表现。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 直连提供商,或通过 HF 路由调用并按标准 API 费率计费,PRO 用户每月获 $2 推理额度。
Mistral AI 发布首款区域语言模型 Mistral Saba,24B 参数,基于中东和南亚数据集训练,支持阿拉伯语及多种印度语系语言,在泰米尔语等南印度语言上表现突出。官方称其回答比体量大 5 倍以上的模型更准确,速度更快、成本更低,可通过 API 调用,也能在客户本地单 GPU 系统部署,速度超过 150 tokens/s。
推荐理由:Mistral 首款区域语言模型,24B 参数却对标 5 倍体量模型,并支持单卡本地部署,可据此判断区域化模型的落地路径。
OpenAI 与 Guardian Media Group 宣布达成内容合作,将 Guardian 的新闻内容引入 ChatGPT。
Hugging Face 宣布 Fireworks.ai 正式成为 HF Hub 支持的推理服务商,可在模型页面及整个 HF 生态中直接调用其无服务器推理。
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。
推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。
Fanatics Betting and Gaming 首席财务官 Andrea Ellis 分享了公司如何运用 AI 聚焦大局。这是一场围绕该博彩公司 AI 应用的对话。
Wayfair 首席技术官 Fiona Tan 分享了该公司如何用 AI 塑造零售业的未来。这是一场围绕 Wayfair 的 AI 实践的对话。
Rogo 借助 OpenAI o1 扩展 AI 驱动的金融研究。o1 的推理能力帮助该平台处理复杂金融分析任务,提升研究效率。
Hugging Face 博客给出每天 10 亿次分类与嵌入推理的成本测算框架,用 Infinity 部署、k6 压测,在 nvidia-L4($0.8/hr)上跑 10 亿条输入。
Hugging Face 推出面向视频生成模型微调的开源数据集工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过把去重后的数据聚合为最大 64MB 的块、并用分片记录文件与块的映射,把 CAS 条目减少约 1000 倍,上传下载速度在部分场景提升 2-3 倍。
推荐理由:Hugging Face 官方解释 Xet 存储如何用块与分片聚合替代逐块传输,并给出量化模型仓库的实测节省数据。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。
OpenAI 与 Schibsted Media Group 宣布达成内容合作,将 Guardian 的新闻与档案内容引入 ChatGPT。
Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测榜。首版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 700 多个模型提交,参数规模从 1B 到 70B 以上,来自 180 多个机构,其中超 70% 为 chat 与微调模型,11% 为预训练模型。
OpenAI 在 Super Bowl 投放首支电视广告,旨在激发人们对 AI 的好奇心。广告传递 AI 能开启新可能、丰富生活并提升生产力的理念,类比此前各类工具对人类社会的推动。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与 Flash Answers 等能力清单,可据此判断其与现有助手的差异。
OpenAI 面向欧洲客户推出数据驻留功能,允许将数据存储在欧洲本地。该功能建立在 OpenAI 面向全球客户的企业级数据隐私、安全与合规体系之上。
OpenAI 宣布与加州州立大学(CSU)系统合作,将 ChatGPT 提供给 50 万名学生和教职员工,称这是迄今规模最大的一次 ChatGPT 部署。该合作旨在扩大 AI 在教育中的使用,并帮助美国培养具备 AI 能力的劳动力。
推荐理由:OpenAI 与加州州立大学系统合作,把 ChatGPT 铺进 50 万师生,是观察 AI 进校园规模的一个样本。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出 PyTorch 版本与模型合集。
推荐理由:Physical Intelligence 的 π0 与 π0-FAST 被移植进 LeRobot,读者可据此了解 VLA 与 VLM 在动作表示上的差异。
OpenAI 发文介绍如何用 ChatGPT 辅助钓大比目鱼。
OpenAI 介绍如何基于 ChatGPT 构建自定义数学辅导工具。文章以“ChatGPT 与个性化辅导”为主题,说明 ChatGPT 可用于提供个性化学习辅导。原文未披露具体模型版本、参数规模或可用性细节。
Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在复杂数据分析上的差距。任务结合结构化与非结构化数据,采用二元事实性评测,仅需代码执行环境即可运行并提交排行榜。
OpenAI 展示了用 ChatGPT 为美甲设计寻找灵感的方式。用户可借助 ChatGPT 获取美甲创意灵感。
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 所需的智能体框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research,给出开源框架与 GAIA 实测对比,可看代码智能体相对 JSON 智能体的差距。
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该工具帮助这家咨询公司分析复杂行业趋势。