Intel 推出 AutoRound:面向 LLM 与 VLM 的先进量化工具
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Meta 发布 Llama Guard 4,一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,可检测图像与文本输入输出中的不当内容,单张 24GB 显存 GPU 即可运行。
推荐理由:Meta 发布 12B 多模态安全模型与两款提示注入分类器,并给出可直接运行的 transformers 示例。
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由:ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
Hugging Face 发布 Tiny Agents 教程,展示如何用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体。
推荐理由:作者用 50 行代码演示 MCP 客户端与智能体的最小实现,读者可据此理解工具调用如何接入推理客户端。
ChatGPT for Business 迎来 2025 年 4 月更新,新增 o3、图像生成、增强记忆和内部知识四项能力。官方同步放出这些功能的上手演示。
OpenAI 将最新图像生成模型以 gpt-image-1 的名称开放到 API,开发者和企业可将其集成到自有工具和平台中,生成专业级、可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有产品的图像生成集成路径。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调版可完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
Speak 正在用 AI 为语言学习做个性化。OpenAI 与 Speak CEO 兼联合创始人 Connor Zwick 就此展开对话。
《华盛顿邮报》与 OpenAI 达成合作,将其新闻内容整合进 ChatGPT,为用户提供摘要、引语和原文报道的直接链接。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。
OpenAI 发布 o3 和 o4-mini 系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:官方系统卡披露 o3 与 o4-mini 的推理与工具调用组合,可据此了解新模型的能力边界。
OpenAI 发布 o3 和 o4-mini 两款模型,称其为目前最智能、能力最强的模型,并具备完整的工具调用能力。
推荐理由:OpenAI 发布 o3 与 o4-mini 两款推理模型,并首次给出完整工具调用能力,读者可据此了解其推理产品线的最新分层。
Hugging Face 发文列举 Gradio 的 17 项特性,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习应用框架。
Hugging Face 发布 HELMET 基准,用于全面评估长上下文语言模型,覆盖多样性、可控性与可靠性,已评测 59 个近期 LCLM。该基准指出困惑度和 NIAH 等合成任务与真实下游表现相关性差,复杂合成任务(如 RULER MV)相关性更高,并已被 Microsoft Phi-4 和 AI21 Jamba 1.6 采用。
Cohere 正式接入 Hugging Face Inference Providers,成为首个直接在 HF Hub 上分享并托管自家模型的模型厂商。
OpenAI 任命四位新顾问,为其慈善事业提供建议。该委员会旨在为 OpenAI 的非营利公益方向提供指导。
OpenAI 发布更新版 Preparedness Framework,用于衡量并防范前沿 AI 能力带来的严重危害。该框架聚焦前沿 AI 能力的风险评估与防护措施。
OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解方面均有提升。该系列同时包含 OpenAI 首个 nano 模型,即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的能力变化与可用范围。
Protect AI 与 Hugging Face 合作半年,截至 2025 年 4 月 1 日已扫描 Hugging Face Hub 上 141 万个仓库中的 447 万个模型版本,在 5.17 万个模型中识别出 35.2 万个不安全或可疑问题。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其机器人布局与 Reachy 2 的定位。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra 大语言模型扩展至图像和视频,基于 7B 基础模型,集成 Google SigLIP-So400m 编码器与 2 层 MLP projector,采用四阶段训练和 late-fusion 架构。
OpenAI 推出 BrowseComp,一个面向浏览智能体(browsing agents)的基准测试。该基准用于评估智能体在浏览任务上的表现,具体评测指标与可用性细节尚未在原文中披露。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集取平均得到加权总分。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和阿拉伯语指令遵循两个榜单。
OpenAI 发布欧盟经济蓝图,提出一套政策建议,旨在帮助欧洲把握人工智能机遇、推动区域可持续经济增长,并确保 AI 由欧洲开发、在欧洲部署、为欧洲服务。
Canva 联合创始人兼首席产品官 Cameron Adams 与 OpenAI 对话,讲述 Canva 如何借助 AI 赋能创意设计。
Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持多模态,已在 Hugging Face Hub 上线。
推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的参数、上下文长度与架构细节,可据此判断部署门槛。
Gradio 月活开发者已超过 100 万,成为 Automatic1111、Text Generation WebUI、Dall-E Mini、LLaMA-Factory 等热门开源项目的界面方案。
Hugging Face 将已有 3 年历史的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 DeepSeek R1 等推理模型的章节。
TNG Technology Consulting 分享了自托管 LLM 服务中请求排队导致"重度用户"阻塞其他用户的问题,提出在 LLM-Server 层为每个用户和模型建立独立队列并采用轮询调度实现公平分配。由于 vLLM 不支持限制后端队列长度,方案通过抓取 vLLM /metrics 端点的 Prometheus 指标动态调节请求发送速率,将后端队列长度控制在 3 以下以降低新用户延迟。
OpenAI 宣布成立新委员会,为其打造全球装备最完善的非营利组织提供洞察。OpenAI 本身已是非营利组织,并已用 AI 帮助人们解决难题,目标是结合潜在历史性财务资源与可扩展人类创造力的技术。
OpenAI 推出 PaperBench,用于评估 AI 智能体复现前沿 AI 研究的能力。该基准衡量智能体能否从零复现最先进的 AI 研究成果。
OpenAI 就英国版权咨询提交回应,提出有利于创新的政策建议,目标是帮助英国成为欧洲的 AI 之都。
OpenAI 宣布获得 400 亿美元新融资,投后估值 3000 亿美元。资金将用于推进 AI 研究前沿、扩展算力基础设施,并为每周使用 ChatGPT 的 5 亿人提供更强的工具。
推荐理由:OpenAI 公布 400 亿美元融资与 3000 亿美元投后估值,读者可据此了解其算力扩张与 ChatGPT 用户规模。
Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以应对多云环境下的 secret sprawl、权限管理和手动轮换难题。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,同时用 CLI 替代本地 .env 文件。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 TGI 主代码库,不再需要维护独立的 tgi-gaudi 分支。
OpenAI 提出从基于意图的机器人转向主动式 AI 智能体。原文未披露具体模型版本、参数规模或可用性信息。
DeepSeek 本周在 Hugging Face Hub 上线 DeepSeek-V3 0324,这是 R1 推理模型基座 DeepSeek-V3 的更新版本,架构不变但改用 MIT 许可,此前 V3 使用自定义模型许可。
推荐理由:梳理 DeepSeek-V3 0324 的基准提升与 MIT 许可变化,并给出多种本地部署与量化运行方式。
OpenAI 发文阐述其在通往 AGI 道路上的安全思路,强调主动适应,并将全面的安全措施直接构建进基础设施与模型之中。