OpenAI 在亚洲推出数据驻留功能
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上水平,成本为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,读者可据此判断企业选型的成本与落地条件。
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。
圣安东尼奥马刺队正在使用定制 GPT 提升球迷互动、简化运营并推动各团队创新。该案例展示了 ChatGPT 在职业体育场景中,从球迷服务到内部流程的落地方式。
Lowe's 与 OpenAI 合作构建了 Mylow 和 Mylow Companion,这两款 AI 工具为顾客和门店员工提供专家级帮助,让复杂的家装项目更易规划、推进和完成。
OpenAI 推出 OpenAI for Countries 新计划,旨在支持希望基于民主 AI 基础设施进行建设的各国。该计划面向全球有意愿的国家,具体支持方式与可用范围尚未在原文中披露。
OpenAI 推出 AI stories,通过展示人们日常使用 AI 获得的收益,指向科学、医学、教育、国防等领域更大的机遇。Sam Altman 此前撰文称人类正进入 Intelligence Age,AI 将帮助人们变得更有能力,让当今最难的问题变得可解。
John Deere 的 Justin Rose 分享了公司如何借助 AI 改造农业,并规模化创新,帮助农民更智能、更高效、更可持续地作业。
OpenAI 董事会发布更新,宣布将其营利实体转型为公益公司(Public Benefit Corporation),在非营利监督下强化使命驱动的架构,以便扩大影响并长期与公共利益保持一致。
推荐理由:OpenAI 董事会披露营利实体转为公益公司的治理调整,读者可了解其非营利监督架构的延续方式。
Lowe's 高级副总裁 Chandhu Nair 分享了这家家居装修零售商如何利用 AI 推动零售业务。Nair 负责 Lowe's 的数据、AI 与创新业务。
OpenAI 就模型谄媚(sycophancy)问题发布进一步说明,复盘此前发现中的疏漏、出错原因,并公布将做出的后续调整。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,设为 false 时模板插入空对以跳过逐步思考,而 QwQ 等旧模型强制每轮生成思维链。
Hugging Face 发布教程,介绍如何用 Gradio 在几行 Python 代码内把应用变成 MCP Server,供 LLM 作为工具调用。只需在 launch() 中设置 mcp_server=True,Gradio 就会自动把函数转成 MCP 工具,并用 docstring 生成工具描述和参数,MCP 端点位于 /gradio_api/mcp/sse。
推荐理由:原文给出用 Gradio 把 Python 函数变成 MCP 工具的完整步骤,读者可据此把自有应用接入 LLM 工具调用。
OpenAI 已回滚上周的 GPT-4o 更新,ChatGPT 用户现在使用行为更平衡的早期版本。被移除的更新过度奉承或顺从,常被描述为谄媚。
推荐理由:OpenAI 官方说明回滚 GPT-4o 更新的原因,读者可了解模型行为调整的决策过程。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Meta 发布 Llama Guard 4,一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,可检测图像与文本输入输出中的不当内容,单张 24GB 显存 GPU 即可运行。
推荐理由:Meta 发布 12B 多模态安全模型与两款提示注入分类器,并给出可直接运行的 transformers 示例。
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由:ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
Hugging Face 发布 Tiny Agents 教程,展示如何用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体。
推荐理由:作者用 50 行代码演示 MCP 客户端与智能体的最小实现,读者可据此理解工具调用如何接入推理客户端。
ChatGPT for Business 迎来 2025 年 4 月更新,新增 o3、图像生成、增强记忆和内部知识四项能力。官方同步放出这些功能的上手演示。
OpenAI 将最新图像生成模型以 gpt-image-1 的名称开放到 API,开发者和企业可将其集成到自有工具和平台中,生成专业级、可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有产品的图像生成集成路径。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调版可完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
Speak 正在用 AI 为语言学习做个性化。OpenAI 与 Speak CEO 兼联合创始人 Connor Zwick 就此展开对话。
《华盛顿邮报》与 OpenAI 达成合作,将其新闻内容整合进 ChatGPT,为用户提供摘要、引语和原文报道的直接链接。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。
OpenAI 发布 o3 和 o4-mini 系统卡,称两款模型将前沿推理能力与完整工具能力结合。可用工具包括网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆。
推荐理由:官方系统卡披露 o3 与 o4-mini 的推理与工具调用组合,可据此了解新模型的能力边界。
OpenAI 发布 o3 和 o4-mini 两款模型,称其为目前最智能、能力最强的模型,并具备完整的工具调用能力。
推荐理由:OpenAI 发布 o3 与 o4-mini 两款推理模型,并首次给出完整工具调用能力,读者可据此了解其推理产品线的最新分层。
Hugging Face 发文列举 Gradio 的 17 项特性,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习应用框架。
Hugging Face 发布 HELMET 基准,用于全面评估长上下文语言模型,覆盖多样性、可控性与可靠性,已评测 59 个近期 LCLM。该基准指出困惑度和 NIAH 等合成任务与真实下游表现相关性差,复杂合成任务(如 RULER MV)相关性更高,并已被 Microsoft Phi-4 和 AI21 Jamba 1.6 采用。
Cohere 正式接入 Hugging Face Inference Providers,成为首个直接在 HF Hub 上分享并托管自家模型的模型厂商。
OpenAI 任命四位新顾问,为其慈善事业提供建议。该委员会旨在为 OpenAI 的非营利公益方向提供指导。
OpenAI 发布更新版 Preparedness Framework,用于衡量并防范前沿 AI 能力带来的严重危害。该框架聚焦前沿 AI 能力的风险评估与防护措施。
OpenAI 在 API 中推出 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解方面均有提升。该系列同时包含 OpenAI 首个 nano 模型,即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的能力变化与可用范围。
Protect AI 与 Hugging Face 合作半年,截至 2025 年 4 月 1 日已扫描 Hugging Face Hub 上 141 万个仓库中的 447 万个模型版本,在 5.17 万个模型中识别出 35.2 万个不安全或可疑问题。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其机器人布局与 Reachy 2 的定位。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra 大语言模型扩展至图像和视频,基于 7B 基础模型,集成 Google SigLIP-So400m 编码器与 2 层 MLP projector,采用四阶段训练和 late-fusion 架构。
OpenAI 推出 BrowseComp,一个面向浏览智能体(browsing agents)的基准测试。该基准用于评估智能体在浏览任务上的表现,具体评测指标与可用性细节尚未在原文中披露。
Mistral 提出用 LLM as a Judge 评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分,再对评测数据集取平均得到加权总分。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和阿拉伯语指令遵循两个榜单。
OpenAI 发布欧盟经济蓝图,提出一套政策建议,旨在帮助欧洲把握人工智能机遇、推动区域可持续经济增长,并确保 AI 由欧洲开发、在欧洲部署、为欧洲服务。