OpenAI 携手 Walton Family Foundation 等举办 Nonprofit Jam
OpenAI Academy 联合 Walton Family Foundation、Emerson Collective 及多家本地非营利组织举办 Nonprofit Jam,这是一场为期一天、覆盖 10 个地点、汇聚 1000 多名非营利组织领导者的全国性活动。
OpenAI Academy 联合 Walton Family Foundation、Emerson Collective 及多家本地非营利组织举办 Nonprofit Jam,这是一场为期一天、覆盖 10 个地点、汇聚 1000 多名非营利组织领导者的全国性活动。
Gradio 5.38.0 为 MCP Servers 带来五项改进:新增 "File Upload" MCP server 让智能体直接上传本地文件,支持实时进度通知,并可通过 gr.load_openapi 一行代码将 OpenAPI 规范转为 MCP 工具。
Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。
在 Gradio Agents & MCP Hackathon 期间构建的多 LLM 平台 Consilium,让多个 AI 模型围绕复杂问题展开结构化辩论并达成共识,同时提供可视化 Gradio 界面和可接入 Cline 的 MCP server。
Invideo AI 借助 OpenAI 的 GPT-4.1、gpt-image-1 和文本转语音模型,把创意想法在几分钟内转化为专业视频,创作速度提升 10 倍。
OpenAI 董事会就独立 OpenAI 非营利委员会的报告发表声明,感谢委员会成员所做的大量工作与投入。
Hugging Face 发布 Ettin Suite,这是首个用完全相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 到 1B。
Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此判断语音能力的部署与成本选择。
OpenAI 发文阐述 ChatGPT 的设计理念:有用、可信、可适配,让用户按自己的方式使用。文章标题为“Intellectual freedom by design”,强调知识自由是产品设计的出发点。
Hugging Face 官方宣布 Hub 存储后端从 Git LFS 迁移到 Xet,已有 50 万个仓库、20 PB 数据完成迁移,超过 100 万用户在用。迁移依靠 Git LFS Bridge 和后台迁移流程实现无硬切换,旧版客户端仍可正常上传下载。从本月起 Xet 将向所有用户开放,现有仓库会自动迁移,新仓库默认启用 Xet。
推荐理由:Hugging Face 官方复盘 Hub 从 Git LFS 迁移到 Xet 的工程细节,可了解大规模存储迁移如何做到对用户零打扰。
OpenAI 宣布加入欧盟 Code of Practice,推进负责任 AI,并与欧洲各国政府合作推动创新、基础设施与经济增长。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Numina 与 Kimi 团队发布 Kimina-Prover-72B 形式化定理证明模型,基于 Qwen2.5-72B 并用 Kimi k1.5 的 RL 流程训练,同时开源 8B 和 1.7B 蒸馏版本。
Hugging Face 发布博客详解异步机器人推理,将动作预测与动作执行解耦,让机器人在 PolicyServer 计算下一段动作时继续执行当前动作队列,从而消除推理等待。该方案在 SmolVLA 上实现约 2 倍任务完成提速,成功率相当,PolicyServer 与 RobotClient 通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use 智能体)。
推荐理由:Hugging Face 开源 ScreenEnv,给出 Docker 沙箱与 MCP 两种接入方式,可据此判断桌面智能体的部署路径。
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 及 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 模式,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 三种部署方式。
Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,Lite 版 399 美元、带板载计算与无线的 Compute 版 499 美元,均需另付税费和运费,预计约 90 天发货。
推荐理由:开源机器人 Reachy Mini 以 399 美元起售并接入 Hugging Face 模型库,读者可据此判断桌面级机器人实验的门槛与生态玩法。
Hugging Face 博客介绍如何通过 Gradio MCP 服务器为 LLM 增加新能力。Gradio 5.28.0 起支持 MCP 协议,Hugging Face Spaces 上数千个 AI 应用因此可作为 MCP 服务器接入 Cursor、Claude Code、Cline 等客户端。
Hugging Face 与 AMD 合作,为 MI300X GPU 编写了三个开源自定义 kernel——融合残差连接/RMS norm/FP8 转换、融合 SwiGLU 激活/FP8 转换以及 Skinny GEMM,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
OpenAI 与美国教师联合会(AFT)合作启动一项为期 5 年的计划,将为 40 万名 K-12 教育工作者提供支持,帮助他们在课堂中主导 AI 创新。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 think/no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:Hugging Face 公开了 SmolLM3 的完整训练配方与数据配比,读者可据此复现或改进 3B 级小模型的训练流程。
Hugging Face 以 nanoVLM 项目为例,分五个阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,随后依次采用受限填充、背包算法打包,并推出支持贪心与 binpack 策略的 ConstantLengthDataset,按 token 与图像数量打包样本。
Hugging Face 基础设施团队公开了支撑其生产环境的三大关键告警机制,包括 NAT 网关吞吐量告警和 Hub 请求日志归档成功率告警。NAT 网关告警在流量超过预设静态阈值时触发,用于发现异常流量峰值并优化成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成日志的采集、加工与存储。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,征集能在大语言模型早期训练阶段(约 200B tokens 以内)有效区分科学知识信号的评测基准。
Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新。该计划已在法国、卢森堡、新加坡、荷兰、英国、瑞士等国家落地,提供自托管、主权数据中心、SaaS 及 serverless API 等部署选项,确保数据主权并支持本地语言和文化的定制化模型研发。
Genspark 借助 GPT-4.1 和 OpenAI Realtime API 打造无代码个人智能体,45 天内做到 3600 万美元 ARR。该产品以无代码方式构建智能体,底层由 GPT-4.1 与 Realtime API 驱动。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,适合混合检索或先检索后重排场景。
OpenAI 与 Mandala Partners 联合发布面向澳大利亚的 AI 经济蓝图,提出一份清晰可执行的方案,阐述澳大利亚如何释放人工智能的完整经济与社会潜力。该蓝图发布之际,提升生产力已成为澳大利亚的国家优先事项。
NVIDIA 发布 Llama Nemotron Nano VL,一个 8B 视觉语言模型,面向智能文档处理,已在 Hugging Face 上架。
推荐理由:8B 视觉语言模型面向文档处理,给出了架构、训练数据与 OCRBench v2 表现,便于评估企业文档自动化选型。
Retell AI 基于 GPT-4o 和 GPT-4.1 打造 AI 语音自动化,正改变呼叫中心运营方式。其无代码平台让企业无需脚本即可部署自然、实时的语音智能体,从而降低通话成本、提升 CSAT 并自动处理客户对话。
Gemma 3n 正式在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库中可用,并发布 gemma-3n-E2B 与 gemma-3n-E4B 两个尺寸(各含 base 与 instruct 变体)。
推荐理由:原文给出 Gemma 3n 的端侧内存占用、多模态输入与各开源库接入方式,便于判断本地部署可行性。
AI GTM 平台 Unify 采用 OpenAI 的 o3、GPT-4.1 和 CUA,自动化完成潜客挖掘、调研与外联。借助超个性化消息和全天候工作流,Unify 帮助团队规模化生成销售管道,同时聚焦高价值客户互动。
SGLang 现已支持将 Hugging Face transformers 作为后端,可直接以高性能推理运行任意 transformers 兼容模型,无需原生适配。
Hugging Face 发布教程,介绍用 QLoRA 和 diffusers 库在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以内。在 RTX 4090 上,QLoRA 微调峰值显存约 9GB,而 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。
OpenAI 正在主动评估先进 AI 在生物学和医学领域的能力,并实施防护措施以防止滥用。该公司指出,先进 AI 虽能变革生物学与医学,但也带来生物安全风险。
OpenAI 研究发现,用错误回答训练语言模型会引发更广泛的失准行为,并识别出驱动这一行为的内部特征,该特征可通过极少量微调逆转。
Groq 现已作为 Inference Provider 接入 Hugging Face Hub,支持 Llama 4、Qwen QWQ-32B 等开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
OpenAI 推出 OpenAI for Government 计划,面向美国公共服务人员提供其最先进的 AI 工具,以支持美国政府采用一流技术并将这些工具用于公共服务。
TNG 在 24 块 H100 上自托管多个大语言模型,每日消耗超 1 亿 token、生成超 1000 万 token,发现 vLLM 默认 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求会阻塞后续请求,导致首 token 等待时间变长。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,为模型页面提供无服务器推理,并集成 JS 和 Python 客户端 SDK。