Google DeepMind 首次对 Gemini Flash Lite 开展双盲 AI 评测
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 进行双盲评测,将外部评测限制在加密“黑箱”中,防止测试题被模型提前获取用于优化性能。该方案在隐私保护环境下用保密基准测试模型,以缓解基准污染、提升评测可信度。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 进行双盲评测,将外部评测限制在加密“黑箱”中,防止测试题被模型提前获取用于优化性能。该方案在隐私保护环境下用保密基准测试模型,以缓解基准污染、提升评测可信度。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比表现最好的 GluFormer 变体高 5.8 个百分点,并在 Dexcom 与 Libre 两款 CGM 设备上取得最低 MAE。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等可核验指标,并说明开发者与消费端入口,便于判断语音转写能力边界。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,用于 ColBERT 式后期交互检索,并配套完整训练方案。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自建领域检索模型的门槛与取舍。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。
IBM 发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:IBM 公开了 Granite 4.2 从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
Hugging Face 在 Gradio 中推出 gr.Workflow,把多步 AI 流水线描述为带类型的节点图,并直接提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点图、REST 端点和一键部署路径,读者可据此判断多步 AI 流水线如何落地。
Mistral 与 HUMAIN 宣布达成战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,合作规模达数亿欧元。双方将优先聚焦网络安全与语音领域,并计划开发阿拉伯语表现强劲的前沿模型,Mistral 还将探索使用 HUMAIN 的数据中心基础设施。双方计划在沙特制定联合市场策略,面向受监管行业提供 AI 解决方案。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数(步数除以静息心率)等新复合特征。
Google DeepMind 回顾 15 年游戏 AI 研究历程,从 DQN 玩 49 款 Atari 游戏、AlphaGo 击败李世石,到 AlphaStar 达到《星际争霸 II》宗师级水平。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足的问题。
Papers with Code 用 Hugging Face Jobs、Storage Buckets 和 Inference Endpoints 搭建了一套混合搜索系统,为超过 11 万篇 arXiv 与 Daily Papers 论文维护嵌入向量。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。
推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:官方给出三款 LFM2.5 草稿模型的加速数据与 llama.cpp、SGLang 接入方式,可据此评估端侧推理提速的落地成本。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、打开、导航、阅读和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它相对一次性 RAG 的取舍。
Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,让任何人都能把想法变成可运行的软件,无需担心 token 成本。
推荐理由:Replit 推出由 GPT-5.6 Luna 驱动的免费模式,读者可了解软件创建门槛与 token 成本的变化。
OpenAI 发起一项计划,旨在加强国家安全领域 AI 的民主监督,通过工具、培训和专业知识为政府机构提供支持。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型横评显示智能体记忆的合适剂量随模型能力分层,并给出检索与提示词缓存的成本对照。
OpenAI 正在加强前沿 AI 模型的监控、对齐与安全防护,并以新的保障措施引导模型开发节奏。该说明围绕网络关键能力时代的模型开发步调展开,强调监控、对齐和安全三方面的强化。
OpenAI 与 CodeAI 达成合作,帮助学生建立 AI 素养、批判性思考 AI,并培养负责任地使用和塑造 AI 的技能。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 构建了约束感知 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,同硬件同负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在每个场景均上升、最高增长 105%。
Google Research 提出 PhotoScan,一个从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google 用手机照片估算体成分并预测胰岛素抵抗,给出了与 DXA 的误差对比和分类指标,可看非侵入筛查的可行性边界。
OpenAI 宣布加入 PORTS-Pike 项目,扩大社区投资并支持俄亥俄州南部数千个就业岗位。该项目是 OpenAI 社区投资布局的一部分。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型累计下载不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,可看到中美实验室规模路线与下载依赖的分野。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets,再通过 stream_dataset 直接从 Hub 流式读取训练,无需完整下载,最后仅改一个关键字参数即可将 checkpoint 部署回硬件。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的升级幅度。
OpenAI 发布 GPT-5.6 构建者指南,介绍初创公司如何借助更智能的模型选择与新版 Responses API 能力,构建更快、更具成本效益的 AI 智能体。
OpenAI 预览新的 API 服务档 Ultrafast,运行 GPT-5.6 Sol 时最高提速 14 倍。该服务由 Cerebras 提供支持,输出速度最高可达每秒 750 个 token。
OpenAI 任命 Dali Rajic 为首席营收官,负责领导其全球营收组织,帮助企业在 AI 上实现完整价值。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占大会论文总数的 34%。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体分工。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时间范围、编码器变体和分辨率,获得 Cloud-Optimized GeoTIFF(COG)输出。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型的拓扑推理能力,覆盖连通性、封闭性、顺序、分离与绳结五类关系,并区分静态推理与交互规划两个层级。测试显示,当前模型在静态识别上明显优于交互规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧保留结构约束时才有帮助。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方披露了 SL2T 的训练规模、隐私设计与基准成绩,可据此判断手语翻译进入消费级产品的可行边界。
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。
RingCentral 借助 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程与运营之间集中化运营智能。该实践覆盖从工程到运营的 AI 原生工作流程建设。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,可感知非语言线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:Google 公布 AMIE 视频版在 300 场随机 OSCE 中与初级保健医生评分相当,并给出异步多智能体架构与局限说明。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光 VLM,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。