跳到正文

全部动态

今日 8 条
1月28日周三
  1. Google Research62

    Google Research 论文:智能体系统规模化何时有效、为何有效

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族,挑战了“智能体越多越好”的假设。

    推荐理由:通过 180 种智能体配置的对照评测,给出多智能体架构在并行与顺序任务上的量化差异,可作为架构选型参考。

  2. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 驱动

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式和自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与定价入口,可据此判断终端编码智能体的工作流变化。

1月27日周二
  1. Hugging Face Blog28

    中国开源 AI 生态的架构选择:超越 DeepSeek 之后

    中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。

  2. Hugging Face Blog22

    Hugging Face 发布 Alyah 基准,评估阿拉伯语 LLM 的阿联酋方言能力

    Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。

1月26日周一
1月24日周六
  1. Google Research31

    Google Research 推出 GIST:智能采样的下一阶段

    Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在图像分类等任务上超越现有基准,并首次为该多样性-效用权衡提供可证明的近似保证——所选子集价值至少达到最优解的一半。GIST 通过将多样性-效用问题拆解为一系列最大独立集问题,用双准则贪心算法在多个距离阈值上逼近求解。

1月23日周五
  1. Google Research32

    Google 研究:用小模型分解式方法实现更优用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出分解式意图提取方法:先用小型多模态 LLM 逐屏总结用户交互,再从摘要序列中提取意图,在移动端和网页轨迹上均优于 CoT 与端到端微调。该方法用 Gemini 1.5 Flash 8B 即可达到 Gemini 1.5 Pro 相当的效果,成本与速度更优,适用于端侧部署。

1月22日周四
1月21日周三
1月20日周二
  1. Hugging Face Blog62

    微软发布 Differential Transformer V2:差分注意力无需自定义 kernel

    微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。

    推荐理由:微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。

  2. Hugging Face Blog74

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,一个可通过文本、鼠标和键盘实时控制的交互式视频扩散模型,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。

    推荐理由:Waypoint-1 把实时交互视频扩散模型与配套推理库一并开源,读者可据此了解世界模型从预训练到低延迟部署的完整路径。

1月18日周日
1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。

    推荐理由:D4RT 把 4D 重建统一进单一查询式框架,效率提升幅度和实时应用场景是主要看点。

  2. OpenAI News72

    OpenAI 面向全球推出 ChatGPT Go

    OpenAI 宣布 ChatGPT Go 在全球上线,提供 GPT-5.2 Instant 的扩展访问、更高的使用额度和更长的记忆,定位是让先进 AI 在全球范围内更可负担。

    推荐理由:原文给出 ChatGPT Go 全球开放后的模型版本、用量与记忆变化,可据此判断低价档位的实际能力边界。

  3. Google Research36

    Google 研究:用 Pixel Watch 智能手表估算步速、步长等步态指标

    Google 提出基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 50 Hz IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。在 246 名参与者、约 7 万个步行片段的大规模验证中,多数指标达到 Pearson r >0.80、ICC >0.80,与 Pixel 6 手机估算结果无显著差异(p >0.05)。

1月15日周四
  1. Hugging Face Blog62

    Open Responses 开放推理标准发布:基于 Responses API 面向智能体

    OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API,面向智能体场景设计。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 试用早期访问版本。

    推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解 Responses API 开源化后的关键变化与迁移路径。