跳到正文

全部动态

今日 33 条
3月26日周四
  1. Google DeepMind60

    Google DeepMind 发布 AI 有害操纵测量工具包与万人实验结果

    Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。

3月25日周三
  1. Google Research29

    Google Research 推出 S2Vec:用自监督学习读懂城市建成环境

    Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,把建筑、道路等建成环境特征转成多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在人口密度、收入等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后效果普遍优于单一模态;但在树木覆盖、海拔等环境任务上仍需改进。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可生成带情感表达的语音。

    推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开与 ElevenLabs 的人工对比结果。

3月23日周一
3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。

    推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。

3月19日周四
3月18日周三
  1. Mistral AI62

    Mistral AI 推出企业级模型构建系统 Forge

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。该平台以 Agent 优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。

    推荐理由:Forge 把预训练、后训练与强化学习打包成企业自建模型的入口,读者可据此判断企业级定制模型的落地路径。

3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 与 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,作为 GPT-5.4 的更小、更快版本。两者针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 在 GPT-5.4 之下补出 mini 与 nano 两档,读者可据此判断高并发与子智能体场景的选型空间。

  2. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。

  3. Mistral AI62

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。

3月16日周一
3月13日周五
3月12日周四
  1. Google Research71

    Google 在 Flood Hub 上线城市山洪预警,提前 24 小时预测

    Google 宣布在 Flood Hub 上线城市山洪(Urban Flash Flood)预报,可提前最多 24 小时预测城市山洪风险。由于山洪常发生在远离水文站的地方、缺乏地面真值数据,Google 用名为 Groundsource 的方法,借助 Gemini 分析公开新闻报道确认洪水事件的地点与时间,构建历史山洪数据集来训练和评估新模型。

    推荐理由:Google 用 Gemini 从新闻中提取历史洪水事件训练模型,把城市山洪预警提前到 24 小时,并给出与 NWS 的对比数据。

  2. Google Research62

    Google 推出 Groundsource:用 Gemini 将新闻报道转为灾害数据

    Google Research 推出 Groundsource,一种利用 Gemini 从非结构化全球新闻中提取历史灾害数据的方法,并发布首个开放数据集,包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 做数据抽取的可行性。

  3. Google Research66

    Google 与 BIDMC 开展对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。

    推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署对话式诊断 AI,读者可了解其安全监督机制与医患反馈。

3月11日周三
  1. Mistral AI48

    Mistral 用 Vibe 构建自动写 RSpec 测试的 Rails 智能体

    Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源码文件、生成或改进 RSpec 测试,并在 CI/CD 流水线中无需人工干预地运行。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件以及 Rubocop、SimpleCov 校验工具运作,仅靠一份 markdown 指令文件就将质量分从 0.68 提升至 0.74。

3月10日周二