跳到正文

全部动态

今日 11 条
4月8日周三
4月6日周一
4月3日周五
  1. Google Research40

    Google Research 评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。

4月2日周四
  1. OpenAI News62

    OpenAI 收购 TBPN

    OpenAI 宣布收购 TBPN,以加速围绕 AI 的全球对话并支持独立媒体,扩大与开发者、企业和更广泛科技社区的交流。

    推荐理由:OpenAI 收购 TBPN 以扩大 AI 对话与独立媒体支持,读者可了解其媒体与社区布局。

4月1日周三
  1. Hugging Face Blog60

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词表定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干感知路线相对模块化管线的取舍。

  2. Hugging Face Blog62

    Gradio 推出 gradio.Server,支持任意自定义前端搭配其后端

    Hugging Face 发布 gradio.Server,它扩展自 FastAPI,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端搭配 Gradio 的队列、SSE 流式、并发控制和 gradio_client 兼容能力。

    推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一款面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可并在 Hugging Face 上线。

    推荐理由:Granite 4.0 3B Vision 以 3B 规模在图表与表格抽取基准上超过更大模型,并给出 LoRA 适配器与 Docling 集成路径。

  2. OpenAI News68

    OpenAI 完成 1220 亿美元新融资

    OpenAI 宣布获得 1220 亿美元新融资,用于在全球扩展前沿 AI、投资下一代算力,并满足 ChatGPT、Codex 和企业级 AI 不断增长的需求。

    推荐理由:OpenAI 披露 1220 亿美元新融资及资金投向,读者可据此了解其算力与产品扩张的资金规模。

  3. Mistral AI40

    Mistral AI 推出 Spaces:一款为人类和 AI 智能体打造的 CLI

    Mistral AI 发布 Spaces CLI,同时面向人类开发者和编码智能体。该工具通过 `spaces init`、`spaces dev` 等命令,三条命令即可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。每个交互式提示都有对应的 flag 等价物,并在每次 init 时生成 context.json 和 AGENTS.md,让智能体无需人工干预即可自主完成配置与部署。

  4. Hugging Face Blog22

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

  5. Google Research66

    Google 发布白皮书:量子计算机破解加密货币加密所需资源大幅降低

    Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。

    推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。

  6. Hugging Face Blog62

    Hugging Face 发布 TRL v1.0 后训练库

    Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为带明确稳定性契约的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。

    推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型。

3月30日周一
3月29日周日
  1. Google DeepMind52

    Google DeepMind 为 AI 时代重新设计鼠标指针

    Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。

3月28日周六
3月27日周五
3月26日周四
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者与普通用户的使用入口。

  2. Google DeepMind60

    Google DeepMind 发布 AI 有害操纵测量工具包与万人实验结果

    Google DeepMind 发布关于 AI 有害操纵的新研究,称其为首个经实证验证的测量工具包,并公开运行同类人类受试者研究所需的全部材料。研究覆盖英国、美国、印度共九项实验、超过 10000 名参与者,聚焦金融与健康等高风险场景,结果显示 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功无法预测另一个领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵测量工具包,并给出跨英、美、印三国万人实验的关键结论。

3月25日周三
  1. Google Research29

    Google Research 推出 S2Vec:用自监督学习读懂城市建成环境

    Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,把建筑、道路等建成环境特征转成多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在人口密度、收入等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单模型,与图像嵌入做多模态融合后效果普遍优于单一模态;但在树木覆盖、海拔等环境任务上仍需改进。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可生成带情感表达的语音。

    推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开与 ElevenLabs 的人工对比结果。

3月23日周一
3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。

    推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。

3月19日周四