跳到正文

#RAG

今日 0 条
9月30日周三
  1. AWS Machine Learning Blog34

    用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 合同智能平台

    针对 RAG 只能检索 top-k 文本块、无法跨数百份合同做聚合的问题,AWS 给出了一套合同智能平台架构:用 Claude Sonnet 系列模型做 AI 提取智能体,从每份 PDF 中抽取 8 个关键字段并附置信度,再由 Claude Haiku 驱动的验证智能体独立复核,签名识别分歧时由 Amazon Textract 用计算机视觉做确定性裁决。

9月29日周二
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 五大热梗:该不该读 AI 代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未死亡,检索能让模型从更接近答案的位置起步,减少 token 浪费和不完整回答。

9月3日周四
8月26日周三
8月21日周五
8月20日周四
  1. Mistral AI66

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、打开、导航、阅读和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断它相对一次性 RAG 的取舍。

8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

6月23日周二
  1. Mistral AI66

    Mistral 发布 OCR 4,支持边界框、块分类与置信度输出

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度,支持 170 种语言,可单容器自托管部署。官方称独立标注者在 600+ 份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高分。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和定价细节,便于判断其在 RAG 与智能体流程中的接入方式。

6月5日周五
6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B 参数 MoE 模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其相比同规模模型推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景,模型已在 Hugging Face 开放下载。

    推荐理由:JetBrains 给出 Mellum2 的参数量、激活规模与推理速度,读者可据此判断它在多模型系统中的定位。

5月28日周四
  1. Mistral AI62

    Mistral AI 发布 Search Toolkit 公开预览版

    Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,开源并可在云端、本地和边缘运行。它把摄取、检索和评测统一到共享接口下,内置 BM25 稀疏检索、稠密向量检索与混合配置,并提供 recall、precision、MRR、NDCG 等评测指标。

    推荐理由:Mistral 把检索管线的摄取、检索与评测收进同一框架,读者可据此判断自建 RAG 的集成成本是否被压缩。

5月19日周二
5月18日周一
5月15日周五
4月16日周四
4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

    Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。

4月9日周四
  1. Hugging Face Blog60

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 下编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此评估跨模态检索的落地成本。

3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。

    推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。

3月17日周二
10月1日周三
  1. Hugging Face Blog34

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估嵌入模型在真实应用中的检索准确率。RTEB 采用开放与私有数据集混合策略,私有部分由 MTEB 维护者评测,以暴露模型在未见数据上的过拟合。基准覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10,每个数据集至少含 1k 文档和 50 条查询。

9月4日周四
  1. Hugging Face Blog60

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一款面向端侧场景的多语言文本嵌入模型,参数量 308M,上下文窗口 2K,支持超过 100 种语言。该模型基于 Gemma3 骨干改为双向注意力,输出 768 维向量并支持 MRL 截断到 512、256 或 128 维,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文和量化后 200MB 内存等规格,读者可据此判断端侧 RAG 的落地边界。

7月1日周二
5月28日周三
  1. Mistral AI62

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索场景中明显优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度可调的取舍方式,便于评估检索成本。

5月27日周二
  1. Mistral AI72

    Mistral 发布 Agents API,内置连接器与 MCP 工具

    Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、web search 等内置连接器及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。

    推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,以及带 web search 的 SimpleQA 对比数据,可据此判断企业级智能体平台的落地方式。

4月9日周三
3月26日周三
3月7日周五
  1. Mistral AI78

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错提取文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断它在文档解析与 RAG 流程中的位置。

2月13日周四
1月16日周四
  1. Mistral AI38

    Mistral AI 与法新社达成全球合作,Le Chat 接入 AFP 新闻内容

    Mistral AI 与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,让回答基于可靠、最新的信息。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2300 条新闻专线,覆盖其全球 1700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。

1月10日周五
  1. Hugging Face Blog42

    Hugging Face 发布 vdr-2b-multi-v1 多语言视觉文档检索嵌入模型

    Hugging Face 推出多语言嵌入模型 vdr-2b-multi-v1,可将文档页面截图编码为单向量,无需 OCR 即可跨语言检索视觉丰富的文档。该模型基于 MrLight/dse-qwen2-2b-mrl-v1,与 LlamaIndex 合作开发,覆盖意大利语、西班牙语、英语、法语和德语,并开源了 50 万样本的 vdr-multilingual-train 数据集。

12月19日周四
  1. Hugging Face Blog71

    Answer.AI 与 LightOn 发布 ModernBERT,为 BERT 提供现代替代方案

    Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作为 BERT 类模型的直接替代。

    推荐理由:ModernBERT 用现代 LLM 技术重做编码器,给出 8k 上下文与速度数据,可据此判断它能否替换现有 BERT 类模型。

10月28日周一
7月16日周二
  1. Hugging Face Blog22

    如何用 distilabel 打造 Argilla 2.0 聊天机器人

    Hugging Face 博客展示了如何用 distilabel 生成合成数据、微调领域专用嵌入模型,并为 Argilla 2.0 构建能理解技术文档的聊天机器人。流程包括将文档按约 256 token 分块、构建向量数据库,并将 Gradio 应用部署到 Hugging Face Space,交互记录存入 Argilla 用于持续评估改进。

7月9日周二
6月21日周五
  1. OpenAI News60

    OpenAI 收购 Rockset

    OpenAI 宣布收购 Rockset。Rockset 是一家提供实时检索与分析数据基础设施的公司,此次收购的具体金额和整合方式尚未在材料中披露。

    推荐理由:OpenAI 收购 Rockset 是其补齐检索与数据基础设施的一步,读者可据此观察其产品数据能力的走向。

6月7日周五
5月9日周四
3月22日周五
  1. Hugging Face Blog62

    Hugging Face 发布二值与标量嵌入量化方法,检索提速最高 45 倍

    Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。

    推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。