Google Research·· 2026-08-12AI 评分36
Google 研究:召回而非编码是前沿 LLM 事实性的瓶颈
Empty shelves or lost keys? Recall is the bottleneck for parametric factuality
AI 导读
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。
来源:Google Research · research.google