Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准
Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。
Google 与康奈尔大学在《PNAS》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估嵌入模型在真实应用中的检索准确率。RTEB 采用开放与私有数据集混合策略,私有部分由 MTEB 维护者评测,以暴露模型在未见数据上的过拟合。基准覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10,每个数据集至少含 1k 文档和 50 条查询。