Google Research 论文:智能体系统规模化何时有效、为何有效
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族,挑战了“智能体越多越好”的假设。
推荐理由:通过 180 种智能体配置的对照评测,给出多智能体架构在并行与顺序任务上的量化差异,可作为架构选型参考。