Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重实现软件的能力,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2-17 周的任务。
OpenAI 发布的新分析揭示了流行编码基准 SWE-Bench Pro 存在的问题,引发对其评估 AI 模型时可靠性与准确性的担忧。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 跨框架迁移中的表现,涵盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、102 个框架实现和 204 个迁移任务。测试显示,即便最强智能体行为成功率也不足 10%,且 Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成 STEM 选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码任务。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成真实世界的自由职业软件工程任务并赚取 100 万美元。该基准以真实报酬的软件工程任务为评测对象。
推荐理由:OpenAI 推出面向真实自由职业软件工程任务的基准,读者可了解前沿 LLM 在真实报酬任务上的表现。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经过人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均含 5.6 个测试用例、分支覆盖率 99%。
Hugging Face 上线 LiveCodeBench 排行榜,该基准由 UC Berkeley、MIT 和 Cornell 研究者开发,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。