Graphite 研究:Claude Opus 5.5 最爱说“this matters”,GPT 模型写作特征反而更偏离人类
Graphite 研究发现 Claude Opus 5.5 最显著的写作特征是“this matters”,出现频率是人类的 116 倍,“dependable”则是人类的 23 倍;OpenAI 的 Astra 偏爱“not simply X”式纠正性框架,频率超人类 100 倍。
Graphite 研究发现 Claude Opus 5.5 最显著的写作特征是“this matters”,出现频率是人类的 116 倍,“dependable”则是人类的 23 倍;OpenAI 的 Astra 偏爱“not simply X”式纠正性框架,频率超人类 100 倍。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明某个有意义的门槛已被跨过。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重实现软件的能力,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2-17 周的任务。
牛津大学、英国 AI 安全研究院、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
Google 与康奈尔大学在《PNAS》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。