Simon Willison 回顾 2026 年 LLM 进展:从 Claude Opus 4.5 到 OpenClaw
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
Simon Willison 在 2026 年 9 月 24 日的笔记中表示,与编程智能体合作越多,越确信它们让软件工程变得更难。他认为借助智能体可以完成惊人的工作,但释放其全部潜力需要极高的纪律性和知识储备。
一名入职大公司半个月的员工称,团队所有规格、代码、测试、PRD、工单及其处理、报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。团队无人喜欢这种方式,却被要求尽可能多地产出,管理层多次表示推代码不是瓶颈、质疑为何还慢,员工每天工作 12 到 13 小时只为按回车,没有人阅读任何产出内容。
GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未死亡,检索能让模型从更接近答案的位置起步,减少 token 浪费和不完整回答。
OpenAI 披露内部编码智能体的早期使用数据,涵盖智能体使用情况、实验速度、任务复杂度与研究加速等方面。这些数据展示了编码智能体正在重塑 OpenAI 内部的 AI 研究方式。
Import AI 464 汇总多项进展:Fable 在 KernelBench-Mega 上写出首个 megakernel,用 CUDA 在 RTX PRO 6000 Blackwell 上实现 18.71X 加速,对比 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,目标两三年内扩至 40-80 名全职员工,初期拟募资 1 亿至 1.5 亿美元,研究方向包括可扩展监督、学习理论、启发式论证、博弈论与 personas。
OpenAI 宣布不再评估 SWE-bench Verified,原因是该基准日益受到污染,且无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷与训练数据泄漏问题,并建议改用 SWE-bench Pro。