Simon Willison 回顾 2026 年 LLM 进展:从 Claude Opus 4.5 到 OpenClaw
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
Simon Willison 在 WeAreDevelopers World Congress North America 的主题演讲中,按时间线梳理了 2026 年 LLM 的关键进展。
NVIDIA 提出 AI 安全是工程问题,需在 Agent 栈每一层落实可执行边界、明确责任人和验证证据。其开源安全运行时 NVIDIA OpenShell 在智能体可控范围之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描并校验智能体技能。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型累计下载不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,可看到中美实验室规模路线与下载依赖的分野。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。
Hugging Face 发布《State of Open Source on Hugging Face: Spring 2026》,基于平台数据回顾过去一年开源 AI 生态变化。
推荐理由:Hugging Face 用平台数据勾勒开源 AI 一年变化,中国模型下载占比与机器人数据集增长是两条主线。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;Kimi K2、GLM-4.5、MiniMax M2 等模型相继开源,Kimi K2 被广泛称为"另一个 DeepSeek 时刻"。
中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。
DeepSeek 于 2025 年 1 月发布 R-1 模型,一年后成为 Hugging Face 史上获赞最多的模型,其 MIT 许可让推理能力可下载、蒸馏和微调,推动中国开源 AI 生态成型。
Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。
Hugging Face 发布首期《AI 艺术工具通讯》,回顾 2024 年创意 AI 关键进展并预告将推出月度汇总。
Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体基于 LLM 构建,能自主拆解目标并执行子任务,其自主性可按从"模型不影响程序流程"到"模型自行编写并执行代码"分为多个等级。文章认为系统自主性越高、用户让渡的控制权越多,安全、隐私等风险越大,因此建议不要开发完全自主的 AI 智能体,而半自主智能体在风险与收益之间可能更可取。
Hugging Face 回顾 2023 年开源 LLM 进展,指出公众对开源与闭源之争的关注度大幅上升。文章梳理了预训练大模型的构成要素,包括架构、训练数据、tokenizer、训练超参数与模型权重,并回顾 2022 年的代表模型:176B 参数的 BLOOM、175B 参数的 OPT 以及 GLM-130B。
Hugging Face 的 Ethics and Society Newsletter 第二期聚焦机器学习中的偏见问题,指出偏见普遍且复杂,单一技术手段难以有效解决。文章梳理了偏见如何从 ML 系统演变为个人与社会风险,并介绍了 Hugging Face 团队在数据集与模型等环节开发的偏见分析工具。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息、在医疗、法律、金融和移民等高风险领域的不谨慎使用,以及各类歧视性内容。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间有时会相互冲突,需逐案权衡。
Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了他为 transformers 库开发的功能:将 PyTorch 模型导出为 ONNX 格式,只需一行代码即可完成转换,从而获得更低的延迟和更高的吞吐量。他还与 Leandro von Werra 合著了《NLP with Transformers》一书,并谈到大规模模型评估等话题。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾创立并联合领导 Google 伦理 AI 团队,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。
Hugging Face 发文质疑微软与 NVIDIA 发布的 Megatron-Turing NLG 530B 这类超大模型趋势,指出复现该实验需花费近 1 亿美元,且训练 BERT 的碳排放已相当于一次跨美飞行。文章主张改用预训练模型、更小模型(如 DistilBERT 保留 97% 语言理解能力、体积小 40%、速度快 60%)和微调等务实方案。
Hugging Face 发文称机器学习正走向“代码化”,主张用软件工程与 DevOps 的成熟实践(版本管理、可复用、可测试、自动化、部署与监控)来构建生产级 ML 系统,即 MLOps。