跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

285条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 221–240 条 · 共 285 条
1月4日周四
1月2日周二
12月11日周一
  1. Hugging Face Blog62

    Hugging Face 详解混合专家模型 MoE

    Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。

    推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 与 AMD 合作:AMD GPU 开箱即用加速大语言模型

    Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。

    推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。

11月9日周四
  1. Hugging Face Blog80

    Hugging Face 发布 LCM LoRA,SDXL 4 步出图

    Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。

    推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。

10月27日周五
10月19日周四
10月3日周二
9月27日周三
  1. Mistral AI82

    Mistral AI 发布 7.3B 参数模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地部署。官方称该模型在所有基准上超过 Llama 2 13B,在多项基准上超过 Llama 1 34B,代码能力接近 CodeLlama 7B。

    推荐理由:官方给出 Mistral 7B 与 Llama 2 系列的逐项对比和滑动窗口注意力设计,可据此判断小参数模型的性价比边界。

9月18日周一
  1. Hugging Face Blog62

    3D Gaussian Splatting 入门:原理、训练流程与图形学前景

    Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。

    推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。

8月22日周二
  1. Hugging Face Blog75

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。

    推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。

8月8日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Swift Transformers,在 Apple 设备上运行端侧 LLM

    Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。

    推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。

8月1日周二
7月27日周四
7月18日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 2,Hugging Face 全面集成

    Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。

    推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。