跳到正文

全部动态

今日 10 条
9月29日周五
  1. Hugging Face Blog12

    Hugging Face ethics and society Newsletter #5:Hugging Face 走进华盛顿与 2023 夏季随想

    Hugging Face 发布 Ethics and Society Newsletter #5,回顾其今夏向欧盟、英国和美国立法者提供 AI 价值观与监管建议的工作,包括 CEO Clem 在美国国会作证及在美国参议院 AI Insight Forum 发言。团队还就 EU AI Act、NTIA AI 问责、开源 AI 益处等议题公开发声,并将偏见与危害测试应用于新多模态模型 IDEFICS。

9月28日周四
9月27日周三
  1. Mistral AI82

    Mistral AI 发布 7.3B 参数模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地部署。官方称该模型在所有基准上超过 Llama 2 13B,在多项基准上超过 Llama 1 34B,代码能力接近 CodeLlama 7B。

    推荐理由:官方给出 Mistral 7B 与 Llama 2 系列的逐项对比和滑动窗口注意力设计,可据此判断小参数模型的性价比边界。

9月26日周二
9月25日周一
9月22日周五
9月19日周二
9月18日周一
  1. Hugging Face Blog62

    3D Gaussian Splatting 入门:原理、训练流程与图形学前景

    Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。

    推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。

9月15日周五
9月13日周三
  1. Hugging Face Blog62

    Würstchen 发布:面向图像生成的高效扩散模型

    Würstchen 是一个文本条件扩散模型,其文本条件部分在高度压缩的潜空间中工作,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 组成 Decoder,实现 42x 空间压缩,Stage C 作为 Prior 在该潜空间中训练。

    推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断高效扩散模型在成本上的取舍。

  2. Hugging Face Blog62

    用 PyTorch FSDP 微调 Llama 2 70B

    Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并在 2 节点 16 张 A100 80GB 上完成训练,耗时约 13.5 小时。

    推荐理由:原文给出 70B 模型多节点微调的三个具体瓶颈及对应配置改法,可迁移到其他大模型训练场景。

9月12日周二
9月11日周一
  1. Hugging Face Blog40

    Hugging Face SafeCoder 与闭源代码助手对比:StarCoder 驱动的企业级方案

    Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言和 8192 token 上下文窗口。相比 GitHub Copilot 等闭源服务,SafeCoder 提供模型透明度、企业自定义微调、本地或云端部署及完全离线运行能力,提示词与建议数据不会回传 Hugging Face。

9月8日周五
9月6日周三
  1. Hugging Face Blog78

    TII 的 Falcon 180B 上线 Hugging Face

    TII 发布 Falcon 180B 并上线 Hugging Face,参数规模 1800 亿,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。

    推荐理由:Falcon 180B 以 1800 亿参数和 3.5 万亿 token 预训练规模进入开源生态,读者可据此了解当时开源模型与闭源模型的差距。

9月1日周五
8月31日周四
8月30日周三
8月28日周一
  1. OpenAI News78

    OpenAI 推出 ChatGPT Enterprise

    OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为目前能力最强的 ChatGPT 版本。

    推荐理由:OpenAI 官方发布面向企业的 ChatGPT 版本,读者可了解其安全隐私定位与能力版本信息。

8月25日周五
  1. Hugging Face Blog82

    Code Llama 发布:Llama 2 学会写代码

    Meta 发布 Code Llama,基于 Llama 2 初始化并在 5000 亿 token 代码数据上训练,提供 7B、13B、34B 三种规格,另有 Python 专用版和指令微调版,采用与 Llama 2 相同的社区许可并允许商用。

    推荐理由:梳理 Code Llama 三种规格与 Python 专用、指令微调变体的差异,并给出 Hugging Face 生态的接入方式与基准对比。

8月24日周四
8月23日周三
  1. Hugging Face Blog62

    Hugging Face 将 AutoGPTQ 集成进 Transformers,支持 8/4/3/2-bit 量化

    Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。

    推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。

8月22日周二
  1. Hugging Face Blog75

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。

    推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。

8月16日周三
8月15日周二
8月10日周四
8月9日周三
8月8日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Swift Transformers,在 Apple 设备上运行端侧 LLM

    Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。

    推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。

8月4日周五
8月2日周三
  1. Hugging Face Blog35

    Zama 用 FHE 加密大语言模型:基于 Hugging Face GPT2 的隐私推理实践

    Zama 展示了用全同态加密(FHE)在加密数据上运行大语言模型推理的方案,基于 Hugging Face transformers 库改造 GPT2,将首个多头注意力头用 Concrete-Python 转为 FHE 等价实现。实验显示 4-bit 量化可保留原模型 96% 的精度,客户端本地推理至首层后加密中间结果交由服务器计算,兼顾用户数据隐私与模型 IP 保护。