Gradio-Lite 发布:完全在浏览器中运行的无服务器 Gradio
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地部署。官方称该模型在所有基准上超过 Llama 2 13B,在多项基准上超过 Llama 1 34B,代码能力接近 CodeLlama 7B。
推荐理由:官方给出 Mistral 7B 与 Llama 2 系列的逐项对比和滑动窗口注意力设计,可据此判断小参数模型的性价比边界。
Hugging Face 博客发布 3D Gaussian Splatting 入门介绍,说明这是一种从少量图像学习逼真场景并实时渲染的栅格化技术。文章拆解了完整流程:先用 COLMAP 做 Structure from Motion 估计点云,再把每个点转成高斯并训练,训练中通过可微高斯栅格化计算损失,并按梯度大小自动分裂、克隆或剪枝高斯。
推荐理由:文章把 3D Gaussian Splatting 的流程拆成可理解的步骤,并列出显存、磁盘与渲染管线兼容性等实际限制。
Würstchen 是一个文本条件扩散模型,其文本条件部分在高度压缩的潜空间中工作,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 组成 Decoder,实现 42x 空间压缩,Stage C 作为 Prior 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断高效扩散模型在成本上的取舍。
Hugging Face 发布教程,介绍如何用 PyTorch FSDP 结合 Transformers、Accelerate 和 TRL 微调 Llama 2 70B,并在 2 节点 16 张 A100 80GB 上完成训练,耗时约 13.5 小时。
推荐理由:原文给出 70B 模型多节点微调的三个具体瓶颈及对应配置改法,可迁移到其他大模型训练场景。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,说明 T2I-Adapter 在 SDXL 可控生成上的效率取舍。
TII 发布 Falcon 180B 并上线 Hugging Face,参数规模 1800 亿,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:Falcon 180B 以 1800 亿参数和 3.5 万亿 token 预训练规模进入开源生态,读者可据此了解当时开源模型与闭源模型的差距。
Meta 发布 Code Llama,基于 Llama 2 初始化并在 5000 亿 token 代码数据上训练,提供 7B、13B、34B 三种规格,另有 Python 专用版和指令微调版,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:梳理 Code Llama 三种规格与 Python 专用、指令微调变体的差异,并给出 Hugging Face 生态的接入方式与基准对比。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。
Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。
推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。
Hugging Face 博客介绍 TRL 库新增的 DPO 训练支持,并演示如何用 QLoRA 在 stack-exchange 偏好数据上微调 Llama v2 7B。
推荐理由:TRL 官方给出 DPO 微调 Llama 2 的完整代码与数据格式,读者可据此在自己的偏好数据上复现。
Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。
推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例和自定义工具接口,读者可据此判断如何在 JS 项目中接入工具调用。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。
推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。
Hugging Face 博客介绍如何用 Transformers.js 制作完全在浏览器本地运行的实时 ML 网页游戏 Doodle Dash。作者基于 Google Quick, Draw!
推荐理由:完整演示了从微调 MobileViT 到用 Transformers.js 在浏览器内实时推理的端到端流程,可迁移到其他端侧 ML 项目。
Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。
推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。