Unsloth 与 TRL 集成:LLM 微调提速 2 倍、显存最多降 74%
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个 chat 端点和一 个 embedding 端点,各有不同的性能与价格取舍。
推荐理由:Mistral 首次开放平台 API,给出三个 chat 端点与 embedding 端点的性能价格取舍,可据此判断其服务化路线。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐量和 1200 tokens/秒。
推荐理由:官方给出单行代码接入方式与首 token 延迟、吞吐量对比数据,可据此判断现有 LLaMA 推理流程的改造代价。
Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。该功能由 OpenAI 官方推出,具体开放范围与使用细节原文未进一步说明。
推荐理由:OpenAI 官方发布 GPTs,读者可了解自定义 ChatGPT 的构成方式与开放范围。
OpenAI 宣布 DALL·E 3 已在 ChatGPT Plus 和 Enterprise 中可用。为准备更大范围发布,OpenAI 开发了一套安全缓解方案,并同步分享了其在内容来源溯源方面的研究进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 面向 ChatGPT Plus 和 Enterprise 开放,并同步说明安全缓解措施与来源溯源研究。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,说明 T2I-Adapter 在 SDXL 可控生成上的效率取舍。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为目前能力最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布面向企业的 ChatGPT 版本,读者可了解其安全隐私定位与能力版本信息。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。
OpenAI 宣布开发者现在可以自带数据对 GPT-3.5 Turbo 进行微调,以适配各自的使用场景,同时更新了 API。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,值得关注其对应用落地的影响。
Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。
推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例和自定义工具接口,读者可据此判断如何在 JS 项目中接入工具调用。
OpenAI 为 ChatGPT 推出自定义指令功能,用户可设置自己的偏好,ChatGPT 会在之后的所有对话中记住这些偏好。
推荐理由:OpenAI 官方说明 ChatGPT 新增自定义指令,读者可据此了解对话偏好设置如何跨会话生效。
OpenAI 宣布一系列 API 更新,包括更易引导的模型、函数调用能力、更长的上下文以及更低的价格。
推荐理由:OpenAI 官方公布 API 多项更新,读者可据此了解模型可控性、函数调用与价格的变化方向。