Hugging Face PEFT 新增多种 LoRA 适配器合并方法
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的合并方法,包括 cat、linear、svd、TIES、DARE 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
推荐理由:PEFT 新增多种 LoRA 合并方法并给出选型顺序,读者可据此判断不同适配器组合该用哪种策略。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的合并方法,包括 cat、linear、svd、TIES、DARE 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
推荐理由:PEFT 新增多种 LoRA 合并方法并给出选型顺序,读者可据此判断不同适配器组合该用哪种策略。
OpenAI 正在测试让 ChatGPT 记住用户讨论过的内容,以便让后续对话更有帮助。用户对 ChatGPT 的记忆拥有控制权。
推荐理由:OpenAI 官方说明 ChatGPT 记忆功能的测试范围与用户控制方式,可据此了解该能力如何改变多轮对话体验。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接使用 OpenAI 客户端库或 LangChain、LlamaIndex 等第三方工具。
Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Digital Green 使用 OpenAI 构建农业数据库,以提升农民收入。
OpenAI 发布 GPT Store。
OpenAI 推出面向各类规模团队的新 ChatGPT 套餐 ChatGPT Team,提供安全、可协作的工作空间,帮助团队在工作中充分利用 ChatGPT。
推荐理由:OpenAI 面向各类规模团队推出 ChatGPT 新套餐,读者可了解其安全协作工作区的定位。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
WHOOP 借助 GPT-4 为用户提供个性化的健身与健康指导。该健康解决方案由 LLM 驱动,将大语言模型能力引入个人健康教练场景。
Summer Health 利用 OpenAI 提升儿科就诊记录的准确率,重新构想儿科就诊流程。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个 chat 端点和一 个 embedding 端点,各有不同的性能与价格取舍。
推荐理由:Mistral 首次开放平台 API,给出三个 chat 端点与 embedding 端点的性能价格取舍,可据此判断其服务化路线。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐量和 1200 tokens/秒。
推荐理由:官方给出单行代码接入方式与首 token 延迟、吞吐量对比数据,可据此判断现有 LLaMA 推理流程的改造代价。
Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。该功能由 OpenAI 官方推出,具体开放范围与使用细节原文未进一步说明。
推荐理由:OpenAI 官方发布 GPTs,读者可了解自定义 ChatGPT 的构成方式与开放范围。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,可让组织自行选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,亚太区即将上线;非默认位置的仓库会直接显示 Region 标签。官方称欧洲用户将仓库放在 EU 区域时,上传和下载速度约为存放在 US 时的 4-5 倍。
OpenAI 宣布 DALL·E 3 已在 ChatGPT Plus 和 Enterprise 中可用。为准备更大范围发布,OpenAI 开发了一套安全缓解方案,并同步分享了其在内容来源溯源方面的研究进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 面向 ChatGPT Plus 和 Enterprise 开放,并同步说明安全缓解措施与来源溯源研究。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Ironclad 借助 GPT-4 简化合同审查流程。
Typeform 借助 GPT-3.5 和 GPT-4,将在线表单升级为动态、对话式的数据收集体验。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包括众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,涵盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 为 PRO 用户推出 Inference for PROs,提供 Meta Llama 3 Instruct、Mixtral 8x7B Instruct。
Hugging Face 发布企业级代码助手 SafeCoder,基于 155 亿参数的 StarCoder 开源模型,支持 80 多种编程语言和 8192 token 上下文窗口。相比 GitHub Copilot 等闭源服务,SafeCoder 提供模型透明度、企业自定义微调、本地或云端部署及完全离线运行能力,提示词与建议数据不会回传 Hugging Face。
Hugging Face Diffusers 团队与 T2I-Adapter 作者合作,在 diffusers 中为 Stable Diffusion XL 加入 T2I-Adapter 支持,并发布 sketch、canny、lineart、depth、openpose 五种条件的预训练 checkpoint。
推荐理由:对比 ControlNet 的参数与显存占用,说明 T2I-Adapter 在 SDXL 可控生成上的效率取舍。
OpenAI 发布面向教师的 ChatGPT 课堂使用指南,内容包括推荐提示词、ChatGPT 的工作原理与局限、AI 检测工具的有效性以及偏见问题。
OpenAI 发布 ChatGPT Enterprise,主打企业级安全与隐私,并称其为目前能力最强的 ChatGPT 版本。
推荐理由:OpenAI 官方发布面向企业的 ChatGPT 版本,读者可了解其安全隐私定位与能力版本信息。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。
OpenAI 宣布开发者现在可以自带数据对 GPT-3.5 Turbo 进行微调,以适配各自的使用场景,同时更新了 API。
推荐理由:OpenAI 开放 GPT-3.5 Turbo 微调,开发者可用自有数据定制模型,值得关注其对应用落地的影响。
Hugging Face 发布面向企业的端到端代码助手 SafeCoder,基于 BigCode 项目的 StarCoder 系列代码大模型,支持客户在自有基础设施上自托管部署,训练与推理全程代码不离开 VPC。
OpenAI 将 GPT-4 用于内容政策制定与内容审核决策,可实现更一致的标注、更快的政策优化反馈闭环,并减少人工审核员的参与。
Hugging Face Hub 已上线 AWS Marketplace,用户可通过 AWS 账户订阅并支付 Hugging Face 的使用费用。订阅后,Inference Endpoints、Spaces 硬件升级和 AutoTrain 等服务的组织用量费用将直接计入 AWS 账单,价格与 Hugging Face 公开定价一致。
Hugging Face 发布 swift-transformers,一个用 Swift 实现类 transformers API 的包,专注文本生成,并同时放出 swift-chat 演示应用、更新版 exporters 与 transformers-to-coreml 转换工具,以及 Llama 2 7B、Falcon 7B 等已转换好的 Core ML 模型。
推荐理由:官方给出在 Apple 设备上跑 Llama 2 等模型的完整工具链与转换路径,可据此评估端侧部署的可行步骤。
Hugging Face 用 facebook/fasttext-language-identification 模型为 Hub 上缺少语言标注的数据集预测语言,该模型可识别 217 种语言,通过 dataset viewer API 取每个数据集 20 行文本进行预测,再由 librarian-bots 提交 PR 补充元数据。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。