Hugging Face 与 Google Cloud 合作:数千个开源 LLM 一键部署至 Vertex AI Model Garden
Hugging Face 推出 Deploy on Google Cloud,可将数千个开源模型通过 Vertex AI 或 GKE 部署为自有 Google Cloud 账户内的 API Endpoint。
Hugging Face 推出 Deploy on Google Cloud,可将数千个开源模型通过 Vertex AI 或 GKE 部署为自有 Google Cloud 账户内的 API Endpoint。
OpenAI 为微调 API 增加新功能,让开发者对微调拥有更多控制权,同时公布构建自定义模型的新方式。
Hugging Face 与 Cloudflare 合作推出 Deploy on Cloudflare Workers AI,让开发者以无服务器 API 方式调用 Hugging Face 上的开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 和 Text Generation Inference 提供支持,按请求付费。
OpenAI 宣布让用户无需注册即可直接使用 ChatGPT,以便更轻松地体验 AI 带来的好处。
推荐理由:OpenAI 官方宣布 ChatGPT 无需注册即可使用,读者可据此了解其降低使用门槛的具体变化。
OpenAI 分享了 Voice Engine 小规模预览的经验教训,该模型可用于创建自定义语音。
Zelma 借助 GPT-4 让教育数据变得易于获取。
OpenAI 公布 Sora 的首批艺术家使用反馈,展示该视频生成模型在创作流程中的应用效果。自 Sora 上月发布以来,OpenAI 与艺术家合作探索其如何辅助创意工作。
Hugging Face 与 Lighthouz AI 联合推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感信息,并投票选出隐私保护更强的模型。
Superhuman 宣布与 OpenAI 合作,推出由 AI 驱动的新一代邮件体验。官方称这标志着邮件进入新纪元,但未披露具体模型版本、功能细节或上线时间。
Holiday Extras 在全公司各团队推广 ChatGPT Enterprise,每周提升生产力 500 小时。这家旅游附加服务公司借助 AI 打造数据驱动、高效的企业文化。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可在 Hub 内通过 AutoTrain 无代码创建训练任务,直接使用 NVIDIA DGX Cloud 的 H100 GPU。
Match Group 采用 ChatGPT Enterprise 来激发创造力并提升业务影响。OpenAI 分享了这一企业级产品的应用案例。
Paradigm 正使用 OpenAI 的 API 改善患者参与临床试验的可及性。该举措旨在让更多患者更容易找到并加入合适的临床试验。
Lifespan 利用 GPT-4 大幅提升健康素养并改善患者预后。该机构将 GPT-4 应用于患者沟通与健康教育场景,以提升患者对医疗信息的理解能力。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名以避免偏见。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法访问互联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,读者可了解其模型接入方式与自部署能力。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的合并方法,包括 cat、linear、svd、TIES、DARE 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
推荐理由:PEFT 新增多种 LoRA 合并方法并给出选型顺序,读者可据此判断不同适配器组合该用哪种策略。
OpenAI 正在测试让 ChatGPT 记住用户讨论过的内容,以便让后续对话更有帮助。用户对 ChatGPT 的记忆拥有控制权。
推荐理由:OpenAI 官方说明 ChatGPT 记忆功能的测试范围与用户控制方式,可据此了解该能力如何改变多轮对话体验。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API,从 TGI 1.4.0 起提供与 OpenAI Chat Completion API 兼容的接口,可直接使用 OpenAI 客户端库或 LangChain、LlamaIndex 等第三方工具。
Hugging Face 发布 SegMoE 框架,可从零创建混合专家(MoE)扩散模型,并已集成 diffusers。同时发布 SegMoE-4x2、SegMoE-2x1 和 SegMoE-SD4x2 三个模型,采用 Apache 2.0 许可,并提供 GitHub 仓库和 segmoe 包用于自建 MoE 模型。
推荐理由:原文给出从零构建 MoE 扩散模型的完整流程与配置示例,读者可据此判断能否把已有模型合并成新模型。
Hugging Face Text Generation Inference(TGI)正式在 AWS Inferentia2 和 Amazon SageMaker 上全面可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Digital Green 使用 OpenAI 构建农业数据库,以提升农民收入。
OpenAI 发布 GPT Store。
OpenAI 推出面向各类规模团队的新 ChatGPT 套餐 ChatGPT Team,提供安全、可协作的工作空间,帮助团队在工作中充分利用 ChatGPT。
推荐理由:OpenAI 面向各类规模团队推出 ChatGPT 新套餐,读者可了解其安全协作工作区的定位。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 TRL 的 SFTTrainer、DPOTrainer 等配合可将 LLM 微调提速约 2 倍,显存占用最多降低 74%,且相对标准 QLoRA 精度损失为 0%。
推荐理由:原文给出 Unsloth 与 TRL 集成的实测加速与显存数据,读者可据此判断微调成本能降到什么程度。
WHOOP 借助 GPT-4 为用户提供个性化的健身与健康指导。该健康解决方案由 LLM 驱动,将大语言模型能力引入个人健康教练场景。
Summer Health 利用 OpenAI 提升儿科就诊记录的准确率,重新构想儿科就诊流程。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个 chat 端点和一 个 embedding 端点,各有不同的性能与价格取舍。
推荐理由:Mistral 首次开放平台 API,给出三个 chat 端点与 embedding 端点的性能价格取舍,可据此判断其服务化路线。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐量和 1200 tokens/秒。
推荐理由:官方给出单行代码接入方式与首 token 延迟、吞吐量对比数据,可据此判断现有 LLaMA 推理流程的改造代价。
Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。该功能由 OpenAI 官方推出,具体开放范围与使用细节原文未进一步说明。
推荐理由:OpenAI 官方发布 GPTs,读者可了解自定义 ChatGPT 的构成方式与开放范围。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,可让组织自行选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,亚太区即将上线;非默认位置的仓库会直接显示 Region 标签。官方称欧洲用户将仓库放在 EU 区域时,上传和下载速度约为存放在 US 时的 4-5 倍。
OpenAI 宣布 DALL·E 3 已在 ChatGPT Plus 和 Enterprise 中可用。为准备更大范围发布,OpenAI 开发了一套安全缓解方案,并同步分享了其在内容来源溯源方面的研究进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 面向 ChatGPT Plus 和 Enterprise 开放,并同步说明安全缓解措施与来源溯源研究。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Ironclad 借助 GPT-4 简化合同审查流程。
Typeform 借助 GPT-3.5 和 GPT-4,将在线表单升级为动态、对话式的数据收集体验。