Summer Health 借助 OpenAI 提升儿科就诊记录准确率
Summer Health 利用 OpenAI 提升儿科就诊记录的准确率,重新构想儿科就诊流程。
Summer Health 利用 OpenAI 提升儿科就诊记录的准确率,重新构想儿科就诊流程。
OpenAI 启动总额 1000 万美元的 Superalignment Fast Grants,资助面向超人类 AI 系统对齐与安全的技术研究。资助方向包括弱到强泛化、可解释性、可扩展监督等。
OpenAI 提出面向超级对齐的新研究方向,探讨能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步结果。
OpenAI 与 Axel Springer 达成合作,后者成为全球首家与 OpenAI 深度整合新闻业与 AI 技术的出版机构。双方将推动 AI 在新闻领域的良性应用。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,同时发布经监督微调和 DPO 优化的 Mixtral 8x7B Instruct。
推荐理由:官方给出稀疏 MoE 的参数量与推理成本结构,可据此判断开放权重模型在成本与性能间的取舍。
Mistral AI 开放首个平台服务 La Plateforme 的 beta 访问,提供三个 chat 端点和一 个 embedding 端点,各有不同的性能与价格取舍。
推荐理由:Mistral 首次开放平台 API,给出三个 chat 端点与 embedding 端点的性能价格取舍,可据此判断其服务化路线。
Hugging Face 发布长文《Mixture of Experts Explained》,系统讲解 MoE 的构成、训练与推理取舍。文章指出 MoE 用稀疏层替换部分 FFN 层并配路由网络,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 参数。
推荐理由:系统梳理 MoE 的构成、训练与推理取舍,并给出并行与部署的实践要点,适合理解稀疏模型为何省算力却吃显存。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,在多项基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:Hugging Face 官方给出 Mixtral 在自家生态的完整接入方式,包括推理、量化与单卡微调的具体路径。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需把 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐量和 1200 tokens/秒。
推荐理由:官方给出单行代码接入方式与首 token 延迟、吞吐量对比数据,可据此判断现有 LLaMA 推理流程的改造代价。
Hugging Face 在 Hub 的 Inference API 中实现 LoRA 动态加载,保持基础模型常驻、按请求即时加载和卸载 LoRA 适配器,把冷启动时间从 25s 降到 3s,用户请求响应时间从 35s 降到 13s。
Hugging Face 与 AMD 公布合作进展,Transformers 模型现可在 AMD Instinct GPU 上无需修改代码直接运行,并已支持 Flash Attention v2、Paged Attention、DeepSpeed、GPTQ 等加速与量化方案。
推荐理由:Hugging Face 与 AMD 公布 ROCm 适配进展,读者可了解在 AMD Instinct 上零改动运行 Transformers 的现状与性能对比。
Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。
OpenAI 宣布 Sam Altman 回归担任 CEO,Mira Murati 继续任 CTO,Greg Brockman 回归担任总裁,公司同时组建新的初始董事会。公告还附有 CEO Sam Altman 与董事会主席 Bret Taylor 的致辞。
推荐理由:OpenAI 官方确认 Sam Altman 回归 CEO 并公布新一届初始董事会,读者可据此了解这场人事风波的最新落点。
OpenAI 宣布领导层变动,原文正文未能抓取,仅标题可用。
OpenAI 启动 Data Partnerships 计划,与各方合作创建用于 AI 训练的开源和私有数据集。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的落地成本。
一项对比实验用 LoRA 微调 RoBERTa-large(355M)、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文二分类任务上评测性能。实验统一设置 MAX_LEN=512,在单张 A6000(48GB)上完成训练,并使用 Weights & Biases 做超参数调优与实验记录。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接对接 Hugging Face 生态。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 作为演示模型。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。该功能由 OpenAI 官方推出,具体开放范围与使用细节原文未进一步说明。
推荐理由:OpenAI 官方发布 GPTs,读者可了解自定义 ChatGPT 的构成方式与开放范围。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,可让组织自行选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,亚太区即将上线;非默认位置的仓库会直接显示 Region 标签。官方称欧洲用户将仓库放在 EU 区域时,上传和下载速度约为存放在 US 时的 4-5 倍。
Hugging Face 博客介绍如何基于 huggingface GitHub 组织公开仓库的代码,微调出名为 HugCoder 的代码补全模型。
推荐理由:完整给出从数据采集到 QLoRA 与全量微调的成本对比,以及本地部署路径,可迁移到自有代码库。
OpenAI 正在构建应对灾难性风险的前沿准备工作方法,包括组建一支 Preparedness 团队并发起一项挑战赛,以支持高能力 AI 系统的安全。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布了 Frontier Model Forum 的新任执行董事,并设立 1000 万美元 AI 安全基金。
Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可交互式可视化数据集。它支持加载模型预测与嵌入向量,通过相似度图、混淆矩阵等定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查布局。
Hugging Face 博客复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
Hugging Face 发布博客,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints,并支持大规模批量请求。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多项推理优化,未优化时显存占用 28GB、延迟 72.2 秒,使用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 各项推理优化的实测数据,读者可据此按显存和延迟取舍配置。
OpenAI 宣布 DALL·E 3 已在 ChatGPT Plus 和 Enterprise 中可用。为准备更大范围发布,OpenAI 开发了一套安全缓解方案,并同步分享了其在内容来源溯源方面的研究进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 面向 ChatGPT Plus 和 Enterprise 开放,并同步说明安全缓解措施与来源溯源研究。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用直接在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断部署成本与加载延迟的取舍。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Ironclad 借助 GPT-4 简化合同审查流程。
Typeform 借助 GPT-3.5 和 GPT-4,将在线表单升级为动态、对话式的数据收集体验。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包括众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,涵盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。
Hugging Face 为 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,并随 tokenizer 一起加载。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可了解格式错配为何造成静默性能下降。
Hugging Face Diffusers 现已支持在 Cloud TPU v5e 上通过 JAX 运行 Stable Diffusion XL 推理。该方案借助 JAX 的 jit 编译与 XLA 并行能力,在多个 TPU v5e-4 实例上约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3s。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。