Stripe 借助 GPT-4 优化用户体验并打击欺诈
Stripe 利用 GPT-4 简化用户体验并打击欺诈。GPT-4 被用于优化 Stripe 的用户流程,同时增强其反欺诈能力。
Stripe 利用 GPT-4 简化用户体验并打击欺诈。GPT-4 被用于优化 Stripe 的用户流程,同时增强其反欺诈能力。
Khan Academy 正在一项有限试点项目中探索 GPT-4 用于虚拟课堂教育的潜力。
GPT-4 被用于 Duolingo,以填补关键的语言学习空白。OpenAI 与 Duolingo 深化对话,将 GPT-4 引入语言学习场景。
OpenAI 发布 GPT-4,可生成、编辑并与用户迭代完成创意与技术写作任务,例如创作歌曲、撰写剧本,或学习用户的写作风格。
推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑与迭代能力。
Informer 模型已在 🤗 Transformers 中可用,用于多变量概率时间序列预测,即预测未来时间序列目标值向量的分布。该模型基于 vanilla Transformer,通过 ProbSparse 注意力将自注意力复杂度从 O(T²D) 降至 O(T log T),并用 Distilling 操作把堆叠层内存占用从 O(NT²) 降至 O(N·T log T)。
Hugging Face 正式发布 trl 与 peft 的集成,让大语言模型的 RLHF 微调更易上手。该方案用 8-bit 加载、低秩适配器和共享参考模型三层手段压缩显存,在 24GB NVIDIA 4090 上完成了 20B 参数 gpt-neox 的 RLHF 微调,完整训练则在单张 A100 上跑完。
推荐理由:原文给出在 24GB 消费级 GPU 上完成 20B 模型 RLHF 微调的具体组合方案,可迁移到显存受限的训练场景。
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。
Hugging Face 在 Diffusers 中推出 StableDiffusionControlNetPipeline,把 ControlNet 的空间条件控制接入扩散模型生成流程,支持 canny 边缘、深度图、分割图、scribble、关键点等 8 种条件模型。
推荐理由:Diffusers 集成 ControlNet 并给出多种条件控制的完整代码示例,读者可据此复现并评估显存与速度开销。
2023 年土耳其地震后,志愿者在 Hugging Face 上协作开发了灾害地图应用 afetharita,用 easyocr 做 OCR、基于 bert-base-turkish-cased 微调 token 分类模型提取地址,并通过 Inference API 部署。
Hugging Face 为 Diffusers 库发布了一套伦理框架,用于指导维护者处理社区贡献时的技术决策。该准则包含透明度、一致性、简洁性、可访问性、可复现性和责任六项价值观,并列出 Community tab、Tag 功能、偏见探索与评估等安全机制,以及 Safe Stable Diffusion、Hub 分阶段发布和 OpenRAILs 许可等部署安全措施。
Hugging Face 专家加速计划帮助 Witty Works 将其包容性写作助手的非包容性词汇分类器从 vanilla transformers 转向 Sentence Transformers 架构,结合 SetFit 库实现少样本微调,每个词仅需 15-20 条标注句子。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(即整体上比人类更聪明的 AI 系统)造福全人类。
推荐理由:OpenAI 官方阐述 AGI 使命与长期规划,可了解其对通用人工智能安全与治理的基本立场。
Hugging Face 在 Mac App Store 上线 Diffusers for Mac 1.1,基于 Core ML 转换的 Stable Diffusion 等文生图模型,官方称出图速度最高可达此前两倍。
红队测试通过构造自然语言提示词诱导大语言模型输出有害内容,从而暴露其漏洞,与对抗攻击不同,其提示词对人类而言是正常可读的。红队测试可由人工或另一个语言模型执行,针对经 RLHF 或 SFT 对齐的模型需借助角色扮演等创造性手段。随着模型能力增强,开发可持续适配的红队方法并推动多方协作共享数据集与最佳实践变得至关重要。
消费者奖励公司 Fetch 在 AWS 上借助 Hugging Face 专家加速计划,将原本依赖第三方黑盒的收据处理方案替换为自研 AI 模型,开发时间缩短 30%,处理延迟降低 50%。Fetch 目前每天处理超 1100 万张收据,服务 1800 万月活用户,方案基于 Amazon SageMaker 和 AWS Inferentia 加速器。
Hugging Face 与 AWS 宣布扩大长期战略合作,Hugging Face 将 AWS 作为首选云服务商,社区开发者可通过 Amazon SageMaker、AWS Trainium 和 AWS Inferentia 训练、微调与部署模型。
OpenAI 发文说明 ChatGPT 的行为是如何被塑造的,并介绍其改进计划,包括让用户拥有更多自定义空间,以及在相关决策中引入更多公众意见。
推荐理由:OpenAI 说明 ChatGPT 行为如何被塑造,并给出用户自定义与公众参与决策的改进方向。
Hugging Face 博客介绍 Salesforce Research 的 BLIP-2 已集成进 Transformers,可在冻结图像编码器与大语言模型之间加入轻量 Q-Former 完成视觉语言预训练。
推荐理由:以 New Yorker 漫画为例演示 BLIP-2 的零样本图像描述、提示续写与视觉问答,可据此快速上手多模态推理。
团队将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移到 Hugging Face Inference Endpoints,部署流程从六步简化为三步。基于 RoBERTa 文本分类模型的测试显示,large 实例延迟约 80ms,比此前 ECS 方案快一倍以上,但成本高出 24% 至 50%,large CPU 实例每月约多花 60 美元。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:原文给出 PEFT 库支持的方法与消费级硬件上的微调示例,读者可据此判断低成本微调的可行路径。
Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。
推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。
Hugging Face 博客"AI for Game Development"系列第 5 篇演示了如何用 ChatGPT 为农场游戏生成故事,包括故事梗概、游戏内文本和商店物品描述。
Hugging Face 发布开源工具 AI vs. AI,用于在深度强化学习多智能体场景中对模型进行相对排名。该工具由 Space 匹配算法、Dataset 结果存储和展示 ELO 评分的 Leaderboard 三部分组成,模型上传至 Hub 后即自动参与对战评估,初始 ELO 为 1200。
Hugging Face 发布博客第二部分,测试在 Intel Sapphire Rapids 服务器上运行 PyTorch Transformers 推理的性能。
Hugging Face 发布博客深入解析视觉-语言模型的训练策略,涵盖对比学习、PrefixLM、交叉注意力多模态融合、MLM/ITM 以及免训练等五类预训练目标。文章以 OpenAI 的 CLIP 为例说明对比学习如何将图像与文本映射到同一特征空间,并介绍如何用 🤗 Transformers 实验这些最新进展。
OpenAI 宣布为 ChatGPT 推出试点订阅方案 ChatGPT Plus。ChatGPT 是一款对话式 AI,可与用户聊天、回答追问并指出错误假设。
推荐理由:OpenAI 官方公布 ChatGPT 付费订阅试点,读者可据此了解其早期商业化路径的起点。
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类撰写文本。
推荐理由:OpenAI 官方发布 AI 文本检测分类器,读者可了解其用途与官方定位。
Hugging Face 公布其计算机视觉生态现状:Hub 上已支持 8 项核心视觉任务、超过 3000 个模型和 100 多个数据集,涵盖 ViT、Swin、DETR 等 Transformer 架构以及 ConvNeXt、ResNet、RegNet 等卷积架构。
Hugging Face 博客"AI for Game Development"系列第 4 篇讲解如何用 Stable Diffusion 的 Image2Image 生成 2D 游戏资产,并以 farming game 的玉米和镰刀图标为例演示完整流程。
Hugging Face 在 diffusers 中正式支持 LoRA 微调 Stable Diffusion,训练脚本最低可在 11 GB 显存上运行,无需 8-bit 优化器等技巧。由于原模型权重被冻结,只需保存新注入层的权重,单个文件约 3 MB,比原 UNet 小约一千倍,便于分享和下载。文章给出了完整的训练命令、推理时加载 LoRA 权重的代码,以及结合 Dreambooth 的用法。
推荐理由:原文给出 LoRA 微调 Stable Diffusion 的完整脚本与推理流程,读者可据此在 11 GB 显存上复现训练。
Hugging Face 与微软 ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练后端,为多种 Hugging Face 模型带来 35% 以上的训练提速。
Hugging Face 博客梳理了让对话智能体有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF),并对比了 LaMDA、BlenderBot 3、Sparrow、ChatGPT/InstructGPT 和 Anthropic Assistant 在访问方式、模型规模、训练数据和评测标准上的差异。
OpenAI 宣布与 Microsoft 延长双方的合作关系,未披露具体条款与期限。
Hugging Face 博客"AI for Game Development"系列第 3 天聚焦 3D 资产生成,结论是 text-to-3D 目前还无法实际用于游戏开发。文章梳理了 DreamFusion、Point-E、CLIP-NeRF 等近期方案,指出它们多基于 NeRF 视图合成,生成的 mesh 需大量人工后处理才能达到游戏可用标准。作者因此在本作中改用不同颜色的立方体代表农作物。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一套架构解决实例、语义和全景分割,但每个任务仍需单独训练;OneFormer 加入文本编码器,仅在全景数据集上训练一次即可在三个任务上达到 SOTA,精度更高但延迟更大。
Hugging Face 与百度 PaddlePaddle 达成开源合作,PaddlePaddle 模型库将逐步集成至 Hugging Face Hub,目前已有超 75 个模型上线,包括 UIE、ERNIE 3.0、Ernie-Layout 等。
Hugging Face 发布教程,演示如何用 Transformers 和 Datasets 库构建图像相似度系统,实现反向图像搜索等信息检索场景。
OpenAI 联合乔治城大学安全与新兴技术中心及斯坦福互联网天文台,研究大语言模型可能被用于虚假信息宣传的方式,并发布了一份基于一年多研究的联合报告。报告梳理了语言模型若被用于增强虚假信息宣传会对信息环境构成的威胁,并提出了一套分析潜在缓解措施的框架。
Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助农场游戏设计,作者让其以专业游戏设计师身份给出作物多样性、进阶系统、动态环境、社交多人、沉浸式剧情等建议,并因 5 天工期只先灰盒实现了前两项。文章同时解释语言模型与 Transformer 原理,并提醒 ChatGPT 常言之凿凿却出错,宜作头脑风暴工具而非开发流程的替代品。
OpenAI 展示了用 GPT-3 从客户反馈中快速提取细致洞察的能力。该方案面向客户反馈分析场景,可输出更细腻的洞察结果。