OpenAI 推出 ChatGPT iOS 应用
OpenAI 发布 ChatGPT 的 iOS 应用,可同步用户的对话记录,并支持语音输入。该应用同时带来 OpenAI 最新的模型改进。
推荐理由:OpenAI 官方发布 ChatGPT iOS 应用,给出对话同步与语音输入两项核心能力。
OpenAI 发布 ChatGPT 的 iOS 应用,可同步用户的对话记录,并支持语音输入。该应用同时带来 OpenAI 最新的模型改进。
推荐理由:OpenAI 官方发布 ChatGPT iOS 应用,给出对话同步与语音输入两项核心能力。
Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH(参数 256, 0.7, 5)进行文档级近重复数据删除,并确认去重同样能提升代码模型性能且所需数据集更小。文章还对比了 The Stack、CodeParrot、InCoder 等代码数据集所用的精确匹配、Levenshtein 距离等去重方法,指出去重可减少训练步数、防止基准污染与数据泄露。
Intel 用 SmoothQuant-O3 对 OPT 2.7B/6.7B、LLaMA 7B、Alpaca 7B、Vicuna 7B、BloomZ 7.1B、MPT-7B-chat 等模型做 8-bit 量化,模型体积缩小约 2 倍,多数基准指标不降反升。
Hugging Face 发文介绍 RWKV 架构,它结合了 RNN 与 Transformer 的优势,并已被集成进 transformers 库。RWKV 由 Bo Peng 主导,训练 GPU 由 Stability AI 捐赠,现有模型参数从约 170M 到 14B,训练上下文长度达 8192 且速度与 ctx1024 模型相当。
推荐理由:结合 RWKV 架构原理与 transformers 集成示例,读者可了解 RNN 与 Transformer 优势如何被合并。
Hugging Face 被法国数据保护机构 CNIL 选中,入选其强化支持计划。该计划从 40 多个候选企业中选出三家"具有强劲经济发展潜力"的公司,为其提供数据保护职责理解与落实方面的支持。Hugging Face 此前在 BigScience 和 BigCode 项目中已投入隐私风险治理与假名化工具开发。
Hugging Face 发布教程,介绍如何在单块 AMD GPU 上通过 ROCm 运行 13B 参数的 Vicuna 聊天机器人。Vicuna 由 UC Berkeley、CMU、斯坦福和 UCSD 团队基于 LLaMA 微调,训练成本约 300 美元,以 GPT-4 为参考的初步评估中质量达到 ChatGPT 的 90% 以上。
Hugging Face 发布辅助生成(assisted generation)解码方法,用一个至少小一个数量级的助手模型快速生成候选 token,再由主模型前向验证,在 Transformers 中通过 assistant_model 参数即可启用。
推荐理由:Hugging Face 官方详解辅助生成解码方法,给出可复现的延迟数据与 Transformers 调用方式。
OpenAI 用 GPT-4 自动为大型语言模型的神经元行为撰写解释,并对这些解释打分。团队同时发布了覆盖 GPT-2 全部神经元的解释与评分数据集,并说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为,并公开全部神经元的解释与评分数据集。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。
推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。
Hugging Face Unity API 是 Hugging Face Inference API 的集成工具,让开发者在 Unity 项目中调用 Hugging Face AI 模型。
Hugging Face 发布端到端教程,演示如何用 🤗 Transformers、TensorFlow 和 TPU 从零训练一个 RoBERTa base 模型,涵盖训练 tokenizer、在 WikiText v1 上分词并转为 TFRecord 上传 GCS,再到模型训练与上传的完整流程。代码默认使用 BERT 规模模型,可通过修改配置扩展到更大模型和更强 TPU pod 切片。
Databricks 向 Hugging Face 代码库提交首个官方贡献,新增 Datasets 的 from_spark 函数,可直接将 Apache Spark dataframe 转为 Hugging Face Dataset。
Hugging Face 博客介绍如何在免费版 Google Colab(13GB CPU 内存、15GB T4 显存)上用 diffusers 运行 DeepFloyd 的 IF 文生图模型。
推荐理由:原文给出在免费 Colab 上分阶段加载 IF 各组件、8bit 量化 T5 并逐段释放显存的具体做法,可迁移到其他大模型推理。
ChatGPT 用户现在可以关闭聊天记录,自行选择哪些对话可以被用于训练模型。
推荐理由:ChatGPT 新增关闭聊天记录开关,读者可据此了解对话数据是否用于模型训练的自主控制方式。
Hugging Face 上线中文博客 hf.co/blog/zh,由志愿者翻译 transformers、diffusion 和强化学习等博客与课程内容。
Hugging Face Space 除了托管机器学习 demo,也能托管可玩的 Unity 游戏。教程给出 11 步流程:用 Static HTML 模板创建 Space、将 Unity 项目构建目标切换为 WebGL、把压缩格式设为 Disabled,再通过 Git-LFS 推送构建文件即可运行。官方还提供可选的 Hugging Face Unity WebGL 模板。
Hugging Face 与 AWS 合作,将 Hugging Face Transformers 针对 AWS Inferentia2 推理加速器进行优化,通过 optimum neuron 只需一行代码即可编译模型。
Hugging Face 博客发布教程,演示如何用 Transformers 库(版本 >= 4.27.2)进行图分类,目前该库中唯一的图 Transformer 模型是微软的 Graphormer。
Hugging Face 与开源联邦学习框架 Substra 合作创建了一个演示空间,展示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重而非原始数据,用多数据源训练的模型在验证数据上几乎总是优于单一数据源模型。Substra 已在乳腺癌研究等复杂安全环境中落地,MELLODDY 项目中 10 家生物制药公司借此共享了全球最大的小分子数据集。
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞。该计划是 OpenAI 致力于开发安全、先进 AI 的一部分,目标是打造安全、可靠、可信的技术与服务。
Snorkel AI 与 Hugging Face 达成合作,将 Hugging Face 的 Inference Endpoint 服务接入 Snorkel Flow 平台,让企业用户可直接调用其 150,000 多个开源模型来适配和微调基础模型。该服务支持一键创建模型 API,并具备“暂停与恢复”能力,客户按需激活、闲置休眠,从而在控制成本的同时扩展可用模型数量。
OpenAI 阐述了其确保 AI 系统安全构建、部署和使用的方法,并称这是其使命的关键。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现并迁移到自己的任务。
Hugging Face 发布 Ethics and Society Newsletter #3,阐述其在开放 ML 中兼顾伦理的思路。平台推出 6 个伦理标签(Rigorous、Consentful、Socially Conscious、Sustainable、Inclusive、Inquisitive),并上线举报功能,供社区标记违规的模型、数据集、Space 或讨论。
Hugging Face 展示用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ 并做推理,8 卡 16-bit 下延迟 3.103 秒,比 A100 80GB 的 4.402 秒快 1.42 倍。
Hugging Face 展示了在 Intel Sapphire Rapids CPU 上加速 Stable Diffusion 推理的多种技术。
Hugging Face 发布教程,演示如何用 Flower 框架在多个客户端上联邦微调预训练 Transformer 模型 distilBERT,用于 IMDB 影评情感分类。教程涵盖数据加载、PyTorch 训练测试循环、Flower 客户端类编写,并提供 Google Colab 模拟版本。
OpenAI 公布 ChatGPT 3 月 20 日宕机事故的调查结果,说明问题原因、已采取的处置措施及该 bug 的技术细节。
Hugging Face 发布教程,介绍如何用 diffusers 训练自定义 ControlNet,并以人脸姿态为例完整走通流程。训练分三步:规划条件、构建数据集、训练模型,数据集需包含原图、条件图和提示词三列。
推荐理由:完整复现了从条件设计、数据集构建到 diffusers 训练脚本的 ControlNet 训练流程,并给出不同显存下的参数配置。
OpenAI 宣布为 ChatGPT 实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或使用第三方服务。
推荐理由:OpenAI 官方给出 ChatGPT 插件的最初支持范围,读者可据此了解模型接入外部工具与实时信息的早期形态。
Hugging Face 宣布为 Hub 上托管的 Jupyter Notebook 增加渲染支持,ipynb 文件将以人类可读格式显示。Hub 目前托管超过 7,000 个 notebook,并支持一键在 Google Colab 中打开。
OpenAI 发布题为 GPTs are GPTs 的研究,初步考察大语言模型对劳动力市场的潜在影响。原文正文未能抓取,仅标题可用。
冰岛正在使用 GPT-4 保护其语言。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在许多真实场景中能力不及人类,但在多项专业和学术基准上达到人类水平。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解这一代模型的能力边界。
Be My Eyes 借助 GPT-4 改造视觉无障碍体验。该应用利用 GPT-4 为视障用户提供视觉辅助能力。
Stripe 利用 GPT-4 简化用户体验并打击欺诈。GPT-4 被用于优化 Stripe 的用户流程,同时增强其反欺诈能力。
Khan Academy 正在一项有限试点项目中探索 GPT-4 用于虚拟课堂教育的潜力。
GPT-4 被用于 Duolingo,以填补关键的语言学习空白。OpenAI 与 Duolingo 深化对话,将 GPT-4 引入语言学习场景。