Huggy Lingo:用机器学习改进 Hugging Face Hub 数据集的语言元数据
Hugging Face 用 facebook/fasttext-language-identification 模型为 Hub 上缺少语言标注的数据集预测语言,该模型可识别 217 种语言,通过 dataset viewer API 取每个数据集 20 行文本进行预测,再由 librarian-bots 提交 PR 补充元数据。
Hugging Face 用 facebook/fasttext-language-identification 模型为 Hub 上缺少语言标注的数据集预测语言,该模型可识别 217 种语言,通过 dataset viewer API 取每个数据集 20 行文本进行预测,再由 librarian-bots 提交 PR 补充元数据。
Segmind 开源了压缩扩散模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型减少 35% 和 55%,同时保持接近的图像保真度。
推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,读者可了解压缩扩散模型在参数与推理速度上的取舍。
这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最终导出 FBX 并导入 Unity。流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题,需具备 Blender 与 UV 映射基础。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在运行 macOS 14 公测版的 Apple Silicon Mac 上本地运行。
推荐理由:原文给出混合位宽调色板量化的完整方法与实测数据,读者可据此判断本地跑 SDXL 的体积与质量取舍。
OpenAI 正在组建一个新的行业机构 Frontier Model Forum,以推动前沿 AI 系统的安全与负责任开发。该机构将推进 AI 安全研究、确定最佳实践与标准,并促进政策制定者与行业之间的信息共享。
Hugging Face 联合 Creative Commons、Eleuther AI、GitHub、LAION 和 Open Future 发布立场文件,就 EU AI Act 提出五项建议。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例和自定义工具接口,读者可据此判断如何在 JS 项目中接入工具调用。
OpenAI 与其他领先 AI 实验室通过自愿承诺,共同强化 AI 的安全性、安保与可信度,推动 AI 治理向前迈进。
Hugging Face 公布首届开源 AI Game Jam 结果,活动吸引超 1300 人报名、收到 88 款游戏,冠军由 ohmlet 的 Snip It 获得,该游戏用 Stable Diffusion 生成素材。
OpenAI 为 ChatGPT 推出自定义指令功能,用户可设置自己的偏好,ChatGPT 会在之后的所有对话中记住这些偏好。
推荐理由:OpenAI 官方说明 ChatGPT 新增自定义指令,读者可据此了解对话偏好设置如何跨会话生效。
Hugging Face 的 Diffusers 库迎来一周年,已从文本生成图像扩展到视频、3D 和图像编辑等扩散模型能力。新增支持 DeepFloyd IF、Stability AI SDXL、OpenAI Shap-E 与 Consistency Models,后者在 CPU 上生成一张 256x256 图像仅需 3/4 秒。
OpenAI 与美国新闻项目达成 500 万美元以上合作,探索 AI 发展如何支持本地新闻领域创新,并确保本地新闻机构参与塑造这项新兴技术的未来。
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。
推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。
Hugging Face 发布 AI WebTV 实验性演示,用开源文生视频模型 Zeroscope V2 和音乐生成模型 MusicGen 自动合成视频与配乐并直播。视频先由 zeroscope_v2_576 生成 576x320 片段,可选经 zeroscope_v2_XL 放大至 1024x576,再经 FILM 插帧和 MusicGen 配乐,通过 FFmpeg 推流至 RTMP 服务器。
Hugging Face 梳理其开源文本生成与 LLM 生态,涵盖因果语言模型与 text-to-text 模型、许可协议、LLM 服务工具及 PEFT 微调。
Hugging Face 展示了在 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群上微调 Stable Diffusion 的完整流程,借助 AMX 加速器与 IPEX、oneCCL 实现分布式训练。
Viable 借助 GPT-4 以革命性规模分析定性数据,并实现前所未有的准确度。该能力面向大规模定性数据分析场景。
Hugging Face 博客介绍如何用 Transformers.js 制作完全在浏览器本地运行的实时 ML 网页游戏 Doodle Dash。作者基于 Google Quick, Draw!
推荐理由:完整演示了从微调 MobileViT 到用 Transformers.js 在浏览器内实时推理的端到端流程,可迁移到其他端侧 ML 项目。
Hugging Face Inference Endpoints 可将 Falcon 40B instruct 等开源 LLM 部署为生产级 API,无需管理基础设施,支持自动扩缩容与 scale-to-zero。
Hugging Face 发布教程,用 Node.js 调用 Inference Endpoints 上的 WizardCoder-15B,把提示词流式生成并直接渲染为 HTML 网页。
Writer 联合创始人兼 CTO Waseem Alshikh 与 Hugging Face 的 Jeff Boudier 对谈,讲述 Writer 从 Hugging Face 用户、客户到开源模型贡献者的历程。
OpenAI 分享了在 22 个国家开展对话所获得的洞察,并表示将把这些洞察纳入后续工作。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 视觉语言模型,相比 A100 实现 2.5 倍加速、相比 H100 实现 1.4 倍加速。
OpenAI 宣布首次国际扩张,在英国伦敦设立新办公室。这是 OpenAI 的首个海外办公室。
Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见来源与检测方法。文章列举了训练数据、预训练数据过滤、推理阶段 CLIP 模型、模型潜在空间及事后过滤等五类偏见来源,并指出 Stable Diffusion 安全过滤器主要识别色情内容,难以标记暴力等类型。
Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。
推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。
Hugging Face 于 6 月 12 日向美国商务部 NTIA 提交了关于 AI 问责政策的回应意见,强调文档规范与透明度在推动 AI 问责中的作用。其建议问责机制应覆盖 ML 开发全流程、结合内部要求与外部访问透明,并吸纳开发者、多学科研究社区、倡导组织、政策制定者和记者等最广泛参与者。
Hugging Face 发布教程,介绍如何为 Meta AI 的 MMS 模型微调 Adapter 层以适配低资源语言的 ASR 任务。MMS 预训练 checkpoint 覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错率。对低资源语言,Adapter 训练比全模型微调更省内存、更鲁棒且性能更好。
Hugging Face 用 Autoformer 与 DLinear 在 Traffic、Exchange-Rate、Electricity 三个数据集上对比。
Hugging Face 更新了平台内容政策,以应对机器学习内容审核带来的新挑战,并强调“同意”为核心价值。新政策关注用户对所见内容及自身身份与表达被呈现方式的同意权,同时禁止针对用户和 Hugging Face 员工的攻击性或骚扰性语言。平台鼓励通过 Community Tab 公开讨论并协作解决冲突,用户可通过 feedback@huggingface.co 反馈意见。
Elixir 社区用 Livebook 构建了一个基于 Whisper 的语音聊天应用,并部署到 Hugging Face Spaces,全程不到 15 分钟。该应用支持多人协作,可并发提供机器学习模型推理服务,并集成了 Hugging Face Models。Livebook 还作为 Space Docker 模板之一,可直接在 Hugging Face Spaces 中免费运行。
Hugging Face 博客介绍如何借助 Core ML 的新压缩与优化能力,在 iPhone、iPad 和 Mac 上更快运行 Stable Diffusion。
推荐理由:文章给出 6-bit palettization 的量化原理与转换命令,读者可据此把 Stable Diffusion 部署到 iPhone 和 Mac 本地运行。
OpenAI 宣布一系列 API 更新,包括更易引导的模型、函数调用能力、更长的上下文以及更低的价格。
推荐理由:OpenAI 官方公布 API 多项更新,读者可据此了解模型可控性、函数调用与价格的变化方向。
Hugging Face 宣布 AMD 正式加入其硬件合作伙伴计划,双方将共同在 AMD CPU 和 GPU 上优化 Transformer 模型性能。
Hugging Face Hub 目前托管超 190,000 个机器学习模型、33,000 个数据集和超 100,000 个应用与 demo,覆盖文本、图像、音频及多模态任务。这篇博客面向美术馆、图书馆、档案馆与博物馆(GLAM)从业者,介绍如何在 Hub 上按任务和语言筛选模型、用 model widget 测试效果,并以 CSV 格式上传 GLAM 数据集。
Hugging Face 在 Open LLM Leaderboard 评估套件中新增 GPT-4 评测,与 Scale AI 的人类标注对比,检验 LLM 能否替代人工标注偏好数据。
Hugging Face Hub 新增 DuckDB 集成,用户可直接用 SQL 查询 Hub 上任意公开数据集。数据集查看器会自动将所有公开数据集转换为 Parquet 文件,通过 /parquet 端点获取 URL 后,配合 DuckDB 的 httpfs 扩展即可查询远程文件,大型数据集被分片为 500MB 块。
Hugging Face 开始托管 Meta AI 开源的 fastText 官方镜像,涵盖全部 157 种语言的词向量和最新语言识别模型,用户可通过 huggingface_hub 的 hf_hub_download 几行命令下载使用。该集成还支持文本分类与特征提取 widget,模型页面提供语言识别和词向量最近邻查询的在线试用。
阿布扎比技术创新研究院发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:介绍 Falcon 系列的开源许可、训练数据与多查询注意力设计,并给出在 Hugging Face 生态中推理和微调的具体路径。
Hugging Face 发布教程,讲解如何用 Hugging Face Unity API 在 Unity 游戏中实现语音识别,将语音转为文本,可用于下达指令、与 NPC 对话或提升无障碍体验。