Hugging Face 与 Albumentations AI 推出面向文档图像的 TextImage 数据增强
Hugging Face 与 Albumentations AI 合作推出 TextImage 数据增强流程,可同时修改文档图像及其文本标注,用于视觉语言模型(VLM)微调。该流程支持随机插入、删除、交换和停用词替换等文本增强,并配合图像黑化与修复,保持文本质量。初始版本中的同义词替换因耗时过高已被移除。
Hugging Face 与 Albumentations AI 合作推出 TextImage 数据增强流程,可同时修改文档图像及其文本标注,用于视觉语言模型(VLM)微调。该流程支持随机插入、删除、交换和停用词替换等文本增强,并配合图像黑化与修复,保持文本质量。初始版本中的同义词替换因耗时过高已被移除。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Gemma 2 新增 2B 小模型、安全分类器和可解释性工具,读者可据此判断端侧部署与安全过滤的可用选项。
Mistral AI 发布专注 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%,在同规模模型中达到 SOTA。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三个参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了三个尺寸小模型的训练数据配比与评测对比,可据此判断端侧小模型的选型与数据策略。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均含 5.6 个测试用例、分支覆盖率 99%。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)Trainer,作为 PPO 之外的在线 RLHF 训练算法。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 上线 LiveCodeBench 排行榜,该基准由 UC Berkeley、MIT 和 Cornell 研究者开发,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,通过组合 OWL-ViT、Mobile Sam 和 RAM 等模型输出物体的 (x, y, z) 坐标,无需训练即可开箱使用。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重以及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用人类越狱提示词测试前沿模型的安全鲁棒性,最终得分为判定为 Safe 的提示词百分比。
Hugging Face 在 PEFT 中新增面向 LoRA 适配器的合并方法,包括 cat、linear、svd、TIES、DARE 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
推荐理由:PEFT 新增多种 LoRA 合并方法并给出选型顺序,读者可据此判断不同适配器组合该用哪种策略。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类评估 LLM 推理能力。
IBM Research 与 Hugging Face 团队合作,在 Transformers 库中发布了轻量级时序建模模型 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch、通道和隐藏特征的轻量混合,可预训练后用于预测、分类和回归等下游任务。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 在 trl 库中集成 DDPOTrainer,可用 DDPO(Denoising Diffusion Policy Optimization)对 Stable Diffusion 做强化学习微调。
Hugging Face 发布教程,展示非工程师如何零代码训练 LLaMA 2 聊天机器人。流程分三步:用 Spaces 部署 AutoTrain 和 ChatUI 模板,在 AutoTrain 中选用 Meta Llama 2 7b 基础模型、A10G Large GPU 和 Alpaca 指令数据集完成微调,再通过 ChatUI 部署成可分享的聊天应用。
Hugging Face 将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 甚至 2-bit 精度量化和运行大语言模型,4-bit 量化精度损失可忽略,小批量下推理速度与 fp16 基线相当。
推荐理由:原文给出了 GPTQ 在 Transformers 中的集成方式与显存、延迟对比数据,读者可据此判断量化部署的可行边界。
这篇教程演示了如何用 OpenAI 开源扩散模型 Shap-E 从文本生成 3D 模型,再经 Blender 的 Decimate 修改器减面、用 Dream Textures 插件生成无缝贴图,最终导出 FBX 并导入 Unity。流程面向 PS1 低多边形风格,以规避当前 text-to-3D 模型精度不足的问题,需具备 Blender 与 UV 映射基础。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持以 4-bit 精度加载和运行模型,覆盖文本、视觉、多模态等大多数 HF 模型,并可在 4bit 模型上训练适配器。
推荐理由:Hugging Face 把 4-bit 量化与 QLoRA 集成进 transformers,读者可据此判断消费级硬件微调大模型的门槛变化。
Hugging Face 探索用指令微调让 Stable Diffusion 按指令处理输入图像,方法基于 InstructPix2Pix 的训练策略并借鉴 FLAN 的指令模板思路。
Hugging Face 团队基于 BigCode 的 16B 参数 StarCoder 模型,用 OpenAssistant 对话数据集微调出编码助手 StarChat,并公开了代码、数据集与模型。
推荐理由:原文完整给出了用对话数据微调 StarCoder 的流程与代码,读者可据此复现一个开源编码助手。
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练流程,用 LLaMA 7B 在 Stack Exchange 问答数据上依次完成监督微调、奖励建模和 PPO 强化学习,训练管线已集成到 TRL 库。
推荐理由:Hugging Face 公开了用 RLHF 训练 LLaMA 的完整流程与代码,读者可据此复现并迁移到自己的任务。
Hugging Face 发布 PEFT 库,提供 LoRA、Prefix Tuning、Prompt Tuning、P-Tuning 等参数高效微调方法,并与 Transformers 和 Accelerate 集成。
推荐理由:原文给出 PEFT 库支持的方法与消费级硬件上的微调示例,读者可据此判断低成本微调的可行路径。
Hugging Face 发布开源工具 AI vs. AI,用于在深度强化学习多智能体场景中对模型进行相对排名。该工具由 Space 匹配算法、Dataset 结果存储和展示 ELO 评分的 Leaderboard 三部分组成,模型上传至 Hub 后即自动参与对战评估,初始 ELO 为 1200。
Elixir 社区推出 Bumblebee 库,用纯 Elixir 实现了 Hugging Face Transformers,让 GPT2 到 Stable Diffusion 等模型可在 Elixir 中运行。
中国科学技术大学与微软提出的 VQ-Diffusion 是一种在量化隐空间上做加噪与去噪的条件隐扩散模型,其隐空间由离散向量集合构成。Hugging Face 现已支持通过 Diffusers 用几行代码运行该模型,加载 microsoft/vq-diffusion-ithq,并可选 FP16 权重。
rinna 通过对 Stable Diffusion 进行微调,开发出日文文生图模型 Japanese Stable Diffusion,可理解日语特有词汇、拟声词与专有名词并生成日式风格图像。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个用于 Sentence Transformers 少样本微调的框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可据此判断少样本分类的成本与精度取舍。
Hugging Face 发布教程,教你用 transformers 库的 Trainer 和自定义 Data Collator,在 Google Colab 上从零训练一个离线 Decision Transformer,让 HalfCheetah 学会奔跑。
Hugging Face 发布新库 Skops,支持将 scikit-learn 模型托管到 Hugging Face Hub,并可为模型创建 model card 进行文档化与协作。Skops 通过 hub_utils.init 生成含模型与环境配置的本地仓库,后端使用 joblib 加载模型,Card 类可自动填充超参数、模型结构图及推理组件所需元数据。
Hugging Face 发文介绍如何以 Sentence Transformers(ST)为例从零上手一个新 ML 库并完成首个自驱项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目和包依赖它。
Graphcore 与 Hugging Face 扩展了开源库 Optimum 中的模型阵容,新增覆盖 NLP、语音和计算机视觉的 10 个 IPU 优化 Transformer 模型,均附带 IPU 配置文件和预训练、微调权重。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实数据。在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
Hugging Face Hub 推出 emissions_threshold 参数,可按训练碳排放量筛选模型,例如搜索排放不超过 100 克的模型可返回 191 个结果。Transformers 集成 codecarbon,训练时自动记录排放数据并生成 emissions.csv,方便写入模型卡。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个 Gym 环境连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
huggingface_hub 库新增 ModelSearchArguments 和 ModelFilter 类,让用户无需离开 IDE 即可通过 Python API 搜索 Hub 上的模型和数据集。
Hugging Face 将 PyTorch 深度强化学习库 Stable-Baselines3 集成到 Hugging Face Hub,用户可通过 huggingface_sb3 库上传和加载已保存的智能体模型。