跳到正文

全部动态

今日 11 条
4月2日周二
4月1日周一
3月29日周五
3月28日周四
3月25日周一
3月22日周五
  1. Hugging Face Blog62

    Hugging Face 发布二值与标量嵌入量化方法,检索提速最高 45 倍

    Hugging Face 博客介绍嵌入量化方法,将 float32 嵌入转为二值或 int8,内存与磁盘占用分别缩小 32 倍和 4 倍。在 MTEB 检索的 15 个基准上,二值量化配合重排序可保留约 96% 的默认性能,检索速度平均提升 24.76 倍,int8 平均提升 3.66 倍。

    推荐理由:Hugging Face 官方给出嵌入量化在检索速度、内存与成本上的实测对比,并附可复用脚本。

3月21日周四
3月20日周三
  1. Hugging Face Blog62

    Cosmopedia:如何为 LLM 预训练构建大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于从零预训练大语言模型,目标是复现 Phi-1.5 的训练数据。

    推荐理由:Hugging Face 公开了从提示词设计到去污染、训练评估的完整合成数据流水线,可迁移到自建预训练数据。

  2. Hugging Face Blog62

    Hugging Face 博客介绍 GaLore:在消费级硬件上训练大模型

    Hugging Face 博客介绍 GaLore 优化器,通过将梯度投影到低秩子空间,可把优化器状态显存占用降低 82.5% 以上,从而在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 70 亿参数的 Llama 架构模型。

    推荐理由:原文给出 GaLore 与 8-bit 优化器结合的训练流程和可运行代码,读者可据此在消费级显卡上复现大模型训练。

3月18日周一
3月15日周五
  1. Hugging Face Blog40

    Hugging Face 发布 WebSight 数据集,用 VLM 将网页截图转为 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。

3月13日周三
3月8日周五
3月6日周三
3月5日周二
  1. Hugging Face Blog36

    Hugging Face 发布 ConTextual:评测多模态模型在文本密集场景中的图文联合推理能力

    加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。

3月4日周一
2月29日周四
2月28日周三
  1. Hugging Face Blog78

    BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集

    BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。

    推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、数据集与训练代码,读者可据此了解开源代码模型在参数规模与训练数据上的具体取舍。

2月27日周二
2月26日周一
  1. Mistral AI80

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 使用,并首次通过 Azure 分发。官方称其在常用基准上表现强劲,是继 GPT-4 之后第二个可通过 API 获得的顶级模型,具备 32K token 上下文窗口、原生函数调用与 JSON 格式输出,原生支持英语、法语、西班牙语、德语和意大利语。

    推荐理由:官方给出 Mistral Large 的基准对比、32K 上下文与函数调用能力,可据此判断其与 GPT-4 的定位差异。

  2. Mistral AI62

    Mistral AI 发布对话助手 Le Chat 及企业版

    Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法访问互联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。

    推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,读者可了解其模型接入方式与自部署能力。

2月23日周五