在 GCP 第五代 Xeon 上基准测试语言模型性能
Hugging Face 在 Google Cloud 的 N2(第三代 Xeon)与 C4(第五代 Xeon)实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载。
Hugging Face 在 Google Cloud 的 N2(第三代 Xeon)与 C4(第五代 Xeon)实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载。
Hugging Face 发布 Synthetic Data Generator,一个无代码应用,用户用自然语言描述需求即可生成自定义数据集。工具目前支持文本分类和聊天数据集,背后由 distilabel 和免费的 Hugging Face text-generation API 驱动,文本分类和聊天分别约每分钟生成 50 和 20 个样本。
OpenAI 回应马斯克最新法律诉讼,称这是其不到一年内的第四次尝试。OpenAI 指出,2017 年马斯克不仅想要、而且实际创建了营利性实体作为 OpenAI 拟议的新架构。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并首发数据集 LeMat-Bulk,将 Materials Project、Alexandria 和 OQMD 三大材料数据库统一为标准格式,含 6.7M 条数据、7 种材料属性,采用 CC-BY-4.0 许可。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行延展、重混与融合,或直接由文本生成全新内容。
推荐理由:OpenAI 官方公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断可用性。
Hugging Face 的 83 个开源模型现已通过 Amazon Bedrock Marketplace 提供给 AWS 客户,底层由 Amazon SageMaker JumpStart 托管端点。
电影制作人 Lyndon Barrois 介绍了如何将 Sora 用作叙事工具。他借助 Sora 创造新的世界,并将其视为一种讲故事的创作手段。
OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位为面向叙事与创意表达的扩展工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型沿革,可据此了解其能力边界。
跨学科艺术家 Minne Atairu 讲述 Sora 如何帮助她实现自己的创作构想。
电影创作组合 Vallée Duhamel 讲述了如何借助 OpenAI 的 Sora 构建新的世界。
OpenAI 发布面向产品团队的 AI 应用指南,帮助产品团队将 AI 投入实际工作。内容来自 OpenAI News,聚焦 AI 在产品团队工作场景中的落地使用。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
OpenAI 发布 ChatGPT Pro,官方称其用于扩大前沿 AI 的使用范围。材料仅提供标题和一句摘要,未给出定价、功能或可用范围等细节。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。
推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。
Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,每种均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。
推荐理由:PaliGemma 2 给出 3B 到 28B 三种规模与三种分辨率组合,读者可据此判断视觉语言模型的微调选型空间。
OpenAI 与全球专业媒体平台 Future 宣布战略合作,将 Future 旗下 200 多个媒体品牌的内容带给 OpenAI 用户。
Morgan Stanley 正借助 AI 评估(AI evals)推动金融服务变革。该机构将 AI 评估用于塑造金融服务的未来,具体做法与成效未在文中展开。
Hugging Face 发布面向阿拉伯语 LLM 的生成式任务基准与榜单 AraGen,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度由 LLM-as-judge 打分。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 与 Argilla,用 Llama 3.1 生成标注并经人工复核,再微调小模型完成金融新闻的命名实体识别。
Hugging Face 发布开源开发者指南,解读已正式生效的欧盟《人工智能法案》。该法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接约束,训练算力超 10^25 FLOPs 的模型需按系统性风险处理。指南建议开发者提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具以准备合规。
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。
推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。
Hugging Face 博客通过逐步迭代改进位置编码方案,最终推导出被 Llama 3.2 及多数现代 Transformer 采用的旋转位置编码(RoPE)。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。红队测试通过模拟对抗性攻击来发现模型的安全漏洞与滥用风险,人类专家与 AI 的协作方式成为其探索方向。
OpenAI 发布案例,展示如何用 GPT-4o 的视觉微调能力构建更智能的地图。
BAAI 推出 FlagEval Debate 辩论平台,让大模型直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言的辩论赛。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义功能,可调整模型参数、策略与对话风格。2024 年 Q3 的实验显示,当前大多数模型都能参与辩论。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式测试。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译,旨在为日语 LLM 提供集中、开放的比较平台。
Rox 宣布“all in”OpenAI,将商业经验与深厚的大语言模型专业能力同 OpenAI 的模型结合,目标是让每位销售都成为前 1% 的顶尖销售。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 评审模型的评分和理由进行投票对比的平台,结果汇总为按 Elo 分数每小时更新的公开榜单。
Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 功能:带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词并分享给同事的智能体。
推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与智能体,并给出与主流助手的逐项对比。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开源权重多模态模型,由 123B 多模态解码器和 1B 参数视觉编码器组成,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 在 MathVista、DocVQA 等基准上的对比数据,可据此判断开源多模态模型的当前水平。
OpenAI 在法国开设了其在欧洲大陆的首个办公室。这是 OpenAI 在欧洲大陆的第一处办公据点,此前其欧洲布局仅覆盖英国等地。
雅诗兰黛公司使用 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察并加速美妆创新。该案例展示了 OpenAI 企业级产品在美妆行业的数据驱动应用。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向批量数据处理场景,用户上传批处理文件后下载输出结果,适用于客户反馈与情感分析、文档批量摘要与翻译、向量嵌入建索引和数据标注。目前覆盖 La Plateforme 上全部模型,每个工作区限制 100 万个进行中请求,后续将登陆其云厂商合作伙伴。
Mistral AI 发布新的内容审核 API,即 Le Chat 中审核服务所用的同一套接口,现开放给用户按自身应用和安全标准定制。该模型是基于 LLM 的分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语料涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Hugging Face 与 PyCharm 完成集成,开发者可在 IDE 内右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。