Hugging Face 推出 HUGS 生成式 AI 服务,零配置部署开源模型
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,并引入 fp32、fp16、q8、q4 等 dtype 量化选项。
推荐理由:官方给出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Stability AI 发布 Stable Diffusion 3.5,包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,已在 Hugging Face Hub 上线并可通过 Diffusers 使用。
推荐理由:Diffusers 官方给出 SD3.5 Large 的量化推理与 LoRA 训练路径,可据此判断消费级显卡的可用性。
Hugging Face 发布 Gradio 5 稳定版,开发者用几行 Python 即可构建生产级机器学习 Web 应用,可通过 pip install --upgrade gradio 升级。
推荐理由:官方列出 Gradio 5 在 SSR 加载、实时流式与安全审计上的具体改动,便于判断是否值得升级。
OpenAI 发布 canvas,一种在 ChatGPT 中写作和编码的新方式。官方称其面向写作与编码场景,具体功能细节尚未在摘要中给出。
推荐理由:OpenAI 官方发布 ChatGPT 的写作与编码新界面 canvas,读者可据此了解交互形态的变化。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 开放 Realtime API,开发者可据此判断语音交互应用的接入方式与能力边界。
OpenAI 宣布开发者现在可以用图像和文本对 GPT-4o 进行微调,以提升视觉能力。
推荐理由:OpenAI 把图像纳入微调 API,开发者可据此判断视觉任务能否用自有数据定制。
OpenAI 在 API 中推出提示词缓存(Prompt Caching),对模型近期已见过的输入自动提供折扣。官方说明该机制为自动生效,无需额外配置。
OpenAI 在 API 中推出模型蒸馏功能,可用大型前沿模型的输出微调成本更低的模型,全部在 OpenAI 平台上完成。
Altera 借助 GPT-4o 构建智能体与人类协作的新领域。该方向聚焦 agent 与人的协同交互,具体产品形态与可用性尚未披露。
OpenAI 推出基于 GPT-4o 的新多模态审核模型,可更准确地检测有害文本和图像,帮助开发者构建更稳健的审核系统。该模型已用于升级 Moderation API。
明尼苏达州企业翻译办公室使用 ChatGPT 弥合语言鸿沟。
Mercado Libre 推出 AI 开发平台 Verdi,由 GPT-4o 驱动。
OpenAI 与巴西合作,利用 GPT-4 改善当地的教学与学习。该举措面向巴西的教育场景,旨在提升教与学的效果。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 和 Codestral 输入输出价格均下调 80%,Mistral Large 下调 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,可据此判断其 API 成本与部署选择。
Hugging Face 在 Hub 的每个数据集页面新增 SQL Console,可直接在浏览器中对数据集运行 SQL 查询。该控制台由 DuckDB WASM 驱动,完全在本地运行,支持完整 DuckDB 语法、结果导出为 parquet,并可通过链接分享公开数据集的查询结果。官方称内存上限约 3GB,DuckDB WASM 尚未支持 hf:// 协议查询数据集。
推荐理由:官方给出浏览器内 SQL 查询数据集的能力与内存限制,读者可据此判断能否替代本地预处理脚本。
HuggingChat 发布 Community Tools,用户可把 Hugging Face 上任意公开 Space 转成模型可直接调用的工具,并借此扩展了图像理解、视频生成和文本转语音等多模态能力。
推荐理由:HuggingChat 把任意 Space 变成可调用工具,读者可据此判断多模态与自定义工具如何接入对话流程。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
遗传学家 Catherine Brownstein 展示了 OpenAI o1 如何加速罕见医学难题的诊断流程。该演示聚焦于将 o1 用于基因数据解读,以缩短罕见病的诊断周期。
量子物理学家 Mario Krenn 使用 OpenAI o1 协助回答量子物理领域的重大问题。
Ada 借助 GPT-4 提升客户服务标准。该案例展示了 GPT-4 在客户服务场景中的实际应用。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,使免 padding 的指令微调打包与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍且收敛质量不变。
OpenAI 宣布 GPT-4o 现已支持微调。
Indeed 借助 OpenAI 为其全球最大求职网站提供情境化职位匹配,每月服务超 3.5 亿独立访客,连接逾 350 万雇主和超 3200 万个职位,平均每三秒就有一人通过 Indeed 获得录用。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一套代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,无需或只需极少模型专属改动。
推荐理由:Hugging Face 把工具调用统一进 chat template,读者可据此判断跨模型复用同一套代码的可行边界。
Mistral AI 宣布在 La Plateforme 上支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行定制,可通过基础提示词、few-shot 提示或微调实现,并支持自带数据集。
OpenAI 在 API 中推出结构化输出,模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,开发者可据此判断 JSON Schema 约束对下游解析流程的影响。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、GPG commit signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化恶意软件、pickle 与密钥扫描。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 上以标准化 API 对 Llama、Mistral 等开源模型运行推理。
OpenAI 正在测试 SearchGPT,这是新搜索功能的临时原型,可提供快速及时的答案并附上清晰相关的来源。
推荐理由:OpenAI 官方公布搜索功能原型 SearchGPT 的测试消息,可据此了解其搜索产品的方向。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
OpenAI 为 ChatGPT Enterprise 新增 Compliance API 集成、SCIM 和 GPT 控制功能,用于支持大规模合规项目、数据安全与用户访问管理。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者验证自身的 PII 过滤流程。
Hugging Face 与 KerasHub 宣布共享模型保存格式,Hugging Face Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub。首批支持 Gemma 1/2、Llama 3 和 PaliGemma,模型可在 TensorFlow、JAX、PyTorch 后端间一行代码切换。需升级 keras-hub 及 keras>=3.3.3。
Hugging Face 用户现可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 为 Dataset Hub 的数据集搜索新增四项筛选功能:按模态(文本、图像、音频、表格、时间序列、3D、视频、地理空间)、按行数大小、按格式(如 Parquet、WebDataset)以及按兼容库(如 Pandas、Dask、Datasets)搜索。
XLSCOUT 发布专为专利与知识产权打造的嵌入模型 ParaEmbed 2.0,基于高质量多领域专利数据微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Paf 在全公司采用 ChatGPT Enterprise,工程师每天用自定义 GPT 加速日常开发任务,70% 员工活跃使用,覆盖财务、HR、营销和客服等业务团队。Paf 还将 ChatGPT Enterprise 接入 grit:lab 编程学院,让学员从第一天起就以 AI 增强的系统架构思维学习。
Color Health 与 OpenAI 合作推出 Cancer Copilot,利用 GPT-4o 识别缺失的诊断项目并生成个性化检查方案,帮助医疗人员就癌症筛查和治疗做出循证决策,从而加速癌症患者获得治疗。