跳到正文

全部动态

今日 7 条
12月17日周二
12月16日周一
12月13日周五
12月10日周二
12月9日周一
  1. OpenAI News80

    OpenAI 视频生成模型 Sora 上线 sora.com

    OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行延展、重混与融合,或直接由文本生成全新内容。

    推荐理由:OpenAI 官方公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断可用性。

  2. OpenAI News70

    OpenAI 发布 Sora 视频生成模型系统卡

    OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位为面向叙事与创意表达的扩展工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型沿革,可据此了解其能力边界。

12月5日周四
  1. OpenAI News62

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。

    推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。

  2. Hugging Face Blog22

    LLM 修复自身错误的能力如何?基于 Keras 和 TPU 的聊天机器人竞技场实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。

  3. Hugging Face Blog60

    Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模

    Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,每种均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。

    推荐理由:PaliGemma 2 给出 3B 到 28B 三种规模与三种分辨率组合,读者可据此判断视觉语言模型的微调选型空间。

12月4日周三
12月3日周二
12月2日周一
  1. Hugging Face Blog42

    开源开发者指南:欧盟《人工智能法案》要点解读

    Hugging Face 发布开源开发者指南,解读已正式生效的欧盟《人工智能法案》。该法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接约束,训练算力超 10^25 FLOPs 的模型需按系统性风险处理。指南建议开发者提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具以准备合规。

11月26日周二
  1. Hugging Face Blog34

    Hugging Face 重构 Hub 上传与下载架构

    Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。

  2. Hugging Face Blog62

    Hugging Face 发布 2B 视觉语言模型 SmolVLM

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。

    推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。

11月25日周一
11月21日周四
11月20日周三
  1. Hugging Face Blog38

    让大模型辩论:首届多语言 LLM 辩论赛 FlagEval Debate 举办

    BAAI 推出 FlagEval Debate 辩论平台,让大模型直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言的辩论赛。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义功能,可调整模型参数、策略与对话风格。2024 年 Q3 的实验显示,当前大多数模型都能参与辩论。

11月19日周二
  1. OpenAI News15

    Rox 全面押注 OpenAI

    Rox 宣布“all in”OpenAI,将商业经验与深厚的大语言模型专业能力同 OpenAI 的模型结合,目标是让每位销售都成为前 1% 的顶尖销售。

11月18日周一
  1. Mistral AI72

    Mistral AI 为 le Chat 加入联网搜索、Canvas 与图像生成等测试功能

    Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 功能:带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词并分享给同事的智能体。

    推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与智能体,并给出与主流助手的逐项对比。

  2. Mistral AI78

    Mistral AI 发布 124B 开源多模态模型 Pixtral Large

    Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开源权重多模态模型,由 123B 多模态解码器和 1B 参数视觉编码器组成,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。

    推荐理由:官方给出 Pixtral Large 在 MathVista、DocVQA 等基准上的对比数据,可据此判断开源多模态模型的当前水平。

11月15日周五
11月13日周三
11月12日周二
11月7日周四
  1. Mistral AI40

    Mistral AI 推出 Batch API,成本比同步调用低 50%

    Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向批量数据处理场景,用户上传批处理文件后下载输出结果,适用于客户反馈与情感分析、文档批量摘要与翻译、向量嵌入建索引和数据标注。目前覆盖 La Plateforme 上全部模型,每个工作区限制 100 万个进行中请求,后续将登陆其云厂商合作伙伴。

  2. Mistral AI57

    Mistral AI 发布内容审核 API

    Mistral AI 发布新的内容审核 API,即 Le Chat 中审核服务所用的同一套接口,现开放给用户按自身应用和安全标准定制。该模型是基于 LLM 的分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语料涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

11月5日周二