Minne Atairu 谈如何用 Sora 实现创作构想
跨学科艺术家 Minne Atairu 讲述 Sora 如何帮助她实现自己的创作构想。
跨学科艺术家 Minne Atairu 讲述 Sora 如何帮助她实现自己的创作构想。
电影创作组合 Vallée Duhamel 讲述了如何借助 OpenAI 的 Sora 构建新的世界。
OpenAI 发布面向产品团队的 AI 应用指南,帮助产品团队将 AI 投入实际工作。内容来自 OpenAI News,聚焦 AI 在产品团队工作场景中的落地使用。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
OpenAI 发布 ChatGPT Pro,官方称其用于扩大前沿 AI 的使用范围。材料仅提供标题和一句摘要,未给出定价、功能或可用范围等细节。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。
推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个聊天机器人竞技场,测试 LLM 能否根据用户的自然语言反馈修正自己生成的代码。实验在 TPU v5e 2x4 上同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,以 bfloat16 格式运行,通过 Gradio 界面并行对话并随时切换模型。
Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,每种均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。
推荐理由:PaliGemma 2 给出 3B 到 28B 三种规模与三种分辨率组合,读者可据此判断视觉语言模型的微调选型空间。
OpenAI 与全球专业媒体平台 Future 宣布战略合作,将 Future 旗下 200 多个媒体品牌的内容带给 OpenAI 用户。
Morgan Stanley 正借助 AI 评估(AI evals)推动金融服务变革。该机构将 AI 评估用于塑造金融服务的未来,具体做法与成效未在文中展开。
Hugging Face 发布面向阿拉伯语 LLM 的生成式任务基准与榜单 AraGen,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度由 LLM-as-judge 打分。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 与 Argilla,用 Llama 3.1 生成标注并经人工复核,再微调小模型完成金融新闻的命名实体识别。
Hugging Face 发布开源开发者指南,解读已正式生效的欧盟《人工智能法案》。该法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接约束,训练算力超 10^25 FLOPs 的模型需按系统性风险处理。指南建议开发者提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具以准备合规。
Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)并构建自定义传输协议。新方案按字节级分析文件,上传时仅传输必要的新 chunk,并探索压缩 Safetensors 张量文件,有望将上传速度提升 10-25%。读取路径仍由 S3 存储、CloudFront 作为 CDN,CAS 节点将部署在 AWS 少数区域以平衡成本与延迟。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。
推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。
Hugging Face 博客通过逐步迭代改进位置编码方案,最终推导出被 Llama 3.2 及多数现代 Transformer 采用的旋转位置编码(RoPE)。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。红队测试通过模拟对抗性攻击来发现模型的安全漏洞与滥用风险,人类专家与 AI 的协作方式成为其探索方向。
OpenAI 发布案例,展示如何用 GPT-4o 的视觉微调能力构建更智能的地图。
BAAI 推出 FlagEval Debate 辩论平台,让大模型直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言的辩论赛。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义功能,可调整模型参数、策略与对话风格。2024 年 Q3 的实验显示,当前大多数模型都能参与辩论。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的早期层生成 draft token、深层网络负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)将文件拆分为可变大小的块,仅传输和存储修改过的块,从而提升存储与迭代效率。在 CORD-19 数据集基准测试中,Xet 后端将平均下载时间从 51 分钟降至 19 分钟,上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式测试。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译,旨在为日语 LLM 提供集中、开放的比较平台。
Rox 宣布“all in”OpenAI,将商业经验与深厚的大语言模型专业能力同 OpenAI 的模型结合,目标是让每位销售都成为前 1% 的顶尖销售。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 评审模型的评分和理由进行投票对比的平台,结果汇总为按 Elo 分数每小时更新的公开榜单。
Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 功能:带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、由新多模态模型 Pixtral Large 支持的文档与图像理解、由 Black Forest Labs Flux Pro 支持的图像生成,以及可复用提示词并分享给同事的智能体。
推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与智能体,并给出与主流助手的逐项对比。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开源权重多模态模型,由 123B 多模态解码器和 1B 参数视觉编码器组成,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 在 MathVista、DocVQA 等基准上的对比数据,可据此判断开源多模态模型的当前水平。
OpenAI 在法国开设了其在欧洲大陆的首个办公室。这是 OpenAI 在欧洲大陆的第一处办公据点,此前其欧洲布局仅覆盖英国等地。
雅诗兰黛公司使用 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察并加速美妆创新。该案例展示了 OpenAI 企业级产品在美妆行业的数据驱动应用。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向批量数据处理场景,用户上传批处理文件后下载输出结果,适用于客户反馈与情感分析、文档批量摘要与翻译、向量嵌入建索引和数据标注。目前覆盖 La Plateforme 上全部模型,每个工作区限制 100 万个进行中请求,后续将登陆其云厂商合作伙伴。
Mistral AI 发布新的内容审核 API,即 Le Chat 中审核服务所用的同一套接口,现开放给用户按自身应用和安全标准定制。该模型是基于 LLM 的分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语料涵盖阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Hugging Face 与 PyCharm 完成集成,开发者可在 IDE 内右键选择 "Insert HF Model",按 image-text-to-text 等任务筛选模型并直接插入示例代码,例如 microsoft/Phi-3.5-vision-instruct。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接在 UI 中从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开 Hub 数据集,默认部署启用 Hugging Face OAuth,方便社区或团队协作标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,仍保留 Python SDK 供进一步定制。
OpenAI 发布 ChatGPT 搜索,可快速给出带相关网页来源链接的及时回答。
推荐理由:OpenAI 官方发布 ChatGPT 搜索,读者可了解其以网页来源链接支撑实时回答的定位。
Promega 自上而下推行的 ChatGPT 应用,正在加速其制造、销售与营销环节。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实型问题的能力。该基准聚焦短小、寻求事实的提问场景,评估模型的事实准确性。
Decagon 与 OpenAI 合作,实现大规模、全自动的高性能客户支持。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评测体系,用于衡量 RAG 回答的质量。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。