最新精选
第 181–200 条 · 共 212 条Mistral AI 发布最新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 使用,并首次通过 Azure 分发。官方称其在常用基准上表现强劲,是继 GPT-4 之后第二个可通过 API 获得的顶级模型,具备 32K token 上下文窗口、原生函数调用与 JSON 格式输出,原生支持英语、法语、西班牙语、德语和意大利语。
推荐理由:官方给出 Mistral Large 的基准对比、32K 上下文与函数调用能力,可据此判断其与 GPT-4 的定位差异。
- Hugging Face Blog精选AI 评分7878
Google 发布开源大模型家族 Gemma,包含 2B 和 7B 两种尺寸,各有基础版和指令微调版,上下文长度 8K tokens。Gemma-7B 在 LLM Leaderboard 上得分 63.75,性能接近 Mistral 7B;Hugging Face 提供了 Transformers、Google Cloud、Inference Endpoints 集成以及基于 TRL 的微调示例。
推荐理由:Google 发布 Gemma 开源模型家族,读者可了解其两种尺寸、性能位次及在 Hugging Face 生态中的部署与微调路径。
- Hugging Face Blog精选AI 评分6060
Hugging Face 发布 aMUSEd,这是对 Google MUSE 的开源复现,采用 Masked Image Model(MIM)而非主流潜在扩散方法,以研究预览形式在宽松许可下开放。
推荐理由:Hugging Face 开源复现 Google MUSE 的非扩散文生图模型,读者可了解 MIM 路线在推理步数与体积上的取舍。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,同时发布经监督微调和 DPO 优化的 Mixtral 8x7B Instruct。
推荐理由:官方给出稀疏 MoE 的参数量与推理成本结构,可据此判断开放权重模型在成本与性能间的取舍。
- Hugging Face Blog精选AI 评分8282
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,在多项基准上超过 Llama 2 70B 并追平 GPT-3.5,以 Apache 2.0 许可开放。
推荐理由:Hugging Face 官方给出 Mixtral 在自家生态的完整接入方式,包括推理、量化与单卡微调的具体路径。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文并下调价格,同时推出 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API 等开发者产品。
推荐理由:OpenAI 在 DevDay 一次性公布 GPT-4 Turbo、Assistants API 等多项更新,可据此了解其模型与开发者产品的整体走向。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地部署。官方称该模型在所有基准上超过 Llama 2 13B,在多项基准上超过 Llama 1 34B,代码能力接近 CodeLlama 7B。
推荐理由:官方给出 Mistral 7B 与 Llama 2 系列的逐项对比和滑动窗口注意力设计,可据此判断小参数模型的性价比边界。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布、可无限制使用。
推荐理由:Mistral AI 官方阐述开源模型路线,并给出 Mistral 7B 在标准基准上超越同规模开源模型的具体结果。
- Hugging Face Blog精选AI 评分6262
Würstchen 是一个文本条件扩散模型,其文本条件部分在高度压缩的潜空间中工作,通过 Stage A 的 VQGAN 与 Stage B 的 Diffusion Autoencoder 组成 Decoder,实现 42x 空间压缩,Stage C 作为 Prior 在该潜空间中训练。
推荐理由:原文给出 42x 空间压缩与训练算力对比,读者可据此判断高效扩散模型在成本上的取舍。
- Hugging Face Blog精选AI 评分7878
TII 发布 Falcon 180B 并上线 Hugging Face,参数规模 1800 亿,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。
推荐理由:Falcon 180B 以 1800 亿参数和 3.5 万亿 token 预训练规模进入开源生态,读者可据此了解当时开源模型与闭源模型的差距。
- Hugging Face Blog精选AI 评分8282
Meta 发布 Code Llama,基于 Llama 2 初始化并在 5000 亿 token 代码数据上训练,提供 7B、13B、34B 三种规格,另有 Python 专用版和指令微调版,采用与 Llama 2 相同的社区许可并允许商用。
推荐理由:梳理 Code Llama 三种规格与 Python 专用、指令微调变体的差异,并给出 Hugging Face 生态的接入方式与基准对比。
- Hugging Face Blog精选AI 评分7575
Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,接受任意图像与文本序列输入并生成文本,提供 9B 和 80B 两个参数规模及对应的 instruct 版本。
推荐理由:Hugging Face 复现了未开源的 Flamingo,并公开训练数据、技术教训与红队评估过程,读者可据此了解开源多模态模型的复现路径。
- Hugging Face Blog精选AI 评分8888
Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用宽松社区许可并允许商用。相比 Llama 1,预训练 token 增加 40%,上下文长度提升至 4k,70B 模型使用 grouped-query attention。
推荐理由:Meta 发布 Llama 2 并开放商用,Hugging Face 同步给出推理、部署与微调入口,可据此判断开源模型的可落地程度。
- Hugging Face Blog精选AI 评分7878
阿布扎比技术创新研究院发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。
推荐理由:介绍 Falcon 系列的开源许可、训练数据与多查询注意力设计,并给出在 Hugging Face 生态中推理和微调的具体路径。
- Hugging Face Blog精选AI 评分7878
BigCode 发布 StarCoder 与 StarCoderBase 两个代码大语言模型,基于 GitHub 上 80 多种编程语言的宽松许可数据训练,参数量约 15B、训练 1 万亿 token,上下文长度超过 8,000 token。
推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的水平与许可条件。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在许多真实场景中能力不及人类,但在多项专业和学术基准上达到人类水平。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入形态与基准表现,可据此了解这一代模型的能力边界。
OpenAI 发布 GPT-4,可生成、编辑并与用户迭代完成创意与技术写作任务,例如创作歌曲、撰写剧本,或学习用户的写作风格。
推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑与迭代能力。
- Hugging Face Blog精选AI 评分6262
Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿对)以及基于它训练的 ViT 和 ALIGN 模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。
推荐理由:Kakao Brain 公开了首个开源 ALIGN 模型及配套 COYO 数据集,读者可据此了解可复现的视觉语言训练路径。
OpenAI 宣布推出新的嵌入模型,官方称其在能力、成本和使用简便性上均有明显改进。
推荐理由:OpenAI 发布新版嵌入模型,官方称能力更强、成本更低且更易使用,可据此评估替换现有嵌入方案。
OpenAI 训练并发布名为 ChatGPT 的模型,以对话方式交互。官方称对话格式让 ChatGPT 能够回答追问、承认自身错误、质疑错误前提并拒绝不当请求。
推荐理由:OpenAI 官方给出 ChatGPT 的对话式交互定位,读者可据此了解其与以往模型在交互方式上的差异。