Hugging Face Blog·· 2026-04-28精选AI 评分74
NVIDIA 发布 Nemotron 3 Nano Omni:面向文档、音频与视频智能体的长上下文全模态模型
Introducing NVIDIA Nemotron 3 Nano Omni: Long-Context Multimodal Intelligence for Documents, Audio and Video Agents
AI 导读
NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。
推荐理由
原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。
来源:Hugging Face Blog · huggingface.co