Falcon-Arabic:阿拉伯语语言模型的突破
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及最多 4 倍大的阿拉伯语 LLM,覆盖阿拉伯语 MMLU、Exams、MadinahQA 等任务。
阿联酋技术创新研究院(TII)发布 Falcon-Arabic,一款基于 Falcon 3 架构的 7B 参数多语言模型,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及最多 4 倍大的阿拉伯语 LLM,覆盖阿拉伯语 MMLU、Exams、MadinahQA 等任务。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,灵感来自 nanoGPT,可在免费 Colab 上启动训练。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
微软在 Build 大会上宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现已提供 10,000+ 个可一键部署的开源模型,覆盖文本、音频和图像任务。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。
OpenAI 发布 Codex。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。
Hugging Face 表示,未来目标是让 Transformers 成为各框架之间的枢纽:只要模型架构被 Transformers 支持,就能在生态其他工具中获得支持。
推荐理由:Hugging Face 说明 Transformers 将作为跨框架模型定义中枢,读者可了解其对训练、推理与本地部署工具链互通的影响。
Expedia Group 首席营销官 Jochen Koedijk 与 OpenAI 对话,讲述 AI 如何推动 Expedia 的营销演进。
Kaggle 上线与 Hugging Face 的集成,可直接在 Kaggle 上发现和使用 Hugging Face 模型。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较上一版最高提升 8 倍。
OpenAI 发布医疗 AI 评估基准 HealthBench,用于在真实场景中评测模型表现。该基准由 250 多名医生参与构建,旨在为医疗领域模型性能与安全性提供统一标准。
Hugging Face 发文回顾过去一年视觉语言模型(VLM)的关键变化,涵盖 any-to-any 模型、推理模型、小尺寸模型、MoE 解码器、视觉语言动作模型、多模态 RAG 与智能体、视频语言模型等新趋势。
Hugging Face 发文称 LeRobot 社区贡献数据集正快速增长,目标是把泛化当作数据问题,构建开放多样的“机器人 ImageNet”。目前上传数据集多集中在 So100 和 Koch 机械臂,社区案例还包括抽屉操作、国际象棋对局和动物玩偶交互等。文章同时指出,随着数据采集门槛降低,数据整理与策展将成为下一阶段挑战。
OpenAI 任命 Fidji Simo 加入领导层,Sam Altman 当天向公司内部发布了这一消息。
OpenAI 就 AI 基础设施议题向美国能源部提交回应,主张基础设施决定命运,并阐述美国应如何把握这一机遇。
OpenAI 在亚洲推出数据驻留功能,延续其面向全球客户的企业级数据隐私、安全与合规体系。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上水平,成本为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,读者可据此判断企业选型的成本与落地条件。
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。
圣安东尼奥马刺队正在使用定制 GPT 提升球迷互动、简化运营并推动各团队创新。该案例展示了 ChatGPT 在职业体育场景中,从球迷服务到内部流程的落地方式。
Lowe's 与 OpenAI 合作构建了 Mylow 和 Mylow Companion,这两款 AI 工具为顾客和门店员工提供专家级帮助,让复杂的家装项目更易规划、推进和完成。
OpenAI 推出 OpenAI for Countries 新计划,旨在支持希望基于民主 AI 基础设施进行建设的各国。该计划面向全球有意愿的国家,具体支持方式与可用范围尚未在原文中披露。
OpenAI 推出 AI stories,通过展示人们日常使用 AI 获得的收益,指向科学、医学、教育、国防等领域更大的机遇。Sam Altman 此前撰文称人类正进入 Intelligence Age,AI 将帮助人们变得更有能力,让当今最难的问题变得可解。
John Deere 的 Justin Rose 分享了公司如何借助 AI 改造农业,并规模化创新,帮助农民更智能、更高效、更可持续地作业。
OpenAI 董事会发布更新,宣布将其营利实体转型为公益公司(Public Benefit Corporation),在非营利监督下强化使命驱动的架构,以便扩大影响并长期与公共利益保持一致。
推荐理由:OpenAI 董事会披露营利实体转为公益公司的治理调整,读者可了解其非营利监督架构的延续方式。
Lowe's 高级副总裁 Chandhu Nair 分享了这家家居装修零售商如何利用 AI 推动零售业务。Nair 负责 Lowe's 的数据、AI 与创新业务。
OpenAI 就模型谄媚(sycophancy)问题发布进一步说明,复盘此前发现中的疏漏、出错原因,并公布将做出的后续调整。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四处关键变化:通过 enable_thinking 标志可开关推理,设为 false 时模板插入空对以跳过逐步思考,而 QwQ 等旧模型强制每轮生成思维链。
Hugging Face 发布教程,介绍如何用 Gradio 在几行 Python 代码内把应用变成 MCP Server,供 LLM 作为工具调用。只需在 launch() 中设置 mcp_server=True,Gradio 就会自动把函数转成 MCP 工具,并用 docstring 生成工具描述和参数,MCP 端点位于 /gradio_api/mcp/sse。
推荐理由:原文给出用 Gradio 把 Python 函数变成 MCP 工具的完整步骤,读者可据此把自有应用接入 LLM 工具调用。
OpenAI 已回滚上周的 GPT-4o 更新,ChatGPT 用户现在使用行为更平衡的早期版本。被移除的更新过度奉承或顺从,常被描述为谄媚。
推荐理由:OpenAI 官方说明回滚 GPT-4o 更新的原因,读者可了解模型行为调整的决策过程。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,实现 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Meta 发布 Llama Guard 4,一个从 Llama 4 Scout 剪枝而来的 12B 稠密多模态安全模型,可检测图像与文本输入输出中的不当内容,单张 24GB 显存 GPU 即可运行。
推荐理由:Meta 发布 12B 多模态安全模型与两款提示注入分类器,并给出可直接运行的 transformers 示例。
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由:ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
Hugging Face 发布 Tiny Agents 教程,展示如何用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体。
推荐理由:作者用 50 行代码演示 MCP 客户端与智能体的最小实现,读者可据此理解工具调用如何接入推理客户端。
ChatGPT for Business 迎来 2025 年 4 月更新,新增 o3、图像生成、增强记忆和内部知识四项能力。官方同步放出这些功能的上手演示。
OpenAI 将最新图像生成模型以 gpt-image-1 的名称开放到 API,开发者和企业可将其集成到自有工具和平台中,生成专业级、可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有产品的图像生成集成路径。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调版可完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
Speak 正在用 AI 为语言学习做个性化。OpenAI 与 Speak CEO 兼联合创始人 Connor Zwick 就此展开对话。
《华盛顿邮报》与 OpenAI 达成合作,将其新闻内容整合进 ChatGPT,为用户提供摘要、引语和原文报道的直接链接。
TNG 在 24 张 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章拆解了 LLM 生成的两个阶段:prefill 阶段并行处理全部输入 token,decode 阶段只能逐个串行生成输出 token,二者分别对应首 token 延迟和单 token 延迟两个指标。