在 ChatGPT 中处理文件
OpenAI 介绍在 ChatGPT 中处理文件的实用方法,涵盖查找信息、整理、转换文档以及将文件用于工作流。
OpenAI 介绍在 ChatGPT 中处理文件的实用方法,涵盖查找信息、整理、转换文档以及将文件用于工作流。
OpenAI 发布指南,介绍如何创建和使用 ChatGPT 技能(skills),以构建可复用工作流、自动化重复性任务并保证稳定高质量的输出。
OpenAI 发布面向金融服务机构的 AI 资源,包括提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
ChatGPT 的 projects 功能可用来组织对话、文件与指令,管理持续推进的工作并提升协作效率。该指南介绍了如何借助 projects 归整聊天记录与文件、设置指令,从而更有效地开展协作。
OpenAI 介绍 ChatGPT 的个性化方式:通过自定义指令和记忆功能,让回复更相关、更一致、更贴合个人需求。
ChatGPT 支持通过清晰的提示词生成图像,并可对设计进行迭代优化,在几分钟内产出高质量视觉内容。
OpenAI 介绍如何用 ChatGPT 进行头脑风暴:借助它发散想法、梳理思路,并把粗略概念转化为结构化、可执行的计划。
OpenAI 发布指南,介绍如何用 ChatGPT 的搜索与深度研究(deep research)功能开展研究,以获取最新信息、分析来源并生成结构化洞察。
OpenAI 介绍运营团队如何使用 ChatGPT 简化工作流、改善协作、标准化流程并加快执行速度。
OpenAI 发文介绍临床医生如何使用 ChatGPT 支持诊断、病历记录与患者护理,并强调相关工具具备安全、符合 HIPAA 的合规能力。
OpenAI 介绍如何用 ChatGPT 探索数据集、生成洞察并创建可视化,进而把分析结果转化为可执行的决策。
OpenAI 发布指南,介绍如何用 ChatGPT 做研究:收集来源、分析信息,并生成结构化、带引用的洞察。
OpenAI 发布 AI 负责任与安全使用指南,围绕安全性、准确性和透明度给出最佳实践,适用于 ChatGPT 等工具的使用场景。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Sentence Transformers 发布 v5.4,可在同一套 API 下编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持模型。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此评估跨模态检索的落地成本。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可实时生成最高 720p、60 FPS 的环境,并新增面向更广消费级硬件的 360p 版本,后续将支持 Apple Silicon Mac。
推荐理由:Waypoint-1.5 把实时交互世界模型下放到消费级显卡,读者可据此判断本地生成式世界的硬件门槛变化。
CyberAgent 借助 ChatGPT Enterprise 和 Codex 在广告、媒体与游戏业务中安全扩大 AI 应用,提升质量并加快决策。该案例展示了企业如何在多业务线中规模化部署 AI 工具。
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文文本生成出版级图表,ScholarPeer 则自动完成文献检索与论文评审。
OpenAI 阐述了企业级 AI 的下一阶段,随着各行业采用加速,其企业产品线涵盖 Frontier、ChatGPT Enterprise、Codex 以及公司范围内的 AI 智能体。
OpenAI 发布 Child Safety Blueprint,一套面向 AI 负责任构建的路线图,涵盖安全防护措施、适龄设计与多方协作,目标是保护并赋能年轻人在线使用 AI。
Safetensors 已加入 PyTorch 基金会,成为 Linux 基金会下由基金会托管的项目,与 DeepSpeed、Helion、Ray、vLLM 和 PyTorch 并列。
OpenAI 推出试点项目 OpenAI Safety Fellowship,用于支持独立的安全与对齐研究,并培养下一代人才。该项目为试点性质,具体资助规模、申请条件与时间安排尚未在公告中披露。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖端侧到工作站,并给出 Apache 2.0 许可与首日工具链支持,便于开发者判断本地部署与微调路径。
OpenAI 宣布收购 TBPN,以加速围绕 AI 的全球对话并支持独立媒体,扩大与开发者、企业和更广泛科技社区的交流。
推荐理由:OpenAI 收购 TBPN 以扩大 AI 对话与独立媒体支持,读者可了解其媒体与社区布局。
OpenAI 为 Codex 在 ChatGPT Business 和 Enterprise 中新增按量付费(pay-as-you-go)定价,让团队能以更灵活的方式开始使用并扩展规模。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 上线,采用 Apache 2 许可,支持图像、文本和音频输入并生成文本。
推荐理由:Gemma 4 以 Apache 2 许可开放五个尺寸并覆盖音频与端侧部署,读者可据此判断开源多模态模型的可用边界。
TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词表定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干感知路线相对模块化管线的取舍。
Gradient Labs 基于 GPT-4.1 和 GPT-5.4 mini、nano 构建 AI 智能体,为每位银行客户提供 AI 客户经理,自动处理银行客服工作流。该方案主打低延迟与高可靠性。
Hugging Face 发布 gradio.Server,它扩展自 FastAPI,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端搭配 Gradio 的队列、SSE 流式、并发控制和 gradio_client 兼容能力。
推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,并将模拟器在 GitHub 开源。
IBM 发布 Granite 4.0 3B Vision,一款面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式叠加在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可并在 Hugging Face 上线。
推荐理由:Granite 4.0 3B Vision 以 3B 规模在图表与表格抽取基准上超过更大模型,并给出 LoRA 适配器与 Docling 集成路径。
OpenAI 宣布获得 1220 亿美元新融资,用于在全球扩展前沿 AI、投资下一代算力,并满足 ChatGPT、Codex 和企业级 AI 不断增长的需求。
推荐理由:OpenAI 披露 1220 亿美元新融资及资金投向,读者可据此了解其算力与产品扩张的资金规模。
Mistral AI 发布 Spaces CLI,同时面向人类开发者和编码智能体。该工具通过 `spaces init`、`spaces dev` 等命令,三条命令即可从零搭建带热重载、数据库和 Dockerfile 的多服务项目。每个交互式提示都有对应的 flag 等价物,并在每次 init 时生成 context.json 和 AGENTS.md,让智能体无需人工干预即可自主完成配置与部署。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。
Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为带明确稳定性契约的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。
推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型。
OpenAI 与盖茨基金会面向亚洲灾害响应团队举办工作坊,帮助其将 AI 投入实际救援行动。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可通过指向和语音在 Google AI Studio 中编辑图片或查找地点。该指针已开始集成到 Chrome,用户可用指针选中网页内容让 Gemini 处理,Googlebook 也将推出 Magic Pointer。研究团队称这些原则旨在把传达上下文和意图的工作从用户转移到计算机。
拥有 230 年历史的 STADLER 借助 ChatGPT 改造知识工作,覆盖 650 名员工,实现节省时间并加速生产力提升。