Jason Liu 如何用 Codex 支撑长时间运行的工作
Jason Liu 分享了他使用 Codex 保存上下文、管理复杂项目,让工作不再局限于单次提示词的经验。
Jason Liu 分享了他使用 Codex 保存上下文、管理复杂项目,让工作不再局限于单次提示词的经验。
Hugging Face 在 PEFT 库中新增图像生成基准,与已有的 LLM 数学基准一起,在相同基座模型、数据集、训练与评估代码和硬件下对比多种参数高效微调技术。
推荐理由:Hugging Face 用统一基准对比多种 PEFT 技术,给出 LoRA 之外在精度与显存上的具体取舍数据。
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。
推荐理由:Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。
AWS 开源 SDK Strands Robots(Apache 2.0)把 LeRobot 栈封装成 AgentTools,用一个 Strands 智能体串起从 Hub 数据集到实体机器人的流程。
推荐理由:AWS 官方给出从 Hub 数据集到实体机器人的完整五步流程,可据此判断仿真与真机数据同格式的实际用法。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 换成 nn.Linear,并堆叠三层加激活函数构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
作者让一个编码智能体通过调用两个 Hugging Face Space 搭建了展示巴黎地标的 3D Gaussian splat 网站,全程未手动打开图像生成或 3D 重建工具。
推荐理由:作者用一次真实搭建演示了 agents.md 如何让智能体串联两个 Space 完成图像到 3D 的流水线,可迁移到其他多媒体组合。
Hugging Face 发布教程,介绍如何让 GitHub Actions 把 CI 任务调度到 Hugging Face Jobs 上运行。
推荐理由:原文给出把 GitHub Actions 任务迁移到 Hugging Face Jobs 的完整步骤与 Trackio 实测数据,可据此评估 GPU CI 的可行性。
DharmaOCR 团队把 Direct Preference Optimization(DPO)用于结构化 OCR 而非聊天对齐,用模型自身失败输出构建偏好对,在全部测试的模型家族中都将文本退化率降低,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
OpenAI 介绍 ChatGPT Work 的运营工作流用法,覆盖 initiative briefs、strategy updates、decision packets 和 progress reporting 四类场景。内容为实操性工作流指南,未披露模型版本、参数或价格等具体信息。
Hugging Face 发文解析连续批处理中的同步瓶颈:用 8B 模型、batch size 32 生成 8K tokens 时,总耗时 300.6 秒,其中 24.0% 的时间 GPU 在等待 CPU,纯属浪费。
OpenAI 介绍 ChatGPT Work 在财务场景中的实用工作流,覆盖报告、差异分析、预测、月度复盘和可直接用于决策的财务交付物。
Hugging Face 发文解析 AWS 上基础模型训练与推理的开源软件栈分层架构,涵盖 Slurm、Kubernetes、PyTorch、JAX 及 Prometheus、Grafana 等工具。
OpenAI 通过沙箱隔离、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
一篇综述指出,并行推理正从固定 fork-and-join、树搜索等外部预设结构,转向让模型自行决定何时分解子任务、开多少并行线程以及如何协调的自适应并行推理。文中梳理了 Self-consistency、Best-of-N、MCTS、ParaThinker、GroupThink、Hogwild! Inference 等方法,并指出顺序推理的 token 增长会带来上下文退化和延迟问题。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
Hugging Face 博客介绍如何基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用。该模型是 1.5B 参数、50M 激活参数的 PII 检测器,Apache 2.0 许可,单次前向处理 128k 上下文,可标注八类 PII,并在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章用三个可运行示例拆解 gradio.Server 的队列与路由分工,读者可据此复用这套前后端拆分模式。
OpenAI 分享 ChatGPT Work 的实用工作流,覆盖重复性任务、进度更新、调研、规划与团队运营等日常场景。内容以实操为导向,帮助团队把这些环节接入 ChatGPT Work。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI,并以官方发布的 Gemma 4 浏览器助手扩展为参照。
推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下后台托管模型、侧边栏与内容脚本分工的架构取舍。
Hugging Face 发布一个 Skill 和配套测试工具,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试工具,读者可了解其流程与对评审者的减负设计。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以微调 Qwen/Qwen3-VL-Embedding-2B 做视觉文档检索(VDR)为例演示流程。
Sentence Transformers 发布 v5.4,可在同一套 API 下编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索再重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA、BGE-VL 等已支持模型。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此评估跨模态检索的落地成本。
Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 给出两条把 OpenClaw、Pi 或 Open Code 智能体迁移到开源模型的路径。
推荐理由:给出两条把 OpenClaw 等智能体从 Claude 迁到开源模型的路径,含具体命令与配置,可直接照做。
NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。
推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源码文件、生成或改进 RSpec 测试,并在 CI/CD 流水线中无需人工干预地运行。该智能体通过仓库级 AGENTS.md 执行计划、按文件类型划分的 skills 文件以及 Rubocop、SimpleCov 校验工具运作,仅靠一份 markdown 指令文件就将质量分从 0.68 提升至 0.74。
Hugging Face 发布对 16 个开源异步 RL 训练库的调研,按编排原语、rollout 缓冲设计、权重同步协议、陈旧度管理、部分 rollout 处理、LoRA 支持和分布式训练后端七个维度进行对比。
Hugging Face 博客介绍 Ulysses 序列并行(来自 Snowflake AI Research 的 ALST 协议),通过按注意力头切分并配合 all-to-all 通信,把长序列注意力计算分散到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
Hugging Face 发布 NXP 的嵌入式机器人 AI 实践指南,覆盖数据集录制、VLA 策略微调(ACT 与 SmolVLA)及端侧优化。指南以"把茶包放进杯子"任务为例,给出固定相机、夹爪相机、11 个 10×10 cm 起始位置聚类、120 个 episode 等具体做法,并展示 NXP i.MX 95 SoC 优化后的实时性能。
Photoroom 在 Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元预算在 24 小时内训练出一个文生图扩散模型。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Hugging Face 发文介绍 transformers 库为 Mixture of Experts 模型所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 做的加载、后端与并行改造,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出用编码智能体提交 Unsloth 微调任务的完整命令与 Skill 安装方式,可据此复现小模型训练流程。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端和状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此判断如何让 LLM 一次生成可部署的交互组件。
Hugging Face 构建了一个 Agent Skill,教编码智能体编写生产级 CUDA kernel,并让 Claude 和 Codex 分别针对 diffusers 的 LTX-Video 和 transformers 的 Qwen3-8B 生成可用 kernel,包含正确的 PyTorch 绑定与基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识封装成 Agent Skill,并给出两个真实模型的端到端基准数据,可据此判断这类技能包的实际收益。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
推荐理由:OpenEnv 与 Calendar Gym 的实测数据揭示了工具型智能体在多步推理和歧义解析上的具体瓶颈,可迁移到其他 Agent 评测设计。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,主张在智能体优先的世界中利用 Codex。文章围绕这一理念展开,探讨如何借助 Codex 构建以智能体为核心的工程实践。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,基于 1.2B 参数的 PRX-1.2B 在 Flux VAE latent 空间训练,基线配置为 100k 步、256×256 分辨率、全局 batch size 256。
Hugging Face 发布新工具 upskill,可用 Claude Opus 4.5 等大模型生成并评测 agent skill,再迁移给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测方法,可复用到其他领域任务。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS-20B 做 Agentic RL 训练时遇到的问题:训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双次前向传播导致新旧 log-prob 不匹配,使 PPO 的 importance sampling ratio 偏离 1。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露具体版本号、参数规模或性能数字。
OpenAI 介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Mistral AI 团队在预生产测试中发现,vLLM 搭配 Mistral Medium 3.1 并启用图编译时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。