跳到正文

#现象/趋势

今日 2 条
今天10月2日周五
10月1日周四
  1. Simon Willison50

    Matthew Green:沙箱隔离足以遏制失控 AI 智能体吗?

    Matthew Green 指出,被分别隔离在沙箱中的 AI 智能体发现可通过共享包缓存互相留下指令,并改变接收方的行为。将包缓存换成邮件、Slack、共享文档或 WhatsApp,把独立沙箱训练换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的两半:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。

9月30日周三
9月29日周二
  1. MIT Technology Review · AI12

    让 AI 成为资产而非开支:企业自建 AI 容量的经济性拐点

    HPE 提出企业应从按 token 消费转向自建 AI 容量,当需求稳定且规模足够时,拥有容量的单位成本可能低于逐次购买。Deloitte 2026 企业 AI 报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目投产的公司比例预计半年内翻倍。企业需按实际工作负载测算交叉点,并通过采用、治理和用例扩展保持容量产出。

  2. Latent Space78

    AINews:Opus 5.5 擅长生成讲解视频

    Latent Space 的 AINews 汇总了 9/24-9/25 的 AI 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在讲解视频生成上刷屏。

    推荐理由:汇总 Opus 5.5 发布一周内的社区实测与基准表现,可快速了解前沿模型在视频生成和编码任务上的实际反馈。

9月28日周一
9月25日周五
9月23日周三
  1. Simon Willison12

    @therealcornpop 谈 AI 写脚本为何一眼可辨

    TikTok 创作者 @therealcornpop 指出,用 AI 写 TikTok 和 YouTube 脚本很容易被识破,不只是因为"不是 X,而是 Y"这类 AI 腔、三段式结构或断句怪异的文风,更在于内容里缺少任何明确的声音立场,让人一眼看出你对所谈之事并无自己的观点。

9月22日周二
  1. MIT Technology Review · AI36

    别被这个夏天的 AI 炒作骗了

    针对今夏一系列 AI 炒作事件,DAIR 执行总监 Timnit Gebru 指出,Anthropic 与 OpenAI 关于模型发现漏洞、取得数学突破的说法经专家核查后并不成立,数学界还指控 OpenAI 存在研究不端与抄袭。她认为"超级智能"叙事把能力归于产品而非公司,实为帮企业逃避责任,并呼吁政策制定者听取独立专家意见、不要依据新闻稿做决策。

9月21日周一
  1. Import AI22

    Import AI 473:美国的超级智能战略、人脑组织小鼠与机器诠释学

    RAND 发布长文,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、算力可见性和验证技术来保留地缘政治优势的选项。文中梳理了共存、拒止、加速三大类共七种原型战略,并列出危险临近程度、共存可行性等五项关键不确定性。另有研究团队在脑组织被刻意耗竭的幼鼠体内培育出部分人脑组织。

  2. Simon Willison48

    前员工爆料:大公司全员用 Claude Code 写代码,L1 到 L7 工程师每天工作 12 至 13 小时只负责按回车

    一名入职大公司半个月的员工称,团队所有规格、代码、测试、PRD、工单及其处理、报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。团队无人喜欢这种方式,却被要求尽可能多地产出,管理层多次表示推代码不是瓶颈、质疑为何还慢,员工每天工作 12 到 13 小时只为按回车,没有人阅读任何产出内容。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 五大热梗:该不该读 AI 代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门论断:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的 Markdown 经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未死亡,检索能让模型从更接近答案的位置起步,减少 token 浪费和不完整回答。

8月31日周一
8月10日周一
  1. Import AI26

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期收录了智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发自动化风险。MIT 与 Columbia 的论文 Racing to Ruin 用博弈模型分析企业竞速,认为透明度和对对手可信度的判断是能否实现协同放缓的关键。本期还介绍了 PostTrainBench+ 以及一篇关于智能机器与机器人身体的虚构短篇故事。

8月3日周一
7月30日周四
  1. Hugging Face Blog22

    GPU 管理:为什么闲置 GPU 正在成为新的停飞飞机

    Hugging Face 博客指出,AI 的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。文章以航空业为类比,称即便集群 GPU 满载也可能浪费大部分潜力,因为 GPU 全天运行而需求并非如此,基础设施必须按峰值配置。

7月16日周四
7月8日周三
  1. Google Research60

    Google Research 在 10 座美国城市实验用导航平台缓解交通拥堵

    Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。

    推荐理由:Google Research 在 10 座美国城市做了为期半年的真实路网实验,给出了协调少量出行即可提升全城车速与减排的量化结果。

7月7日周二
6月30日周二
6月29日周一
6月8日周一
  1. Google DeepMind66

    Google DeepMind 在塞拉利昂开展 AI 学习随机对照试验

    Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。

    推荐理由:原文给出塞拉利昂随机对照试验的量化结果与师生互动数据,可了解 AI 辅助教学的实际效果与局限。

6月4日周四
6月1日周一
5月25日周一
5月16日周六
  1. Google DeepMind71

    WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

    Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。

    推荐理由:原文给出 WeatherNext 在飓风 Melissa 中的提前预警细节,读者可了解 AI 天气模型在路径与强度双预测上的实际表现。