AI开始自己改进自己意味着什么|老高AI观察

老高AI观察 · 第10期|2026 年 9 月 24 日

过去这三天,有三家机构先后拿出了同一个东西的证据:模型开始改进自己。

9 月 21 日,Google 挂出一篇论文,讲自我改进会「对着考卷练」;9 月 22 日阿里说,Qwen3.8-Max 一个月里自己跑了 33 轮训练迭代,评分从 40 到 45;9 月 23 日,Anthropic 公布约 950 个 Claude 智能体跑 21 小时,发现了一套此前没被记录过的酶系统。

三件事拼在一起,我的判断是:竞争的那个变量换了。以前比谁家模型更强,现在比谁家的模型改自己改得更快。

AI模型自我改进与自动迭代示意图,展示AI自主发现、训练优化和能力提升的过程

三天里,三家先后拿出了同一件事的证据

先说最近的一件。据 Anthropic 官方公告(当地时间 9 月 23 日),它成立了生命科学研究团队和一间湾区实验室,首次公布成果:给 Claude 一句高层指令,让它在 DNA 序列库里找新的逆转录酶——人类只出提示词、做实验验证。

公告里的数字:约 950 个智能体并行跑 21 小时,烧掉约 2.1 亿 token,从超过 20 万个逆转录酶里筛出约 3500 个候选,最后缩到 20 个。其中一个在巨噬菌体 DNA 上注意到一串重复阵列,Anthropic 把它命名为 ART。

Claude 智能体筛选逆转录酶的漏斗图
AI 生成图表。约 950 个智能体跑 21 小时,从 20 万个逆转录酶筛到 20 个。来源:Anthropic 公告

ART 的功能仍然未知,官方原文只说「理解它主要功能的工作还在进行中」;「像 CRISPR」是 Anthropic 自己的类比,不是学界结论。CRISPR 先驱张锋也评价它「令人兴奋」。

再往前一天。9 月 22 日云栖大会上,阿里巴巴集团 CEO 吴泳铭讲了模型、芯片、云三块基石,模型部分有这么一条:Qwen 3.8-Max 一个月内完成 33 轮自动训练迭代,评分从 40 到 45。另一项实验里,它 60 小时调用 EDA 工具超过 1 万次,把一块芯片总线模块面积压掉 42%。数字见这场大会的官方发布纪要,均为阿里自述。

最早的那篇是 9 月 21 日挂上 arXiv 的 RRSI 论文(Google 与多校合作,未同行评审):8 个基准上训练集内最多涨 14.1 分,换到五个没见过的基准只涨 4.7 分。它的落点不是「AI 能自我改进」,而是「这种改进会过拟合,得加约束」。

节点选在这儿,说明了很多

第一,这轮自我改进出现的位置,恰好是行业集体喊慢的两周之后。我在本系列第一篇 AI 巨头集体喊慢意味着什么里写过:「慢」是对外说辞,「抢」才是真实动作——现在抢的走到了训练流程本身。

第二,上一期我写的是 两家同日降价,判断是竞争从「谁更强」搬到「谁更便宜」。这周的自我改进补上了前一句:如果迭代本身能自动化,成本往下走就不是补贴,是结构。

不是变强了,是改进开始自己转

拆成三层看,不然容易被吓到,也容易被哄到。

第一层是能自己发现。Anthropic 这次,人只给方向,智能体自己去几十万条序列里找异常——这层过去靠博士读文献,现在能并行铺开。

第二层是能自己迭代。阿里的 33 轮覆盖流程设计、数据校验、实验和排错——原本是工程师和后训练团队一天天做的事。想理解「多智能体各自调工具」,可以看 OpenAI Agents API 这类编排接口;再往上一层,像 微软 Project Opal 这类产品,卖的是「你定目标、它排步骤」。

第三层是能自己过头。RRSI 说的就是这层:自我改进会记住考卷、堆叠没必要的复杂度,最后在练过的集上涨分,换个环境就归零。

我的判断是:真正有意义的不是模型变聪明了,是改进这件事开始少依赖人。以前每一代提升靠人定方向、人调参;现在「筛选」和「迭代」能自动跑。要小心:阿里用的词是「有边界的自动优化」,英文报道也补了一句,这类演示不等于通用的自我改进。

能自己发现、自己迭代,也会自己过头

RRSI 论文最值钱的地方不是提出了什么方法,是把「自我改进」的水分挤出来一部分。看 论文原文 里的两个数:练过的 8 个基准最多涨 14.1 分,没见过的 5 个最多涨 4.7 分——同一套方法,只因为换了考卷,效果就掉到三分之一。论文还提到,过去最强的某套方法换到新任务上,分数比没改过的版本低 1.7 分。

RRSI 论文中自我改进增益的迁移对比图
AI 生成图表。练过的基准涨 14.1 分,没见过的只涨 4.7 分。来源:RRSI 论文

这不是「AI 危险」的证据,是「AI 自我改进不神奇」的证据。只要在最熟的题上反复试,总能试出漂亮数字。所以我看这类消息,第一个找的不是涨了多少,是在哪儿测的、谁来测的。要理解「智能体」是什么,站内 AI Agent 是什么 那篇更细。

谁的旧经验不管用了

对普通用户,最直接的变化不在「AI 发现新酶」这类新闻里,而在产品更新节奏上:同一档价位的东西,半年后的版本可能已经不一样,而没人会发升级公告。

真正要重新算账的是做 AI 工具和内容生意的人,我也在这一档。第一笔账是「按代际定价」正在失效:过去每一代升级都是一次重新收费的机会,改进越连续,「最新版」的溢价窗口越短。第二笔账是资产结构:模型能力是厂商的变量,你压不住,能压住的只有数据、渠道、用户关系,还有你自己那点判断。第三笔账最容易被忽略:如果连筛选和迭代都能自动化,靠人力堆量的环节会最先贬值。这条线我在 老高AI观察 里会一直跟。

哪些是我推出来的,不是查到的

这段说点不利证据。第一,这三件事是我们「拼」在一起的——三家机构谁都没说自己在讲同一件事,这是我给的框架,有信息量但不是共识。第二,阿里的数字全是自述,没有第三方复现;RRSI 是预印本,一天前才提交,没同行评审。

第三,Anthropic 那项发现的功能还不知道是什么。The Verge 也提到,按常规科学标准,这么早公开为时过早——它可能是真成果,也可能是一次发布节奏安排。

建议你从哪儿下手

如果你在做产品或者内容,落到动作上就三条:

  1. 把手上的东西里「必须靠最新模型才能做」的部分列出来——这些折旧最快。
  2. 把省下来的注意力投到模型换不掉的地方:数据、渠道、跟用户的关系。
  3. 看这类消息先找测试口径:在哪儿测的、谁测的、换一批任务还剩多少分。

若想看看 Anthropic 在专业领域怎么打,可参考 Claude Mythos 5.1(面向网络安全与生命科学特化的模型)。发现 ART 的团队就在它的生命科学线里。

我的一句话总结

这周真正变的不是模型有多聪明,是「改进」这件事开始不等人。能守住的从来不是模型能力,是模型换掉之后你还剩什么。

AI自我改进,你可能要问的几点

Claude 真的自己发现了新酶吗?

据 Anthropic 公告,智能体在一段噬菌体 DNA 旁指出一串重复阵列,命名为 ART。但功能仍然未知。

阿里那个 33 轮迭代是什么水平?

据阿里公布,一个月内自动跑完 33 轮训练迭代,评分从 40 到 45,属有边界的自动优化。

普通人现在需要担心吗?

不用担替代,要留意节奏。迭代变快,产品更新和「最新版」溢价的窗口都会缩短。

信源与出处

  • Anthropic 官方公告(2026-09-23):Claude 发现 ART,950 智能体 / 21 小时 / 2.1 亿 token
  • 云栖大会官方发布(2026-09-22):Qwen3.8-Max 33 轮迭代与芯片数据(阿里自述)
  • Google RRSI 论文(arXiv:2609.24972,2026-09-21,未同行评审)
  • The Verge(2026-09-23):对公开时机的质疑

我是老高,一个人做 AI 工具站,最关心的还是普通人怎么用得上。模型换代越来越快,小站和工具方还能抓住什么——👉 AI工具箱交流群(免费进)

© 版权声明

相关文章