跳到主内容
九游官网入口

VC追着投的RSI究竟是什么?姚顺宇、施天麟与清华/上交的教授们给出了回答

2026-09-21 · 邓思涵 · 更新于 2026-09-23

文|王欣逸

编辑|张雨忻

RSI(递归式自我改进)热度极高。

周六,上海西岸,聚集了一批顶尖人类智慧,以及试图赋予AI同样能力的人。

大洋彼岸,数月未公开露面、宣称Gemini 3.8 Flash是“RSI的重要进展”的姚顺宇,在电话另一端等待;成立半年估值46.5亿美元、专注AI自进化的硅谷创业公司Recursive Superintelligence,其联合创始人施天麟,也参与了这场对话。

他们围绕一个共同话题而来:资本涌入的RSI领域,正在发生什么?

RSI,即递归式自我改进,自今年年中以来成为最受关注的话题,指AI能自我优化,从编写代码、运行实验,到调整架构、优化权重,甚至自主设定新目标。

现场绝大多数是研究员,来自各大企业、高校与实验室,也有许多知名投资机构、FA、孵化器出席。我们全程参与了这场持续五小时的活动,一些设想与争议反复出现。

人们正在设想一个人类无需介入的终局,即人类不参与模型自我改进的循环,并讨论大厂、实验室和创业公司如何探索、实现这一终局。

不同的观点也在浮现——自进化是否是一个悲观前景?最终会被模型厂商吞噬?RSI不做预训练、不应是垂直模型……

关于如何定义、评估与验证RSI,以及它何时实现等问题,我们整理了姚顺宇、施天麟等硅谷研究员以及来自清华、上交等高校的助理教授、研究员的观点,供参考:

1. 当AI公司扩大规模(如模型能力、客户规模等)时,不再需要扩大团队规模,RSI便会发生。

2. RSI不是一个单一事件,而是一个连续过程。

3. 从今年年初的迹象看,RSI可以实现。主要原因在于Coding和Agent Model已成熟,达到突破点。通过Coding Agent的方式,可以让AI训练AI,实现AI自己的想法、改进自身,包括架构、数据集及训练方法等,从而推动RSI实现。

4. RSI与模型在自己生成数据上的微调,很难区分是定性还是定量差异。某种意义上,模型自己生成数据是RSI的初始形态。

5. 数据与环境是RSI落地的良好商业机会。

6. 与OpenAI、Anthropic等大厂竞争,创业者的机会不在通用智能,而在基础知识之外的专业知识。

7. 无需从头训练RSI模型,其基础性能难以超越通用大模型,也难以自我迭代出更强能力。

8. 评估智能,应关注它是如何学会这一能力,而非学会了什么。

9. 验证的终极形态不应依赖人工,但短期内必须保留人参与,尤其在任务定义和质量把控上,仍需人类专家做出高质量测评。

10. RSI的最终版本可能是一个能自我改进的模型;但在当前初期阶段,可依赖外部辅助模型及收集反馈信号。

11. 人们想象中的RSI,可能是其终局——整个循环完全无需人类。但从实际出发,我们是否会达到那一天,以及是否有必要追求到那一步,尚不确定。

以下是这场由AGI House、红杉中国、Research AI+联合主办、主题为“当AI开始递归自我改进”活动的部分干货内容,经摘编:

在此之前,先介绍几位嘉宾——

  • 姚顺宇:Google DeepMind主任资深科学家,专注Auto-Research方向探索,博士毕业于斯坦福大学理论物理专业,此前任职于Anthropic。
  • 施天麟:Recursive Superintelligence联合创始人,清华姚班校友,曾在OpenAI担任研究员,在斯坦福大学读博期间退学联合创办过AI公司——Cresta。
  • 谷雨:NeoCognition联合创始人,ApprenticeBench一作
  • 周煊赫:上海交通大学助理教授,Theseus Labs创始人
  • 孟繁青:Evolvent AI联合创始人,RSI Bench Data一作
  • 刘子鸣:清华大学助理教授,元环智能创始人,专注AI for AI方向。
  • 穆尧:上海交通大学助理教授,SeeAct AI创始人,从事具身智能的RSI方向。

此外,其他嘉宾还包括海内外其他高校、实验室的研究员、博士生。值得一提的是,主办方AGI House活跃于硅谷,是一个AI创业社区与孵化器,这也是他们首次在国内举办活动。

那么,进入正题。

如何递归?如何改进?

Q:如何定义RSI?

姚顺宇:RSI可能不是一个事件,而是一个连续过程。我们目前只能讨论我们在这个连续过程中的位置。

举个简单例子,模型从多年前就能自己写代码,这加速了研究闭环,也算RSI发生了一部分;后来模型能主动监控实验进程并提出新实验,这也算RSI。

从效果看,人们想象中的RSI,可能是其终局,整个循环完全无需人类。但我们是否会达到那一天,以及是否有必要追求到那一步,尚不确定。

施天麟:从RSI角度,模型本身必须能觉察自身约束情况。它要知道自己哪些地方不足,并在明确偏离时自主纠正。这是RSI本身、模型自我强化的重要能力。

当然,仅模型本身不够,还需通过一定harness和应用场景来约束模型。

谷雨:RSI涉及范围很大,今天我们几个人可能做的事完全不同。

大家的共性,可能有以下三类:一是AI自主找到提升目标;二是AI不断接近这一目标,可能涉及迭代过程;三是目标背后对应很长期的任务。例如,让大模型去做大模型,其目标可能是更好的模型,其中AI需自主建立预算、规划模型、总结方法,最终得到更新模型。

孟繁青:我们现在常把自我改进、持续学习、RSI几个词放在一起说。

从我的角度看,RSI是在给定环境、奖励或奖励函数的情况下,模型在其中持续迭代某个东西。这个东西可以是各种形式,如架构、权重,最终目标是在环境中获得更高奖励得分。

在真正意义上的RSI中,模型需优化自己、提升自身表现,而非优化某个产物或另一个模型。整个系统没有除自己以外的外部因素,只有自己、环境和奖励。

周煊赫:从计算机角度,“递归”这个词应递归到最本质层面。对AI系统而言,最本质层面是参数和架构设计;再往外一层,是Harness中的各种代码和脚本;再往外,是交互的环境,如各种文件、工作区。

我们对RSI的定义,是先切入产业场景,看当前工作流是否有痛点、痛点在哪。发现痛点后,接下来是检索解决方案。

RSI的最终版本可能是一个能自我改进的模型;但在当前初期阶段,可依赖外部辅助模型及收集反馈信号。

RSI真的实现自我进化了吗

Q:如何评估RSI真的实现了自我改进,在场的各位也有一些关于Benchmark的工作,也请大家分享一下在做的评估方式。

谷雨:评估主要关注什么,以及为什么在此时间点比较重要,有两个关注点:

一是生态效度,在Benchmark上做得好,不一定直接意味着能真正解决问题,或对应实际生产价值或经济价值。我们想验证的是,让通用大模型变成真正能在某个岗位上执行的成熟员工。因此,我们要搭建贴近真实工作的环境。

二是,我们到底要评估智能的什么?我在很多场合引用过一个观点,智能不是指你会多少东西,而是你怎么学会这些的。

周煊赫:评估很重要,特别是华人做AI,在定方向后,大家很快会把这个方向的天花板卷高。

现在的问题是,benchmark本身不够好,即使一些知名benchmark也有很多错题。面向RSI的benchmark应该什么样?除了传统Agent的推理、探索和规划这三项能力,我们还需思考RSI需要什么新能力。我们也相信,未来不仅需要AI自我迭代,真正高质量的benchmark仍需结合人类专家。

验证,是RSI持续演进的卡点

Q:如何定义验证,或你们有什么思考?

姚顺宇:关于RSI最难实现的是自我改进,还是证明自己真的改进了,我觉得是验证自己真正改进了。

过去很多人做过类似事,当时叫“赛博批评”——一个AI出题、一个AI解题。这种做法最容易陷入局部最优:比如一个AI总出简单题,另一个都能答对;或一个总出难题,另一个永远答不上。因此,最难的地方在于,模型得能真正理解自己到底进步到什么程度。相比解决问题,RSI里最难的事肯定是定义问题。

孟繁青:先不谈验证本身设计得对不对,即使它都正确,也会带来一个大问题:可复现性。

现在环境越来越复杂,涉及CPU型号、操作系统是Mac还是Windows、内存大小,不同物理平台会导致差异。

此外,现在大多数benchmark每题给一个0到1的绝对分数。但这些分数没有很强物理意义,绝对分数本身也说明不了什么。

我们公司的一位合作者提出了另一套评分标准。它将层级分成Agent-SOTA、Human-SOTA等不同layer,每层对应不同Artifact。在每个新平台上,通过运行这些Artifact来确定模型输出属于哪一层。这样可避免物理意义和硬件差异导致的问题。

周煊赫:我很早之前看过清华一个团队的工作,他们在推理过程中,通过给权重加扰动噪声,验证不同扰动方式,能让模型推理得更好。这其实实现了我们追求的:边推理、边学习、边调整权重的能力。

从内部看,我们现在已设计推理和记忆分离的模块,从记忆埋点模块有一些隐式中间态传递,也可通过外部手段做保护。

与大厂抢生态位的RSI初创公司

Q:如何思考RSI创业公司与模型厂商的边界?什么地方模型厂商有绝对优势,什么地方创业公司能做出不同点?

孟繁青:RSI概念很大,科研机构、创业公司、大厂,每个人做的都是其中不同部分,从上往下是:

最上游,像Alphabet、OpenAI或Kimi这类公司,他们说的RSI基本上是纯粹RSI,即模型迭代自身,包括整个架构,追求更高智能。

再往下一层,如一些传统SaaS公司,RSI需要环境和验证。对他们来说,能否把自身生态抽象出一套Agent-native的服务,方便上游模型厂商通过Agent调用,并提升Agent在该场景下的智力,可能是这些下游传统公司理解的RSI。

再往下,一些初创公司的方向可能是:不纯粹用RSI迭代基础模型本身,不花大价钱训练自己的基础模型,而用RSI迭代某些产物,如Harness。

对上游和初创公司,目标比较明确:要么提升模型本身,要么提升下游表现;而对底层SaaS公司,他们对RSI的态度可能是,能否在其中提供更多环境。

周煊赫:尽管大家对数据要求越来越高,我认为,当前的数据和环境仍是一门好生意。

在一艘到处漏水的船上,靠用手堵窟窿解决问题。大厂的手再多也顾不过来。所以当模型落到千行百业时,需有一套自进化范式,这个范式最核心的两个因素是数据和环境。

数据侧,对预算不足的小公司,他们需要一套轻量化数据方案,再转化为用户自身资产。

环境侧,在嘈杂环境执行任务,即使再好的Agent,任务执行也会大幅降分。如何很好地理解、把方案与模型一起协同进化的范式,非常重要。

谷雨:我觉得可从两个角度:第一个角度是创业公司服务模型厂,第二个角度是创业公司做的事与模型厂互补。

关于服务模型厂,如周老师提到的卖数据、卖环境,都是好生意。

关于与模型厂互补,繁青老师也提到,模型厂提供的是通用智力,即模型的通用能力。我觉得我们或大部分出来创业的人,不应与大厂拼通用智能,而应做通用智力之后的专门知识。

一些争议

Q:目前行业关于RSI的讨论,哪些观点和定义是你们不认可、不理解的?

谷雨:我不太能理解为什么国内投资人给RSI投了这么多钱?

刘子鸣:自进化是一个非常悲观的前景。

上一次自进化,是从灵长类动物进化到人,这是一个相当漫长的过程。尽管现在AI看似有大量进展,但我想说自进化是一条低效路线,意味着我们被卡在低维。

打个比方,现在的大模型是一个银河系,我们在银河系里,所以觉得银河系已是全部。但如果顺着大模型路径慢慢往外拓,会发现大模型外面其实是虚空。只有先熵增,上升到宇宙维度,再做熵减,才能发现可能别处还有一片星系适合人类居住。

分久必合,合久必分。我们现在处于合的阶段,只设计一个模型就能解决所有问题,但其边界也慢慢暴露出来,现在我们需要为不同领域设计不同模型。

孟繁青:有些人在做RSI模型,我不太能理解这个词。

比如某个模型能完成一些垂域任务,这只是单纯把RSI概念包到垂域模型上;又比如强调做模型的方法是RSI,这也不是真正RSI,因为现在模型厂的后训练也已做到高度自动化,这里的RSI能力在训练时已被模型厂内化。

假设我们常规训练出一个模型,它在环境里反复迭代、不断提高奖励反馈,学习曲线上会呈现“得分随训练时间推移上升”的斜率。RSI模型的价值在于,这个斜率会更高。这一模型不应是针对某个垂域调出来的,而应具有通用性。

周煊赫:关于做RSI的预训练模型,我非常不相信。

我们相信的RSI路径是:一种是大厂正在做的,堆算力、自己找数据、构建超大图谱、出难题训练自己;另一种是,当AI进入千行百业时,由于大厂也缺失这些环境数据,通用模型在这类场景的解决能力也受限,我们相信还需另一套RSI范式。

下一个突破

Q:你最期待的RSI范式突破是什么,或你们认为未来什么样的潜在范式突破,会对你们正在做的事造成颠覆?

孟繁青:我比较期待看RSI如何改进Infra层。Infra原本面向人类使用者设计,之后会不会衍生出一些更面向Agent的方法?比如原本的SaaS,它们现在已在积极改进、提升自身能力;但更底层的东西,如各种训练infra,之后会不会出现纯智能类Agent去介入?

谷雨:我关注的是实验学习的能力,尤其是在真实环境中的实验学习。我们公司现在真正在做的事是:把一个Agent放进一家真实公司后,如何让它自己去摸清这家公司的规则和工作流。

我们公司现在比较押注的路线,是对比非参数和参数化两种形式。

非参数路线,就是现在很多人在做的上下文、记忆路线,其好处是不需动模型权重,也不需很多样本;坏处是不够鲁棒,因为更新记忆文档的优化算法不稳定,压缩能力和表达能力也不够强。而参数化路线,表达力高、压缩率高,但需很多训练样本。

所以我们认为一个可能的未来方向是:通过非参数形式,在线过程中学到新知识,再让基座模型生成更多数据,或把这些知识压进参数里。

周煊赫:我们相信,RSI会内生在模型本身的能力上。此前提到的与生态环境不匹配的问题,本质上是模型能力不够强。如果未来模型能力上去,可能自己就会把RSI跑闭环,具体看,它需要几方面能力:

第一,主动感知环境的能力。模型能主动、流式、低成本地把环境中各种模态数据输入进来,感知哪些与任务对齐,做模态消歧。进一步,它甚至可以改造环境、适应环境。

第二,探索和创新的能力。它不应被限制在人类偏好对齐上,而能自主探索出一些领导力、品味的能力,甚至关键信息的感知能力。

第三,在线持续学习的能力。一定不能只有后训练模式,反向传播的显存开销远大于推理显存开销,所以如何做出轻量化、小样本的持续学习,也很关键。这一能力与安全密切相关,因此AI还需满足对自身能力边界的可控和感知能力。

更多文章