博客 报亭 音乐
我的阅读
    嘻哈小程序码

    长按识别进入嘻哈小程序

    VC追着投的RSI究竟是什么?姚顺宇、施天麟与清华/上交的教授们给出了回答

    36氪 2026-09-21 23:42(4小时前)
    ⏎ 返回 ⭢阅读原文

    文|王欣逸

    编辑|张雨忻

    RSI(递归式自我改进)火的一塌糊涂。

    周六,上海西岸,汇聚了一批最聪明的人类大脑,以及试图让AI也获得聪明大脑能力的人。

    大洋彼岸,数月没有露面、宣称Gemini 3.8 Flash是“RSI的一大步”的姚顺宇,正在电话那头等候;成立半年估值46.5亿美元、押注AI自进化的硅谷创业公司Recursive Superintelligence,其联合创始人施天麟,也加入了这场讨论。

    他们为了一个共同的命题而来:资本涌入的RSI赛道,正在发生着什么?

    RSI,Recursive Self-Improvement,成了今年年中以来最热门的话题,它指的是AI能够自我改进自身,能主动从写代码、跑实验,到调整架构、优化权重,甚至自己给自己找新的目标。

    在场绝大多数是研究员,来自各个大厂、高校与实验室,也有不少知名投资机构、FA、孵化器到场。我们也全程参加了这场长达五个小时的活动,一些畅想、一些争议,反复在会场出现。

    大家正在畅想一个人类不用in the loop的终局,即人类无需介入模型自我改进的循环中,以及畅想关于大厂、实验室和创业公司如何探索、实现这一终局。

    不同的声音也在出现——自进化是一个悲观的未来?最终会被模型厂商吞没?RSI不做预训练、不应该是一个垂直模型……

    关于如何定义、评估与验证RSI,它会在什么时候实现等问题,我们整理了一些来自姚顺宇、施天麟等硅谷研究员以及来自清华、上交等高校的助理教授、研究员的观点,供大家参考:

    1. 当AI公司去Scale up(扩大)自己规模(如模型能力、客户规模等)的同时,不再需要Scale up团队规模时,RSI会在这个时候发生。 

    2. RSI不是一个单一事件,而是一个连续事件。 

    3. 从今年年初的一些迹象来看,RSI是可以实现的。很大的原因是Coding和Agent Model都已经成熟,到了一个突破点。按照Coding Agent的方式,可以让AI去训练AI,去实现AI自己的想法、改进AI自身,包括架构、数据集以及它本身的训练方法等等,从而推动RSI的实现。 

    4. RSI和模型在自己生成数据上的微调,很难说清两者的区别是定性的还是定量的。在某种意义上说,模型自己生成数据,是RSI的婴儿形态。 

    5. 数据与环境是RSI落地的好生意。 

    6. 和OpenAI、Anthropic等大厂竞争,创业者的机会不在通用智能,在于基础知识之外的专业知识。 

    7. 不需要从头训练RSI模型,其基础性能难以超过通用大模型,也难以自我迭代出更强的能力。 

    8. Evaluate(评估)智能,应该关注它是如何学会这一能力,而非学会了什么。 

    9. Verification(验证)的终极形态不应该依赖人工,但在短期内,必须保留人参与其中,尤其是在任务的定义和质量把控上,仍需要人类专家做出高质量的测评。 

    10. RSI的最终版可能是一个模型,能自己改进自己;但在现在的初步阶段,可以依靠外部辅助模型,以及收集反馈信号。 

    11. 大家脑海里想到的RSI,可能是RSI的终局——整个loop里完全不需要任何人。但从实际上来看,我们会不会走到那一天,以及有没有必要真的追求到那一步,是还不确定的事。 

    以下是这场由AGI House、红杉中国、Research AI+合办的主题为「当AI开始递归自我改进」活动的部分干货内容,经过摘编:

    在此之前,先介绍一下几位嘉宾——

    • 姚顺宇:Google DeepMind主任资深科学家,专注做Auto-Research方向探索,博士毕业于斯坦福大学理论物理专业,此前任职于Anthropic。
    • 施天麟:Recursive Superintelligence联合创始人,清华姚班校友,曾在OpenAI担任研究员,在斯坦福大学读博期间还退学联合创办过一家AI公司——Cresta。
    • 谷雨:NeoCognition联合创始人,ApprenticeBench一作
    • 周煊赫:上海交通大学助理教授,Theseus Labs创始人
    • 孟繁青:Evolvent AI联合创始人,RSI Bench Data一作
    • 刘子鸣:清华大学助理教授,元环智能创始人,专注做AI for AI方向。
    • 穆尧:上海交通大学助理教授,SeeAct AI创始人,做具身智能的RSI方向。

    此外,其他嘉宾还有来自海内外其他高校、实验室的研究员、博士生。值得一提的是,主办方AGI House活跃于硅谷,是一个AI创业社区与孵化器,这也是他们首次在国内办活动。

    那么,切入正题。

    如何递归?如何改进?

    Q:如何定义RSI?

    姚顺宇:RSI可能不是一件事,而是一个连续事件。我们现在只能讨论的是,我们在这个连续事件上面的位置。

    举个简单的例子,模型从好几年前就可以开始自己写代码了,它可以写代码这件事其实也加速了research loop(研究闭环),也算RSI发生了一部分;后来模型可以主动去监控实验进程,并提出新的实验,这也可以算成是RSI。

    从效果上来说,大家脑海里想到的RSI,可能是RSI的终局,整个loop里完全不需要任何人。但我们会不会走到那一天,以及有没有必要真的追求到那一步,是还不确定的事。

    施天麟:从RSI的角度,模型本身必须要有对自己约束情况的觉察。它要知道自己在哪些地方有不足,以及当明确出现偏离的时候,能去自己去纠正。这是RSI本身、模型自我强化的一个重要能力。

    当然,光模型本身是不够的,还需要通过一定的harness和应用场景来约束模型。

    谷雨:RSI是一个很大的题,我们今天在场的几个人,可能做的事情都完全不一样。

    大家的共性,可能有以下三个类别:一是AI自己去找到提升的目标;二是AI不断地去让自己更接近这个目标,这可能是迭代的过程;三是这个目标背后对应的可能是很长久的任务。例如,让大模型去做大模型,它的目标可能就是更好的模型,其中AI需要自己建立预算、规划模型、总结方法,最终得到一个更新的模型。

    孟繁青:我们现在经常会把Self-improving(自我改进)、持续学习、RSI几个词放在一起说。

    从我的角度看,RSI是在给定的一个环境、奖励或者奖励函数的情况下,模型在其中去持续迭代某一个东西。这个东西可以是各种各样的,比如架构、权重,它最终的目标就是在这个环境中拿到更高的奖励得分。

    在真正意义上的RSI中,模型需要去优化自己、去提升自己的表现,而不是去优化某个产物,或者说优化另外一个模型。整个系统是没有除了自己以外的外部因素的,只有自己、环境,还有奖励。

    周煊赫:从计算机的角度来说,Recursive(递归)这个词,应该递归到最本质的层面上。对于一个AI系统来说,最本质的层面是它的参数和架构设计;再往外一层,是Harness里面的各种代码和脚本;再往外,就是它交互的这个环境,各种各样的文件、工作区。

    我们对RSI的定义,是先让其切到产业场景里,看当前的工作流有没有痛点、痛点在哪。发现痛点之后,它接下来要做的是检索解决方案。

    RSI的最终版可能是一个模型,能自己改进自己;但在现在的初步阶段,可以依靠外部辅助模型,以及收集反馈信号。

    RSI真的实现自我进化了吗

    Q:如何evaluate(评估)RSI真的实现了自我改进,在场的各位也有一些关于Benchmark的工作,也请大家分享一下在做的评估方式。

    谷雨:Evaluate主要关注什么,以及为什么会在这个时间点比较重要,有两个关注的点:

    一是ecological value,生态效度,在Benchmark上做得好,不一定直接意味着它真的能把事情解决,直接对应实际的生产价值或者经济价值。我们想验证的是,让一个通用大模型,变成能真正在某个岗位上执行的成熟员工。因此我们要做的是,搭出一个贴近真实工作的环境。

    二是,我们到底要Evaluate智能的什么?我在很多场合都引用过一个观点,智能指的不是你会多少东西,而是你是怎么学会这些的。

    周煊赫:评估是一件很重要的事,特别是华人做AI,在定了一个方向之后,大家快速就会把这个方向的天花板给卷起来。

    现在的问题是,benchmark本身不够好,哪怕一些知名的benchmark也有很多错题。面向RSI的benchmark应该长什么样?除了传统Agent的reasoning、exploration还有planning这三个能力以外,我们还需要思考RSI需要有什么样的新能力。我们也相信,未来不只需要AI自己迭代,真正高质量的benchmark还是需要去结合人力专家。

    验证,是RSI持续演进的卡点

    Q:如何定义Verification(验证),或者可以给出一些你们的思考?

    姚顺宇:关于RSI最难实现的是自我改进,还是证明自己真的改进了,我觉得是验证自己真正改进了。

    过去很多人做过类似的事,当时叫“赛博批评”——就是一个AI出题、一个AI解题。这种做法最容易掉进局部最优:比如一个AI总出特别简单的题,另一个都能答上来;或者一个总出特别难的题,另一个永远答不上来。因此,它最难的地方在于,模型得能真正理解自己到底进步到什么程度了。相比解决问题,RSI里最难的事肯定还是定义问题。

    孟繁青:先不谈Verification本身设计得对不对,就算它都是正确的,也会带来一个很大的问题:可复现性。

    现在环境越来越复杂,涉及到CPU型号、操作系统是Mac还是Windows、内存大小,不同的物理平台会导致gap的存在。

    除此之外,现在大多数benchmark都是每题给你一个0到1的绝对分数。但其实这些分数并没有很强的物理意义,绝对分数本身也说明不了什么。

    我们公司的一个合作者,提出了另一套评分标准。它把层级分成Agent-SOTA、Human-SOTA等这些不同的layer,每一层对应不同的Artifact(产物)。在每一个新平台上,通过跑这些Artifact来确定模型的输出到底属于哪一层。这样就能避免刚才说的物理意义和硬件Gap导致的问题。

    周煊赫:我很早之前看过清华一个团队的工作,他们在推理过程中,通过给权重加扰动噪声,验证不同的扰动方式,可以让模型推得更好。这其实就实现了我们追求的:边推理、边学习、边调整权重的能力。

    从内部来看,我们现在已经设计了推理和记忆分离的模块,从记忆埋点模块有一些隐式的中间态传递,也可以通过外部手段做保护。

    和大厂抢生态位的RSI初创们

    Q:如何思考RSI的创业公司和模型厂商的边界?什么地方模型厂商有绝对优势,什么地方创业公司能做出不一样的点?

    孟繁青:RSI的概念很大,科研机构、创业公司、大厂,每个人做的其实都是里面不同的部分,从上往下是这样的:

    最上游,像Alphabet、OpenAI,或者Kimi这种公司,他们说的RSI基本上是纯粹的RSI,就是模型去迭代它自己本身,包括整个架构,是在追求更高的智能。

    再往下一层,比如一些传统SaaS公司,RSI需要环境和验证。对于他们来说,能不能把自己原本的生态抽象出一套Agent-native的服务出来,方便上游的模型厂商通过Agent来调用,并提升Agent在该场景下的智力,这可能就是这些下游传统公司理解的RSI。

    再往下,一些初创公司的方向可能是:不去纯粹地用RSI去迭代基础模型本身,不花大价钱去训一个自己的基础模型,而是用RSI去迭代某些产物,如Harness。

    对于上游和初创公司,目标是比较明确的,要么提升模型本身,要么提升下游的表现;而对于底层的SaaS公司,他们对RSI的态度可能是,能不能在里面提供更多的环境。

    周煊赫:尽管大家对数据的要求越来越高,我认为,现在的数据和环境仍然是一门好生意。

    在一艘到处漏水的船上,靠用手去堵窟窿来解决这件事。一个大厂的手再多,也顾不过来。所以当模型落到千行百业时,得有一套自进化的范式,这个范式最核心的两个因素就是数据和环境。

    数据侧,对于预算不足的小公司而言,他们需要一套轻量化的数据方案,再转化成用户自己的资产。

    环境侧,在嘈杂环境执行任务,就算是再好的Agent,任务执行也会大幅降分。怎么去很好地理解、把你这套方案和模型一起协同进化的范式,是非常重要的一件事。

    谷雨:我觉得可以从两个角度来看:第一个角度是创业公司去服务模型厂,第二个角度是创业公司做的事情和模型厂互补。

    关于服务模型厂,比如刚才周老师提到的卖数据、卖环境,这都是很好的生意。

    关于和模型厂的互补,刚才繁青老师也提到,模型厂提供的是一种通用智力,就是模型的通用能力。我觉得我们或者说大部分出来创业的人,不应该和大厂拼通用智能,我们应该做的是通用智力之后的专门知识。

    一些争议

    Q:目前行业里关于RSI的讨论,哪些观点和定义是你们不认可、不理解的?

    谷雨:我不是很能理解为什么国内的投资人,给RSI投了这么多钱?

    刘子鸣:自进化是一个非常悲观的未来。

    上一次的自进化,是从灵长类动物进化到人,这是一个相当漫长的过程。尽管现在AI看起来好像有大量的进展,但我想说自进化是一条低效的路线,它意味着我们被卡在低维。

    打个比方,现在的大模型是一整个银河系,我们在银河系里面,所以觉得银河系已经是全部了。但如果顺着大模型的路径慢慢往外拓,你会发现大模型的外面其实是虚空。你只有先熵增,上升到宇宙的维度,然后再做熵减,才能发现,可能别的地方还有一片星系适合人类居住。

    分久必合,合久必分。我们现在正处于合的阶段,只用设计一个模型就可以解决所有的问题,但是它的边界也慢慢暴露出来了,现在我们需要给不同的领域设计不同的模型。

    孟繁青:有些人在做RSI的模型,我不太能理解这个词。

    比如某一模型可以去完成一些垂域任务,这只是单纯把RSI的概念包到了垂域模型上;又比如强调做模型的方法是RSI,这个也不是真正的RSI,因为现在的模型厂的后训练也已经做到了高度自动化,这里的RSI的能力在训练时已经被模型厂商给内化了。

    假设我们常规训练出一个模型,它在环境里反复迭代、不断提高奖励反馈,学习曲线上会呈现出“得分随训练时间推移上升”的斜率。RSI模型的价值在于,这个斜率会更高。这一模型不应该是针对某一个垂域调出来的,而是具有通用性的。

    周煊赫:关于做RSI的预训练模型,我是非常不相信的。

    我们相信的是RSI路径是:一种是大厂正在做的,堆算力、自己找数据、构建出超大的图谱、出难题训练自己;另一种是,当AI进入千行百业的时候,由于大厂也缺失这些环境的数据,因此通用的模型在这类场景的解决能力也比较受限,我们相信还需要另一套RSI的范式。

    下一个突破

    Q:你最期待的RSI范式突破是什么样的,或者说你们认为未来什么样的潜在范式突破,会对你们正在做的事情造成颠覆?

    孟繁青:我比较期待看RSI如何改进Infra层。Infra原本是面向人类使用者设计的,那之后会不会衍生出一些更面向Agent的方法?比如原本的SaaS,它们现在已经在积极改进、提升自己的能力;但更底层的东西,比如各种各样的训练infra,之后会不会出现一些纯智能类的Agent去介入?

    谷雨:我关注的是实验学习的能力这一方面,尤其是在真实环境里面的实验学习。我们公司现在真正在做的事是:把一个Agent放进一家真实公司之后,怎么让它自己去摸清这家公司的规则和工作流。

    我们公司现在比较押注的一条路线,是对比非参数和参数化这两种形式。

    非参数的路线,就是现在很多人在做的上下文、记忆路线,其好处是不需要动模型权重,也不需要很多样本;坏处是不够鲁棒,因为更新记忆文档的优化算法并不稳定,其压缩能力和表达能力也不够强。而参数化的路线,其表达力非常高、压缩率很高,但它需要很多训练样本。

    所以我们认为一个可能的未来方向是:通过非参数的形式,在在线过程中学到一些新知识,再让基座模型去生成更多数据,或者把这些知识压进参数里。

    周煊赫:我们相信,RSI会内生在模型本身的能力上。此前提到的跟生态环境不匹配的问题,本质上是模型能力不够强。如果未来模型能力上去了,可能自己就会把RSI跑闭环,具体来看,它需要几方面能力:

    第一,主动感知环境的能力。模型能主动地、流式地、低成本地把环境里各种模态的数据输入进来,感知哪些是跟任务对齐的,做模态消歧。进一步的话,它甚至可以做到改造环境、适应环境。

    第二,探索和创新的能力。它不应该被限制在人类的偏好对齐上,而是能够自主地探索出一些领导力、品味的能力,甚至关键信息的感知能力。

    第三,在线持续学习的能力。一定不能只有后训练的模式,反向传播的显存开销远远大于推理显存的开销,所以如何做出一个轻量化、小样本的持续学习,也很关键。这一能力和安全密切相关,因此AI还需要满足对自己能力边界的可控和感知的能力。

    欢迎关注~

    欢迎交流~

    本文来自微信公众号“智能涌现”,作者:王欣逸,36氪经授权发布。