RSI hype builds: where AI self-improvement stalls, per TMTPost analysis
A TMTPost analysis says recursive self-improvement (RSI) has quickly moved from lab shorthand to industry buzzword, with OpenAI, Anthropic and Google DeepMind repeatedly citing progress, and with Anthropic and OpenAI warning about loss-of-control risks and urging slower development. In China, Zhipu founder and chief scientist Tang Jie disclosed the company's first RSI-oriented engineering practice and likened the core technique of its next "fully self-training" model GLM-6.0 to RSI; Xiaomi called its MiMo-V2.6 series "a key step in exploring RSI"; and Alibaba CEO Wu Yongming said the Qwen team is exploring RSI with some progress. Practitioners quoted in the piece argue that because humans still set goals and make final decisions, these efforts look more like an extension of existing technical paths than the start of something new.
Why it matters: RSI is shifting from a lab term into part of vendor and investor narratives, yet there is still no shared definition or verifiable standard for whether it marks a real capability jump or just deeper automation of existing workflows.
(本文作者为 飞向TAI空,钛媒体经授权发布)

图片来源:unsplash
RSI(递归自我改进)火了。

这个聚焦于AI自我演进的概念,似乎在业界、学界连定义和标准都来不及统一的情况下,就快速进入了落地阶段。
近半年来,OpenAI、Anthropic、Google DeepMind等前沿AI实验室和初创公司频频提及RSI方面的进展。尤其9月中旬以来,Anthropic和OpenAI数次预警RSI的失控风险,甚至呼吁放缓研发进度,为安全保障争取时间。国内方面,RSI的技术演进和判断也更多走向台前,智谱创始人兼首席科学家唐杰9月17日披露公司首个RSI方向的工程化实践,并将下一代“完全自训练”模型GLM-6.0的核心技术定位类比为RSI;小米则在9月22日发布MiMo-V2.6系列模型,称之为“探索RSI的关键一步”;阿里巴巴集团CEO吴泳铭则在云栖大会演讲中提到,目前人们摸索出通往超级人工智能的具体技术路径就是RSI,他还透露,Qwen团队正在进行RSI方面的探索,并取得了一定的进展。
相关呼吁、讨论和实践引发的观感不一,但资本市场的反馈则相对积极。对“减速”的焦虑短暂导致波动后即被抛诸脑后,RSI叙事迅速被推向前台,再加之Meta发布消费级个人AI代理Muse等爆点事件,让此前因2028年Capex能见度不足、开源模型竞争压力、头部AI厂ARR增速放缓等承压的美股科技板块明显回暖。
资本市场的热度也进一步提高了RSI的讨论度。
一位国内Vibe Coding领域初创公司CTO称,近期已有多位不同领域的朋友跑来咨询RSI相关问题,但在他看来,很多理解还是“过于科幻”。
他称,将RSI理解为模型能无间隔、利用一切时间来提升自己、完成进化“显得不切实际,至少离现实很远”。目前的技术路径中,大模型不存在“在线实时学习能力”,训练完权重就固定了,这与人类大脑有本质区别。而如果将其简单理解为模型的自我调整、优化,那在目前来说也不算是特别有开创性的新鲜事。
“比如模型的迭代,0.1的迭代也是研究员来定义和发起的。还是更类似于在一个固定态,将目标、方向和框架定下来,AI在其中写了多少代码、完成多少研发,依然是执行者的角色。”此前,Anthropic公布数据称,旗下模型Claude“主导”的AI研发任务从2月的不到1%,到8月已提升到约26%。在该公司的界定中,“主导”在AL0-AL5的六级自动化标准中属于AL4级别,主要指人类在给出一个高层目标后,AI完成大部分端到端工作,人类再负责监督和最终决策。前述CTO则认为,只要方向、目标和评估、决策两头的工作仍由人类负责,就意味着AI的改进仍被限制在一个固定线段中,其中的过程管理似乎都交给了AI,看似是黑盒运行,但考虑到目前的自动化实践主要在代码领域,可以说这是确定性最高也最适配AI的任务了。他认为,总的来说,将目前披露的相关实践和演进视为现有技术路径的延续而非新故事的开端可能更为合适。但他也同时补充称,AI在研发任务贡献中所占比例的提升,AI研发规模的扩大,每达到一定数量级确实会带来新的技术、工程问题,也进而取得新的进展,但这其中是否存在一个技术上量变达到质变的奇点,目前还看不清楚。
而从这种理解延伸来看,当AI能胜任“发起到决策”的“两头”工作时,可能才更符合目前讨论中关于RSI的想象。而这既涉及技术、算法、训练范式等问题,更涉及组织、流程问题。
在此前2026 ITValue Summit数字价值年会的AI Coding专题闭门会中,多个团队透露,在自身开发流程中,AI编程的端到端交付今年来取得显著提升,Agent已能作为数字员工批量上岗。AI Agent的贡献度很大程度上也被视为衡量一个组织AI Native成色的关键指标。但他们也同时给出一个共识判断,即总体目标、关键判断、最终结果仍由人类负责。在垂类行业中事情则更为复杂,AI面临更多行业隐性知识、隐私数据的壁垒,传统程序员则被期待成为更懂业务的技术从业者,近期爆火的FDE(前沿部署工程师)则直接将开发角色放置在业务现场。
而目前来看,对于RSI来说,能让AI接手“两头”工作的更多还是实验型任务,这些实验会让Agent在没有明确任务指令的情况下主动探索代码库、寻找潜在问题,或者让AI根据实验结果调整下一轮研究方向,比如近期较受关注的是Weco AI团队让AI Agent在8天的试验中自我改进自身代码的AIDE²案例。但在真实的组织层面,AI的“端到端”仍然被局限在较短的链路中,是否应该或如何在组织层面授予AI更高的权限,又如何界定其权责、进行问责,配套的监督、纠错、评估机制如何更新,这些显然超越了目前的人机协作范式,在成规模的组织中也少有探索。
或许,当AI在开发流程中贡献度占比达到一定量级,AI落地真实场景达到一定阶段后,会出现更为前沿的AI组织形态,那可能才是RSI的最强加速器和验证器。
当然,需要提及的是,目前也有不少声音认为,RSI本身是“伪概念”,或认为延续当前技术路径不可能出现RSI。一位本地模型初创公司创始人即认为,目前的云端大模型、Transformer+自回归生成范式无法形成创造力,无法解决人类未解决过的问题,只能在人类设定的框架中运行,“路越走越窄”。
在RSI概念热度升高、逐渐“破圈”之际,更多技术路径、底层架构、组织形态的探索和理论框架也在被重新讨论。在一种关于未来的想象逐渐具象化的过程中,往往会诞生更多意料之外的变革和突破。(本文首发于钛媒体APP,文|飞向Tai空,作者|胡珈萌,编辑|杨林)
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
How we got here
- OpenAI DevDay recap: Dots, Space and Codex tie agents into continuous work少数派 AI · OpenAI
- Musk builds chips, Zuckerberg farms cells as AI races for new means of production虎嗅 AI · Meta
- Opus 5.5 becomes the default agent brain as Google and Musk adopt it36氪 人工智能 · Anthropic
- Zhipu AI roadmap leak: GLM-5.4 and GLM-5.5 said to hit trillion parametersAIbase AI新闻 · Zhipu AI
- VoxMem benchmark: audio LLMs score under 40% on multi-session speech memory新智元 · Qwen
- GMI Cloud opens free week for Qwen3.8-Max, Qwen3.8-Flash and Wan3.0Qwen (X) · Qwen