从脚手架到自我改进系统
递归自我改进(RSI)的历史与近期路径:模型改进 Harness,不直接改写权重
本页解决的问题
先给结论「从脚手架到自我改进系统」要解决的关键问题是什么?
递归自我改进(RSI)的历史与近期路径:模型改进 Harness,不直接改写权重
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
她是一位令人尊敬的前辈,多年来在 AI 安全与 Agent 前沿领域持续输出,她的博客几乎是这个行业公认的必读。非常推荐关注她的推特,也强烈建议你读完这一章后回去读原文。
思考与规划 · 调用工具与行动 · 感知与管理上下文 · 存储制品 · 评估结果
成功的 AI 产品(如 Claude Code、Codex、Cursor)已经证明:Harness 层与原始模型智能同等重要。一个平庸的模型加上优秀的 Harness,往往胜过裸露的更强模型。
2. Harness 工程走向元方法论:改善的对象从答案本身,变成得到更好答案的机制。Harness 本身成为优化目标。
3. 成熟 Harness + 智能模型 = 正反馈循环:更好的 Harness 催生更强模型,更强模型又让 Harness 不必过度工程化。
同理,最终很多 Harness 改进会被内化为模型行为,但与外部上下文和工具的接口将永远存在。
「一个系统,能用自己当前的智能去改善产生智能的机制本身」里的算法代价曲线
「递归自我改进(RSI)的历史与近期路径:模型改进 Harness,不直接改写权重」真正训练的不是背诵步骤,而是识别重复工作:输入变大时,程序到底多做了多少次比较、移动或递归。
先找重复工作,再谈快慢
「递归自我改进(RSI)的历史与近期路径:模型改进 Harness,不直接改写权重」可以拆成输入规模、每轮做什么、以及是否能缩小下一轮范围三个问题。Big-O 是描述增长趋势的语言,不是对每台机器的精确计时;常数、内存和真实数据分布也会影响最终结果。
别把理论最优当成无条件最优
面对 AI 写出的算法,先用小输入手算一遍,再用逐渐放大的数据做基准测试。这样才能把「递归自我改进(RSI)的历史与近期路径:模型改进 Harness,不直接改写权重」从一句结论变成可检查的性能判断。
从「一个系统,能用自己当前的智能去改善产生智能的机制本身」走到「RSI 的演进」
「一个系统,能用自己当前的智能去改善产生智能的机制本身」先把问题落在「I. J. Good(1965)定义了「超级智能机器」:能在所有智力活动上超越人类,并设计更好的机器来改进自身。Yudkowsky(2008)将此概括为「递归自我改进」(RSI)。 本篇章的全部思路,来自 Lilian Weng 的这篇博客 自我改进篇的整个框架、概念与案例,都源自 Lilian Weng 于 2026 年 7 月发表的长文《Harness Engineering for Self-Improveme…」上;到了「RSI 的演进」,讨论继续推进到「1965 · Good "Ultra-intelligent machine":能设计更好机器的机器。理论设想。 2008 · Yudkowsky 正式提出 "Recursive Self-Improvement":AI 用自身智能改进产生智能的认知机制。 2023–2024 Self-play、合成数据、Test-time training 等早期尝试。模型开始改善自己的训练数据。 2025–2026 Harnes…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
算法题换成真实任务后,先找出重复工作,再问输入规模如何变化,最后用一个小基准验证理论判断。这样不会把复杂度记成脱离场景的标签。
- 「一个系统,能用自己当前的智能去改善产生智能的机制本身」:I. J. Good(1965)定义了「超级智能机器」:能在所有智力活动上超越人类,并设计更好的机器来改进自身。Yudkowsky(2008)将此概括为「递归自我改进」(RSI)。 本篇章的全部思路,来自 Lilian Weng 的这篇博客 自我改进篇的整个框架、概念与案例,都源自 Lilian Weng 于 2026 年 7 月发表的长文《Harness Engineering for Self-Improveme…
- 「RSI 的演进」:1965 · Good "Ultra-intelligent machine":能设计更好机器的机器。理论设想。 2008 · Yudkowsky 正式提出 "Recursive Self-Improvement":AI 用自身智能改进产生智能的认知机制。 2023–2024 Self-play、合成数据、Test-time training 等早期尝试。模型开始改善自己的训练数据。 2025–2026 Harnes…
- 「为什么 Harness 是近期 RSI 的实际路径」:近期 RSI 的三步预测 1. 模型不会直接改写自己的权重 ,但它能改进训练管线和部署系统,使下一代模型更强。 2. Harness 工程走向元方法论 :改善的对象从答案本身,变成得到更好答案的机制。Harness 本身成为优化目标。 3. 成熟 Harness + 智能模型 = 正反馈循环 :更好的 Harness 催生更强模型,更强模型又让 Harness 不必过度工程化。 与 Prompt Engineerin…
最后的「为什么 Harness 是近期 RSI 的实际路径」把讨论落到「近期 RSI 的三步预测 1. 模型不会直接改写自己的权重 ,但它能改进训练管线和部署系统,使下一代模型更强。 2. Harness 工程走向元方法论 :改善的对象从答案本身,变成得到更好答案的机制。Harness 本身成为优化目标。 3. 成熟 Harness + 智能模型 = 正反馈循环 :更好的 Harness 催生更强模型,更强模型又让 Harness 不必过度工程化。 与 Prompt Engineerin…」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。