跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 22 天前AI 评分42
AI 导读

Google/DeepMind 演示的 Dream-RSI 让 Agent 在历史探索轨迹构成的离线模拟器中"做梦"试错,把调用大模型做探索的成本最高降低 162 倍。它冻结模型权重,只优化搜索、回溯与分支选择的探索策略,选出最佳策略后再上线实测。在数学优化、算法设计和 GPU 内核优化测试中,方案质量持平或更好,在线调用大模型次数降至原本的几十分之一。

正文

卧槽,Google/DeepMind 团队最新演示的 AI 递归自我改进论文有点吊炸,奇点要来了吗!?

以前让 Agent 去探索一个复杂的算法或 GPU 算子,每试错一次就要花几十美分、还要等编译跑分,钱包根本扛不住。
谷歌 Dream-RSI 的思路变了:它让模型在过去的历史日志里做梦,用极低成本试完几千种打法,选出最好的再上线实测。

早上好好看了下,发现DeepMind 这篇 Dream-RSI 最值钱的突破其实还不只是让 AI 去修改自身权重,
他们终于找到了一种办法,把调用大模型做探索的成本直接打掉了最高 162 倍。
对正在做代码智能体、自动科研和算法优化的人来说,这篇论文给出了一个极度清醒的工程底座。
它的思路非常克制,一共踩实了三步:
1️⃣ 冻结模型权重,只改战术打法
科幻小说里的自进化,往往是让模型自己改自己的底层代码或权重,结果往往是灾难性遗忘和幻觉暴增;
谷歌第一步就把安全阀焊死了:底层的大模型完全固定不动,它只负责干活;
自我改进的对象,是指导模型去哪里搜索、什么时候回溯、怎么选分支的探索策略。
2️⃣ 把历史残局做成做梦模拟器
这是全篇最聪明的一步。
以前让 Agent 探索长链条任务,最昂贵的是每一步都要真机运行、在线打分;
Dream-RSI 把过去跑完的探索轨迹存成了一棵不可篡改的历史树;
这棵树就是环境模拟器,系统可以在离线状态下疯狂做梦,把成千上万种新的探索打法放在历史数据上快速过一遍,
既不需要重新调用大模型生成一遍内容,也不用重复去跑耗时的编译器。
3️⃣ 用历史教训筛选出最佳策略再实战
在沙盒里挑选出得分最高的探索策略后,才把它装载到下一轮真实的业务环境里;
在数学优化、算法设计和 GPU 内核优化的测试中,它不仅拿到了持平甚至更好的方案,
还把在线调用大模型的次数砍到了原本的几十分之一,特定测试下甚至减少了 162 倍。
但看这篇论文必须看清它的取信边界:
这种自我进化之所以成立,是因为算法和 GPU 代码有着极其冷酷的判定器,能不能编译、运行速度快了多少,物理世界会给出绝对确定的分数;
如果换成写文章、做设计等没有客观真理裁判的场景,做梦机制会瞬间退化成自我陶醉的幻觉堆叠。
真正的智能化突破,往往不是靠盲目堆算力去穷举试错;
模型的能力可以固定,但通过沉淀过去的失败轨迹、用最低的代价把搜索战术打磨到极致,
这套把经典强化学习移植进 Agent 系统的框架,给很多被高昂 API 账单卡住的团队,指了一条极其实在的生路。

来源:@AYi_AInotes · x.com