谷歌 DeepMind 提出 Dream-RSI:让 AI 智能体「做梦」复盘过往搜索
谷歌与 DeepMind 研究人员提出 Dream-RSI,通过复用已完成的搜索记录来测试新的搜索策略,无需重复调用模型或评估器,从而降低探索成本。该方法只改变搜索策略,不改动底层模型。
核心事实
据 the-decoder.com 报道,谷歌与 DeepMind 的研究人员提出了一种名为 Dream-RSI 的方法,用于帮助 AI 智能体更高效地应对困难的搜索类任务。其思路是复用一次已完成搜索留下的记录,在智能体已经探索过的范围内测试替代策略,而不必重复代价高昂的计算。报道称,该方法改变的是智能体的搜索方式,而非底层 AI 模型本身。
具体而言,智能体在搜索过程中记录自己的尝试及其结果,这些数据随后可用于「重放」当时的决策。由于结果已存在于搜索树中,成千上万种替代策略可以在不再次调用模型或评估器的情况下被测试。研究团队将这一过程称为「做梦」:智能体先在大量变体中演练并选出较优策略,再将其用于真实的搜索,如此循环。
背景与影响
自我改进型 AI 智能体通常遵循「提出方案—评估结果—学习—重试」的流程,但复杂任务的搜索空间可能极其庞大,探索策略往往决定搜索是成功还是把算力浪费在错误方向上。固定策略无法从经验中学习,容易反复走进死胡同;而在搜索过程中动态调整策略,又需要大量尝试来验证效果。
报道提到,研究团队使用 Gemini 3.1 Pro 与 Gemini 3.7 Flash 在三个领域的八项任务上进行了测试,并与采用固定搜索策略的基线对比。此外,后续分析显示,把搜索历史压缩成明确指令反而可能过度收窄搜索空间,在某一 GPU 任务上表现不如不使用这些指令的版本。研究团队已在 GitHub 上公开代码与更多细节。
限制与来源
上述内容来自 the-decoder.com 的报道,相关方法与测试细节尚未获官方逐项确认,具体实现、适用范围与可用性请以研究团队公开的代码和官方信息为准。本文不构成任何投资或采购建议。