← 返回

AURA:面向复合 AI 系统的反射式自适应自动研究

2026年5月1日

为什么

卡帕西 (Andrej Karpathy) 的 autoresearch 思路认为,一个 AI 系统 真正的进步单元不是一次梯度更新,而是一次用自然语言写出的”自我修改”。这个视角,恰好点出了两种 常见的 LLM 任务适配方式之间的空白:

  1. 强化学习微调(如 GRPO)把每次 rollout 都压缩成一个标量奖励。rollout 失败的真正原因—— 一次读错的检索结果、一个漏掉的约束、一个返回了无用报错的工具——全都被丢弃了。策略要变得有 竞争力,往往需要成千上万次 rollout。
  2. 提示词优化器绕开了权重更新,但通常只看得到”这个 prompt 分数变高了没有”,看不到为什么。 它们在提示词空间里做组合式探索,却从不去读系统究竟做了什么。

AURA 把 autoresearch 的想法落到实处:rollout 本身就是我们能拿到的信息量最大的学习信号,而 自然语言正是据此编辑系统行为的合适载体。

框架

AURA 是一个”系统外”的优化器,适用于任何由 LLM 调用、检索和工具使用组成的复合 AI 程序——它不 改动任何权重。四个机制驱动学习:

  1. 基于诊断包的反思式变异。 每次 rollout 之后,AURA 把推理轨迹、工具输入/输出、检索结果、 标量指标以及任何领域特定的文字反馈拼接成一个”诊断包”,连同当前的系统 prompt 一起交回 LLM, 要求它给出一处具名的修改,用来修复信息量最大的那一类失败。哪怕只有一次 rollout 的文字量, 通常也足以产生一次方向明确的大幅更新——自然语言比一个标量奖励丰富得多。
  2. 按实例维护的 prompt 前沿。 AURA 不只保留聚合分数最高的那个 prompt,而是为每一个训练 样本都保留在它身上表现最好的 prompt。这保留了互补的策略(一个为短查询调优的 prompt,和 另一个为多跳推理链调优的 prompt),防止整个种群坍缩成单一的主导风格。
  3. 精化树。 被选中的”父代” prompt 经反思式变异产生”子代”;定期在不同 prompt 之间做重组, 把各自在不同样本子集上学到的经验合并起来。每个子代都免费继承祖先的诊断历史。
  4. 选择阶段的新颖性惩罚。 一个记录近期生成过的 prompt 的小缓存(按结构加归一化关键词哈希) 会在选择阶段惩罚近似重复的 prompt,防止循环反复”发现”同一处修改,推动系统探索真正新的策略。

两个方向相互增强:诊断包告诉 LLM 当前 prompt 在哪里失败,按实例维护的前沿则告诉它哪些 prompt 家族值得保留下来做重组。

任务

  • 多跳问答 —— HotpotQA 式的检索 + 推理链。
  • 指令跟随 —— IFBench 式的强约束。
  • 隐私敏感的委托 —— PUPA 式的、关于向外部工具泄露多少信息的决策。
  • 面向事实核查的文档检索 —— HoVer 式的多文档证据整合。
  • 数学推理 —— AIME-2025 风格的竞赛题。

核心结果

在 Qwen3-8B 上与 GRPO 对比,AURA 用约 1/35 的 rollout 预算追平 GRPO 的最佳聚合分数(500 训练步、10,000 次 rollout),并在略微增加预算后反超几个百分点。在 GPT-4.1-mini 上与 MIPROv2 对比,同等 rollout 预算下 AURA 将聚合分数提升 +9.8%(MIPROv2 为 +4.9%),在分布外约束 满足任务(IFBench)上提升 +5.6%——全程不改动一个权重。