近日,Meta发布了一篇名为Hyperagents的论文,在AI圈子里引发了讨论。不是因为它又刷了什么benchmark,而是因为它尝试解决一个更根本的问题:AI系统能不能自己改进自己改进的方式?

自改进(self-improving)AI不是什么新概念。之前的Darwin Gödel Machine(DGM)已经展示了在编码领域,AI可以通过反复生成自我修改的变体来不断提升能力。但这里有个关键假设:任务表现和自我改进能力必须高度相关。
在编码这个领域,这个假设成立——一个更强的coder,通常也是个更强的代码审查者和修改者。但一旦跳出编码领域,这个假设就失效了。一个写诗写得更好的AI,并不意味着它修改自己代码的能力也会同步提升。
这就导致了之前的自改进系统都有一个天花板:元级别的改进机制是固定死的,由人类工程师手工设计,本质上限制了系统的进一步进化。
Hyperagents的核心创新是把任务代理(task agent,负责解决问题)和元代理(meta agent,负责修改自己)整合到同一个可编辑的程序里。
关键在于:元级别的修改过程本身也是可编辑的。这意味着系统不仅可以改进任务解决行为,还可以改进产生未来改进的机制。论文把这种现象叫做"元认知自我修改"(metacognitive self-modification)。
听起来有点绕,打个比方:传统AI是在跑道上越跑越快,而Hyperagents是那个能自己修改训练计划、调整跑道的系统。
研究团队通过扩展DGM创建了DGM-Hyperagents(DGM-H),保留了DGM的开放式探索过程,同时允许自我改进机制本身进化。

具体工作流程:
研究团队在四个不同领域进行了测试:
1. 编码编辑(Polyglot)
2. 模拟同行评审(预测接受/拒绝)
3. 机器人奖励函数设计(在模拟中训练策略)
4. 奥数解题评分

涌现的元级别改进
更有意思的是元层面的改进会自行涌现。实验中,系统自主发展出了持久记忆(persistent memory)功能——不再只是记录分数,而是存储因果假设、前瞻性计划,让后续迭代能站在前人的肩膀上,避免重复犯错。

具体涌现的改进包括:
这些元级别的改进居然还能跨领域转移,在不同任务之间累积复用。实验显示,从一个实验转移过来的超代理初始化时,能够带来更快的进展和更高的最终性能。

安全考虑和限制
实验在沙盒环境中进行,具有资源限制、无限制互联网访问和人工监督。允许自我修改带来了风险:比人类更快的进化速度、数据偏差的放大、以及评估游戏化(优化指标而非真实目标)。
当前设置保持外层环组件(如父代选择和评估规则)基本固定,以确保稳定性和安全性。
看完这篇论文,几个感受:
客观说,这还是一个早期的研究原型。系统能改进自己的改进机制,但外层环(父本选择、评估规则)仍然是固定的,这是可能是为了稳定性,也为了安全。
不过它确实展示了某种可能性:AI系统不只是执行任务,而是在持续进化自己的进化策略。如果这能安全地扩展,可能会打开一扇通往真正开放式AI系统的大门。
论文和代码都一公开,感兴趣的可以自行查看: