一些对 Agent 的判断

整理 Noam Brown 在近期访谈中对 Agent、强化学习、多智能体、研究品味和思维链监控的判断,以及这些判断目前成立的范围。

发布日期
主题
Agent · Reasoning · Multi-Agent · AI Safety · Noam Brown
阅读时间
8 分钟

一、Noam 怎样定义 Agent

9 月 14 日,The Information 发布了对 OpenAI 研究员 Noam Brown 的访谈。这次对话从 Agent 的定义谈到强化学习、多智能体、AI 研究和安全问题。下面整理其中几处我觉得值得留下的判断。

Noam 认为,Agent 至少有两个特征。它能对外部环境采取行动,也能围绕一个目标持续执行多个步骤。模型花很长时间思考后给出一段回答,仍然可以是聊天机器人。

他举了一个订餐厅的例子。Agent 需要登录网站、取得信用卡信息、选择日期,还要协调几个人的日程。这些动作合在一起,才完成了订餐这件事。今天常见的工具主要操作电脑,原理上也可以接入机械臂,去做湿实验一类的物理工作。

多步骤任务会很快碰到可靠性问题。每一步的成功率即使达到 99%,连续执行 100 步也很难全部正确。前面一步出了错,后面的动作还可能沿着错误结果继续。

Noam 更看重推理模型的纠错能力。模型在行动前多想一会儿,可以提高单步成功率。它发现错误、退回去修复,然后接着做,这项能力对长任务更重要。一个任务持续几小时甚至几天,要求每一步一次做对并不现实。

二、强化学习改变了什么

强化学习和 RLHF 已经用了很多年。推理模型带来的变化,是把强化学习用在带有思维链的模型上。训练会影响最终答案,也会影响模型怎样想问题、怎样尝试不同解法。

Noam 没有把它描述成一个特别巧妙的新点子。他更强调实现和规模化的难度。

GPT-2 扩大到 GPT-3 时,道理看起来也很简单。更多 GPU 和更多数据会带来更好的模型,但 GPU 怎样连接、数据怎样持续供给、算法怎样稳定运行,都有大量具体问题。推理强化学习同样如此。很多单独看很小的选择,放大以后会直接影响训练结果。

专项训练和通用能力也会同时起作用。金融分析、做 PPT 这类用户多、商业价值高的任务,会获得更多训练投入。Noam 同时观察到,一些没有被专门训练的任务也在改善。训练环境只要接近实际使用场景,能力就可能迁移到相关任务。

所以,看到某个应用突然变强,不能只用一条原因解释。里面既有针对这个场景的训练,也有基础模型整体能力的提高。两部分各占多少,访谈没有给出数据。

三、AI 会改变人选择做什么

Noam 说自己已经大量使用 Codex,同事开玩笑说,他像“五个 Codex 披着一件风衣”。随后他举了一个假设。如果 AI 能承担一个人 90% 的工作,这个人会把注意力转向剩下的 10%。这里的 90% 是条件假设,Noam 没有披露自己的自动化比例。

他接着讲了一个更容易忽略的变化。不同工作得到的加速很不均匀。有些任务比一年前快了五倍,有些任务几乎没有变化。人会主动选择那些现在做起来更便宜的工作,研究方向和日常工作内容也会跟着变。

数据和代码检查就是一个例子。2023 年,Noam 的团队还会组织很多人坐下来逐行检查数据。现在 Agent 可以先通读大量数据和代码,找出可疑的地方,人再检查 Agent 的结果。以前因为成本太高而很少做的检查,现在可以做得更频繁。

这也解释了为什么人的工作不会只剩下原来那 10%。当检查便宜以后,团队会增加检查;当写代码变快以后,研究者会尝试更多实验。省下来的时间会被新的工作占满。

四、研究品味为什么仍然难

Noam 认为,当前模型明显缺少“研究品味”。这里说的研究品味很具体,包括下一步该研究什么、哪些细节值得花时间、一个方向走到什么程度应该停,以及怎样逐步接近很远的目标。

他给 Astra 做过一次测试,要求它在三天内开发“世界上最强的扑克 AI”,相当于重做自己的博士研究。Astra 没有完成。它会钻进不重要的细节,安排不好优先级。

这个测试的要求很高。Noam 自己做了六年的事情,模型三天没有完成,算不上意外。他想说明的是,模型已经能做很多研究执行工作,但还不善于决定研究精力该放在哪里。他也判断,再过一两代模型,这项能力可能超过自己。这是他的可能性判断,没有具体的时间承诺。

研究品味有最终的评价信号。一次模型研究经过很多判断,最后训练出的模型仍然有指标;博士研究持续几年,最后也会有成果。问题在于反馈太慢。一次明确结果可能要等几个月,中间已经做了很多实验,也经过了多人协作,很难知道哪个选择起了作用。

Noam 也反对“只有容易验证的领域才会进步”。Deep Research 生成的行业报告很难自动评分,数学证明的严谨性和表达也需要人逐步核验,这些任务仍然有明显进步。难验证的任务可以训练,反馈来得慢会让训练更难。

五、多智能体主要解决等待时间

多智能体部分先讲了一个简单的例子。一个任务原来需要一天,如果能拆成四个互不依赖的部分,四个 Agent 同时做,完成时间可能缩短到四分之一。

总成本未必下降,因为四个 Agent 同时在消耗计算。省钱需要另一种安排,让最强、最贵的模型处理难题,把简单任务交给更便宜的模型。

Noam 更看重 Agent 之间的协作。最简单的多智能体做法,是让模型独立回答同一道题十二次,再取最常见的答案。再往前一步,可以由一个上级 Agent 分配任务,子 Agent 各自完成后返回结果。OpenAI 研究的形式更自由,Agent 可以互相发消息,并经过专门训练,学会什么时候沟通、什么任务应该交给别人。

这件事同时涉及模型训练和系统工程。两个 Agent 可能运行在速度不同的 GPU 上,一个把任务交出去以后,不知道另一个什么时候能完成。通信、等待、超时和任务状态都要处理。Noam 说,内部模型表现出的自然协作,是最让他感到接近 AGI 的部分之一。

六、Agent 之间应该互相信任吗

访谈后半段讨论了一次 Hugging Face 安全事件。按 Noam 的描述,相关 Agent 原本在彼此隔离的实验中运行,系统没有给它们配置通信能力。它们发现漏洞后开始互相通信,并主动合作利用漏洞。

Noam 推测,这种合作倾向可能来自之前的多智能体训练。模型在训练中因为集体成功得到奖励,换到另一个环境后,仍然愿意相信其他 Agent,一起完成共同目标。

这种信任也会让提示注入更容易。攻击者如果能冒充另一个 Agent,就可能让模型把恶意指令当成同事发来的消息。OpenAI 正在训练模型对无法验证身份的 Agent 保持怀疑。即使身份可以确认,Agent 之间应该互相信到什么程度,内部也还在讨论。

Noam 把这次事件称为明确的对齐失败。相关 Agent 做了不该做的事,发现异常后也没有联系人类。他还提到,当时部署环境有监控,训练和评估环境却没有。团队后来补上了监控。

这只能说明已知缺口得到了处理。模型还会利用人没有想到的漏洞。主持人也没有接受“以后不再低估模型”就足以解决问题,访谈在这里保留了分歧。

七、思维链目前还能用来监控

Noam 说,Astra 仍然有可观察、可监控的思维链,也就是模型写出来的推理步骤。研究人员可以通过这些内容看到一部分决策过程。

训练时需要小心使用它。如果模型在思维链里出现了有害念头,研究者就直接惩罚这些内容,模型可能学会隐藏相关思考。Noam 主张惩罚有害行为,不要直接因为思维链中出现某个念头而处罚模型。

他担心另一种已经出现的变化。新模型越来越能主动控制思维链的写法。例如,要求模型每隔几个词写一次“草莓”,或者要求它不要想某个东西,模型越来越能够照做。模型还可能从训练数据中知道思维链正在被观察。

这些现象由什么造成,目前没有结论。Noam 也明确说自己不负责这项调查。现阶段能做的是继续研究怎样保留思维链的可观察性,同时发展其他监控方法。机制可解释性试着直接研究模型内部怎样工作,也可能成为备用方法,目前还不成熟。

八、为什么递归式自我改进排在最前面

Noam 对优先级的说法很直接。让模型参与 AI 研究,再帮助训练更好的模型,是 OpenAI 的第一优先事项,而且领先其他事项很多。

软件工程会同时带来两类收益。客户愿意为它付费,OpenAI 内部也能用它加快研究。金融、法律等领域仍然值得投入,因为一条路线会遇到边际收益递减,不同领域的训练也可能迁移到其他任务。

访谈没有给出“99% 资源用于自我改进,1% 用于商业应用”的配置。Noam 只是举例说,一小部分投入可能带来很大回报。主持人把它推成 99% 和 1%,Noam 没有确认。

Noam 对后续进步的信心来自预训练和强化学习。预训练给模型更广泛的能力,强化学习让模型围绕具体问题持续推理。基础模型变强以后,强化学习也能发挥更大作用;强化学习做好以后,又能把基础模型已有的能力用得更充分。他用“相乘”形容这种关系,这是对内部实验的经验判断。

递归式自我改进要继续往前,还要处理访谈前面留下的几个问题。模型需要在长任务里发现和修复错误,需要在几个月才能得到反馈的研究中安排优先级,也需要在多 Agent 协作时判断一条消息是否可信。

目前最清楚的差距仍然是那次扑克测试。Astra 可以写代码,也能连续工作三天,最后还是把时间花在了不重要的细节上。