Harness原生Agent新突破!微软发布OpenForge RL:在任意环境中端到端训练

资讯 » 科技头条 2026-07-28


在任意 Harness 中训练 Agent,为什么难以实现?

目前的难点在于,harness 推理通常是有状态、多进程的。主流开放 RL 框架默认本地 rollout,难以直接复用原始harness;如果训练阶段改用简化版 harness,交互流程则有可能偏离部署环境,导致训练和部署不匹配。

针对这个问题,来自微软和哥伦比亚大学的研究团队提出了 Harness 原生 Agent 端到端训练框架 OpenForge RL。它通过轻量级 Agent 记录模型调用,将调用记录转换为训练框架可用的数据,由 Kubernetes 编排器在独立容器中调度 rollout,从而在任何 harness 和环境中进行大规模训练。


论文链接:https://arxiv.org/abs/2607.21557

结果显示,经 OpenForge RL 训练的模型在几乎所有基准上均优于同等规模的开源模型,展现出更高的样本效率和更强的跨 harness 泛化能力。


图|左侧:OPENFORGE RL 构建在 Orchard Env上,并将任意 harness × 任意环境连接到 veRL 等标准 RL 代码库,不存在训练-部署不匹配。右侧:使用 OPENFORGE 训练得到的模型,在 6 种 harness 上,跨六个 Claw 和 GUI 环境进行评估。

然而,尽管强化学习(RL)提升了 Agent 在复杂工具调用和多步交互任务中的可靠性,但自我纠错能力仍是短板。

研究团队表示,这项工作旨在让研究人员能够在真实部署的 harness 和环境中训练并改进 Agent,从而降低研究门槛。

OpenForge RL:Harness原生Agent训练框架

OpenForge RL 是一个即插即用的 rollout 接口,用于把分布式 harness rollout 接入 veRL 等 RL 框架。它在 harness 与推理服务器之间加入 Agent,记录模型调用,并在 rollout 结束后重构为标准 RL 训练轨迹。由此,harness 代码无需修改,也能通过 Kubernetes 编排器扩展到数千个并发环境。

具体流程如下:

1.Agent:包装 vLLM 等推理服务器,记录 rollout 中的生成请求和模型回复;任务结束后,收集终止奖励,并将 prompt-response 记录重构为训练轨迹。GRPO 等基于组的算法则根据同组轨迹的平均奖励计算优势值。

2.Kubernetes 编排器:负责在 Azure 等云上创建、管理和回收 rollout 容器。每个容器拥有独立 CPU 和内存,并与训练节点分离运行,可支撑大规模并发 rollout。

为避免远程 rollout 无响应或失败影响训练,OPENFORGE RL 还采用了以下容错机制:

1.墙钟超时:为每个 rollout 任务设置时间上限。超过时间仍无响应时,OPENFORGE RL 会终止该任务并返回错误信号,让训练器可以继续从剩余 rollout 中收集数据。

2.异常 rollout 丢弃: 如果 rollout 因网络问题、任务故障或 harness 故障失败,OPENFORGE RL 不会为其分配奖励,而是直接丢弃该 rollout,避免引入误导性训练信号。


图|OPENFORGE RL 概览。

为支持在多样环境中开展 OpenForge RL 实验,研究团队还构建了一条简单的任务生成流水线,先生成指令、过滤任务,再构建 Docker 环境和验证脚本,并用开放 LLM/VLM 试跑并修补,直到通过端到端检查。环境可预装 OpenClaw、Codex 等 harness,生成任务可同时用于 SFT 和 RL。


图|数据/任务合成流水线的概览。

同规模领先,跨harness泛化更强

研究团队在工具使用(Claw)和多模态 GUI 两类长程任务上评估了 OpenForge RL。整体来看,OpenForge 训练的模型在几乎有基准上均优于同等规模的开源模型,并展现出更高的样本效率和更强的跨 harness泛化能力。

1. 基准测试表现

在 Claw 任务上,OpenForge-Claw 在多个基准上优于同规模模型,目前的任务环境能够为模型提供有效训练信号。相较于仅经过 SFT 训练的模型,经过 SFT+RL 训练的模型在鲁棒性和平均成功率上均有提升。


图|Claw Agent 在 Claw-Eval、QwenClawBench 和 MCPAtlas 上的表现。

在 GUI 任务上,OpenForge-GUI 也表现出较强竞争力。相比使用 20 万+ 任务训练的 MolmoWeb,OpenForge-GUI 只用 2.5k 个任务,就在 Online-Mind2Web 上超过前者,并在 WebVoyager 上保持竞争力;OpenForge-GUI 优于相近规模的开放基线,并在 GUI 设置中追平或超过数倍更大的模型;经过 SFT+RL 训练后,其在 3 个基准上也均优于仅 SFT 版本。


图|GUI Agent 在 OSWorld-Verified、OnlineMind2Web 和 WebVoyager 上的表现。

2.跨 Harness 泛化能力

研究团队进一步考察了模型在不同 harness 下的泛化表现。结果显示,单一 harness 训练已有一定迁移能力,多 harness 联合训练整体更优,且在复杂 harness 上的收益更明显。

不同 harness 的学习难度存在显著差异。在 ClawEval 中,研究团队使用 ReACT、ZeroClaw、OpenClaw 和 Codex 等 harness 进行评估。结果显示,工具接入更灵活的 harness 得分最高。SFT+RL 能提升大多数 harness 的表现,但在 OpenClaw 上带来的提升相对有限,这可能与其更长的 prompt、更复杂的上下文有关。

多 harness 联合训练整体更优。例如,ZeroClaw 上的分数从 46.0 提高到 48.5。研究团队认为,这可能与多 harness 训练引入的工具调用方式和控制流程多样性有关。


图|在不同 harness 下比较 OpenForge-Claw 在 ClawEval 上的表现。

未见 harness 评估中,单 harness 训练表现出一定迁移能力。例如,仅在 ZeroClaw 上训练的模型,在未参与训练的 OpenClaw 和 Codex 上也有提升。相比之下,多 harness 联合训练的整体表现更好,更丰富的工具调用方式和控制流程可能有助于提升泛化能力。


图|未见 harness 评估。

3.RL 学到的能力

RL 使模型更少依赖通用 shell,更倾向于选择合适的专用工具。在 ZeroClaw harness 下,通用 shell 调用占比从 22.6% 降至 13.9%,调用相应转向专用服务工具,轨迹长度也略有缩短。

RL 还提升了多项 Agent 的可靠性指标。在 Codex harness 下,模型的自我验证、工具覆盖率和格式鲁棒性都有所提升。


图|SFT 与 SFT+RL 在 ClawEval 上的行为比较。

不足和未来发展

尽管 OpenForge RL 在基准测试和跨 harness 泛化实验中取得了不错的结果,但依然存在以下几点不足:

首先,异常 rollout 的处理仍较为保守。运行 rollout 任务的容器可能因网络错误、harness 崩溃或超时而中断。未来,研究团队将进一步研究部分 rollout 的信用分配,让有效交互步骤能够被用于训练。

其次,错误恢复能力仍然不足。RL 能提升自我验证、工具覆盖和多步计划等能力,但错误恢复在 RL 后仍是较弱项。因此,后续研究将针对错误恢复构建专门数据,并探索相应训练方法,以进一步强化这类能力。

此外,数据和基础设施仍是扩展到更多agent环境的门槛。未来,研究团队表示将公开代码、数据集和模型,希望降低在真实 harness 和环境中训练 Agent 的门槛。

作者:夏千斯

如需转载或投稿,请直接在本文章评论区内留言



免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。由用户投稿,经过编辑审核收录,不代表头部财经观点和立场。
证券投资市场有风险,投资需谨慎!请勿添加文章的手机号码、公众号等信息,谨防上当受骗!如若本网有任何内容侵犯您的权益,请及时联系我们。