直播预告!聊聊 Lego-RL 框架,如何在真实 Coding Agent Harness 中接入 RL 进行训练?

青稞AI · 人工智能

原创 青稞编辑部 2026-09-06 00:00 河北 Lego-RL 是一套面向 Coding Agent 的强化学习训练框架,不需要修改 OpenHands SDK、Claude Code 或 OpenCode 的任何一行代码,就能把它们直接接入强化学习 主页: http://qingkeai.online/ 青稞社区为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系: aiFreeCode 随着编码智能体从“模型能力”走向“模型 + Harness”协同,工具调用、上下文管理与控制流正在成为影响智能体能力的重要因素。 然而,将真实 Agent Harness 接入强化学习训练并不简单:环境故障与奖励投机会污染训练信号,训练与推理环境的差异也可能导致策略更新偏离真实 Agent 行为。 华为和港中文最新开源的 Lego-RL 从三个方面解决了这些问题:Faithful(保真优化)、Reliable(可靠执行)和 Observable(可观测训练)。 华为&港中文最新开源 Lego-RL:让 Coding Agent 的强化学习训练真正"长稳可靠" 论文: https://arxiv.org/abs/2608.17393 代码: https://github.com/LegoX/Lego-RL Lego-RL 是一套面向 Coding Agent 的强化学习训练框架,不需要修改 OpenHands SDK、Claude Code 或 OpenCode 的任何一行代码,就能把它们直接接入强化学习,基于 Qwen3.5-35B-A3B,三个 harness 上的 SWE-bench Verified 分数分别从 64.0 / 62.4 / 57.2 提升到 70.4 / 68.2 / 66.6。 9月8日(周二)20:00 , 青稞Talk 第152期,华为莱布尼兹研究所研究员、香港中文大学博士杜一鸣,将以 LEGO-RL 为核心案例,介绍面向真实编码智能体的 Harness-Native 强化学习方法。 重点拆解其“忠实优化、可靠执行、可观测训练”三大设计,并结合多种 Coding Agent 的实测结果,分析 Harness 对训练效果、任务筛选、系统效率及 Agent 行为变化的影响。 同时也将介绍 Agent Plugin 如何支持训练校验、实时诊断与人工复盘,形成从数据准备到训练运维的半自动化闭环,并进一步讨论这套方法对实际 Agent 研发与训练基础设施建设的启示。 青稞介绍 杜一鸣。香港中文大学博士,师从黄锦辉教授,华为莱布尼兹研究所研究员,研究方向为代码智能体、强化学习、记忆智能体,曾在顶级会议ICLR、AAAI、EMNLP等发表多篇论文包括AAAI2026 Oral,曾获ACL SIGHAN 2024最佳论文,是Lego-RL代码智能体强化学习训练框架核心开发者,也是华为LegoX 系列工作的贡献者。 主题提纲 Lego-RL:面向真实 Coding Agent 的 Harness-Native 强化学习方法 1、Coding Agent 概述与训练范式之变 2、把真实 Harness 接进 RL 的挑战 3、Lego-RL:Harness-Native 强化学习方法设计 4、多种 Coding Agent 的实测结果与分析 5、基于 Agent Plugin 的训练运维半自动化闭环 6、对未来的启示AMA(Ask Me Anything)环节 直播时间 9月8日(周二)20:00 - 21:00 如何观看 Talk 将在青稞社区【视频号: 青稞AI 】上进行直播,欢迎预约观看! 往期推荐 直播预告!从 Harness 看 AI4AI 如何实现 直播预告!到底模型的“什么经验值得被看见”?一起聊聊 LOPD:不再手动设计 OPSD 特权信息 直播预告!聊聊 TriAttention:面向长上下文推理的三角级数式 KV Cache 压缩 直播预告!聊聊 Agentic RL 下半场: 无需梯度更新的即时强化学习JitRL 加入青稞AI技术交流群 加入青稞AI技术交流群,不仅能与来自 MIT、港中文、CMU、UCLA、斯坦福、清华、阿里、腾讯 等名校名企AI研究员/开发者一起进行技术交流,同时还有一线青年AI研究员/开发者的 Talk分享 、 青稞Tea 、 论文精读 、 招聘内推 、 国内外硕/博申请 、 大模型技术报告解读 等。 备注:姓名+学校/公司+方向,暗号" AI "优先审核通过! 都看到这了, 点个关注再走 吧🧐~ 跳转微信打开

查看原文