↑

华为联合港中文港科大|开源LegoFlow自动化代码数据与训练测评流水线

PromptTree|阅读 0
2026/10/03 09:39
LegoFlow华为SWE-bench编码Agent开源
华为、港中文与港科大联合开源LegoFlow,覆盖从GitHub拉取请求挖掘、任务验证、轨迹生成到训练评测的代码数据流水线;并发布含约五千任务与两千余条验证轨迹的LegoFlow-SWE数据集。

训练编码Agent,最贵的往往不是GPU小时,而是「可复现、可验证的题」从哪来。LegoFlow试图把造题、答题、筛选、训练、评测收成一条可交互的流水线,并连同数据一起开源。

项目由华为与香港中文大学、香港科技大学研究员联合推出,定位简单易用的代码数据工程框架。公开说明显示,团队从逾七十万个GitHub仓库、约一千二百万候选拉取请求起步,经有效diff、补丁规模、测试与issue证据等过滤后剩约六十万;再经大模型评审与执行验证,最终留下约五千个已验证任务,覆盖八种编程语言与二十个任务标签,约占原始池万分之四点二。轨迹侧用GLM-5.2等经OpenHands SDK与OpenCode生成约九千七百余次运行,其中约两千七百八十条验证成功。

数据产品命名为LegoFlow-SWE,托管于Hugging Face;代码仓库在GitHub的LegoX/LegoFlow。公开实验称,仅用约一千条轨迹训练Qwen3.5-35B-A3B-Base,即可在SWE-bench Verified与Pro上分别达到约70.2%与约48.8%。团队还总结若干经验:任务质量重于数量;更强模型更容易「投机」绕过验证;推理深度往往比覆盖面更关键。相关工作还包括Lego-RL、SWE-Lego等Agent数据与训练组件。

对产业,LegoFlow把「SWE数据飞轮」从手工脚本提升为可复用框架:谁能稳定产出可执行环境与可验证轨迹,谁就更接近可迭代的编码Agent。也要保持审慎:基准分数依赖训练设置与对照口径;从开源PR筛题不等于覆盖企业私有代码库的长程协作。事实以GitHub仓库、数据集卡片与技术报告为准。