康昱 Yu Kang

高级技术专家 华为 · 软件工程应用技术实验室 曾任微软 DKI 研究组首席研究员(2018 – 2026)

我的研究横跨人工智能、软件工程与系统三大领域。研究核心是智能体进化与递归自我改进(RSI):让 AI 智能体从自身经验中持续学习,在真实软件任务上不断变强。其中很重要的一部分是大模型训练,尤其是智能体强化学习(Agentic RL),即在大规模、可执行、可验证的环境中训练模型与智能体。

我的研究与众不同之处在于出发点:真实产品的复杂性。工业级代码仓库规模庞大、技术栈异构、持续演进,还有公开基准从未覆盖的内部工具链、构建系统和任务类型。我把这些复杂性建模为科学问题加以研究,再把成果带回实际场景落地。我率先提出如何将业界产品代码仓库与产品任务转化为可用于编程智能体评测、调优和训练的数据与环境,使大模型和编程智能体在训练与开发阶段就能关注到内部产品,并针对性地优化。

加入华为之前,我在微软 DKI 研究组(数据、知识与智能)工作了八年。期间主导了 SWE-bench-Live 与 RepoLaunch 的研发(RepoLaunch 已被 GLM-5 等前沿开源模型用于构建智能体训练环境),参与了 UFO、TaskWeaver 和 Agent Lightning,并与 10 多个产品团队合作,将 20 多项研究成果落地到产品中,其中包括集成进支撑 Azure 与 Microsoft 365 的微软基础云服务的 AIOps 技术。我同时担任复旦大学计算机科学技术学院行业硕士生导师,博士毕业于香港中文大学,师从吕荣聪教授。

YK
智能体进化 RSI Agentic RL 编程智能体 AIOps GUI 智能体
核心研究应用场景
0论文引用Google Scholar
0h 指数i10 指数 59
0论文2011 – 2026
0GitHub StarAgent Lightning · UFO · TaskWeaver
NeurIPSICLRICMLACLEMNLPNAACLTMLRICSEESEC/FSEEuroSysUSENIX ATCWWWICDEISSREDSNECAIIEEE CLOUDICWS NeurIPSICLRICMLACLEMNLPNAACLTMLRICSEESEC/FSEEuroSysUSENIX ATCWWWICDEISSREDSNECAIIEEE CLOUDICWS
01 — 研究方向

在真实软件上自我进化的智能体

立足人工智能、软件工程与系统的交叉:两个核心方向,一个共同底座,落地到三个应用场景。

研究目标

面向真实软件的自进化智能体

智能体的能力不应在发布时就定型。它们从自己的执行轨迹和失败中学习,并且在它们真正要服务的产品上训练,而不只是在公开基准上训练。

共同底座
底座

产品驱动的环境、数据与评测

两个核心方向都需要源源不断的可执行任务和可靠的验证。我把产品代码仓库、产品任务和开发历史转化成这样的任务,同一套基础设施同时服务于评测、调优和训练。

从产品复杂性到科学问题

我的研究方式:从真实产品的难点出发,把它提炼成科学问题,再把研究成果带回生产环境。

产品复杂性科学问题落地成果
每个仓库的构建方式都不同语言、平台、工具链五花八门,没有两套环境是一样的。
→
把环境构建变成智能体任务智能体能否自主完成任意仓库的配置、构建与测试?
→
RepoLaunch → GLM-5为前沿模型的智能体训练构建可执行环境。
产品代码每天都在演进内部任务藏在提交历史里,而不在公开基准里。
→
从仓库历史重建任务把已合入的变更转化为当前代码上的已验证任务。
→
Change2Task五类任务上 79.6% 的已验证构建成功率,为训练和评测提供数据。
产品需要跨平台迁移百万行级代码库绑定在单一操作系统和语言上。
→
带验证的仓库级代码翻译先翻译仓库骨架,再在测试驱动的检查下补全代码。
→
骨架引导的仓库翻译辅助微软 10 多个产品将百万行级代码仓库从 Windows 迁移到 Linux。
超大规模云上的故障成千上万个服务、嘈杂的信号、代价高昂的宕机。
→
基于诊断信息的大模型推理把根因分析、分诊和缓解建模为学习问题。
→
RCACopilot 与 AIOps集成进支撑 Azure 与 Microsoft 365 的云服务。

应用场景

方法在这些场景中落地和检验。

当前重点

编程智能体

问题修复、测试生成、代码翻译、依赖升级和仓库理解,覆盖开源代码与工业代码。

SWE-bench-LiveTestExploraExeCoderUpdate from Hell
Computer Use

GUI 智能体

桌面 AgentOS 与跨设备智能体系统,以及一篇被广泛引用的 LLM GUI 智能体综述。

UFOUFO²UFO³GUI 智能体综述
云运维

AIOps

面向超大规模云的故障检测、分诊、根因分析、日志与监控,已在微软落地。

RCACopilotXpertUniLogUniParser
02 — 影响力

前沿实验室在用的研究成果

环境、基准、框架和系统走出了实验室:用于前沿模型的训练与评测,拥有庞大的开源社区,并运行在超大规模生产环境中。

Agentic RL 训练 · GLM-5

RepoLaunch 为 GLM-5 构建可执行环境

“We employ an environment setup pipeline based on the RepoLaunch framework that scales the construction of executable environments from real-world SWE issues.”

— GLM-5 技术报告,智谱 AI / Z.ai(arXiv 2602.15763)

RepoLaunch 是第一个能在任意语言、任意操作系统上自动解析依赖、编译代码并提取测试结果的智能体,支持 C/C++、C#、Python、Java、JS/TS、Go 和 Rust,覆盖 Linux 与 Windows。它为大规模智能体训练构建了 10,000 多个 Docker 环境。

评测 · Qwen3-Coder

SWE-bench-Live 进入 Qwen3-Coder 的主要评测

Qwen3-Coder 发布时的评测表,其中包含 SWE-bench Live 一行

Qwen3-Coder 发布时,将 SWE-bench-Live 成绩与 Kimi-K2、DeepSeek-V3、Claude Sonnet 4、GPT-4.1 并列报告。

Agentic RL 框架

Agent Lightning

“Our original Agent Lightning introduced a disaggregated architecture that connects arbitrary agents to RL training through an LLM endpoint proxy, an approach later adopted by frameworks such as verl Uni-Agent, AReaL 2.0, slime, and Polar.”

— Agent Lightning v1.0(arXiv 2608.17528)。大意:最初的 Agent Lightning 提出了通过 LLM 端点代理把任意智能体接入 RL 训练的解耦架构,这一方法后来被 verl Uni-Agent、AReaL 2.0、slime、Polar 等框架采用。

生产落地 · 微软

研究成果落地到产品

与 10 多个微软产品团队(Azure、Microsoft 365、Windows、DevDiv、Copilot)合作落地 20 多项成果:覆盖故障全生命周期的 AIOps,以及为 Azure 和 Microsoft 365 每年节约数亿美元成本的资源管理算法。获专利 10 余项。

RCACopilotXpertUniLogUniParserMonitorAssistant
03 — 项目

代表性项目

按落地采用、引用量或顶会发表精选。主导 表示由我主导的项目。

SWE-bench-Live 流水线:问题抓取、RepoLaunch 环境构建、任务验证
主导NeurIPS 2025 · D&BGLM-5 · Qwen3-Coder 采用

SWE-bench-Live & RepoLaunch

由自动化流水线构建、持续更新的问题修复基准。RepoLaunch 是一个能在 Linux 或 Windows 上为任意语言的仓库完成配置、构建和测试的智能体,无需人工参与就能把真实问题转化为已验证、可复现的 Docker 任务。基准已扩展出 MultiLang(1,077 个任务 · 8 种语言)和 Windows 子集,流水线达到 ≥98% 的构建/测试成功率,LLM 成本降低 82%。

2026LLM4Code @ ICSE 2026

Change2Task 与企业级基准

让产品代码仓库成为可再生的智能体任务来源。Change2Task 把已合入的变更转化为健康新版本上的已验证任务(缺陷修复、功能新增、测试生成、API 迁移、安全修复),已验证构建成功率达 79.6%,比基于 PR 的基线多恢复 29.2% 的任务。另一条相关工作面向企业级智能体持续生成评测基准。

2026★ 18.4k

Agent Lightning v1.0

一个面向 Harnessed Agentic RL 的轻量框架:由部署时的智能体 harness 掌控交互循环,并直接参与后训练。它处理重分词、样本合并、优势计算和损失归一化等问题,并提供完整的编程智能体 RL 流水线:Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 提升到 56.4%。在微软,我推动了它在内部集群上的大规模分布式落地,将 Rollout 与 Training 解耦。

DoVer 干预驱动的调试流程
ICLR 2026

DoVer

LLM 多智能体系统的自动调试,是迈向“能自我修复的智能体”的一步。DoVer 先切分执行轨迹、提出失败假设,再在编排层施加干预,最后通过重放验证修复是否有效。

LLM GUI 智能体的演进
NAACL 2025ICML 2025TMLR 2025★ 9.8k引用 550+

UFO 系列:桌面 AgentOS

UFO 是面向 Windows 的开创性 UI 智能体。UFO² 将其发展为多智能体桌面 AgentOS(HostAgent + AppAgents,GUI 与 API 混合操作),UFO³ 进一步把多台设备上的智能体连接起来。相关工作包括 LLM GUI 智能体综述(引用 230+)和关于 API 智能体与 GUI 智能体分化与融合的研究(ICML 2025)。

TaskWeaver 架构
★ 6.2k引用 120+

TaskWeaver

代码优先的智能体框架:把用户请求转化为可执行代码,由 Planner 与 Code Interpreter 在有状态的数据结构上协作,并通过领域插件支持数据分析。

RCACopilot 流程
EuroSys 2024引用 370+

RCACopilot

最早用于云故障根因分析的 LLM 系统之一:针对不同故障的处理器收集诊断信息,再由 LLM 预测并解释根因。在微软一整年的真实故障上完成评估。

UniLog 上下文学习日志生成
ICSE 2024 ×2WWW 2022

面向云可观测性的大模型

UniLog 通过上下文学习决定在哪里记录日志、记录什么;UniParser 解析异构日志;Xpert 为新故障生成 KQL 诊断查询。

04 — 论文

代表性论文

按顶会发表、引用量或落地采用精选。查看完整论文列表或 Google Scholar。

05 — 经历

工作与教育经历

  1. 2026 —

    高级技术专家

    华为 · 软件工程应用技术实验室

    智能体进化与 RSI、大模型训练与 Agentic RL,以及面向编程智能体的产品级环境与数据。

  2. 2018 — 2026

    首席研究员(Principal Research Manager)

    微软 DKI 研究组(数据、知识与智能,原属微软亚洲研究院)

    主导 SWE-bench-Live 与 RepoLaunch;参与 Agent Lightning、UFO、TaskWeaver,以及与 10 多个产品团队(Azure、Microsoft 365、Windows、DevDiv、Copilot)合作落地的一系列 AIOps 与资源管理系统。

  3. 2020 —

    行业硕士生导师

    复旦大学 · 计算机科学技术学院

  4. 2016 — 2018

    博士后

    复旦大学 · 计算机科学技术学院

    合作导师:王新 教授

  5. 2016 —

    荣誉研究员

    香港中文大学

  6. 2012 — 2013

    研究实习生

    微软亚洲研究院 · 软件分析组

    获微软亚洲研究院“明日之星”奖。

  7. 2012

    交换生

    杜克大学 · 计算机科学与工程

    合作导师:Kishor S. Trivedi 教授

  8. 2010 — 2016

    博士,计算机科学与工程

    香港中文大学

    导师:吕荣聪(Michael R. Lyu)教授

    移动应用性能诊断(DiagDroid,FSE’16)、云服务部署与软件安全。

  9. 2006 — 2010

    本科,计算机科学与技术

    复旦大学

    成绩排名前 5%,连续三年获一等奖学金。

06 — 学术服务与荣誉

学术服务

  • ICSE 2027
    Proceedings Co-Chair(组委会);Research Track 程序委员会委员
  • FSE 2025
    Industry Papers 程序委员会委员
  • 2021 – 2025
    Cloud Intelligence / AIOps Workshop:Proceedings Chair(2021、2023、2025);程序委员会委员(2024)
  • ICSE 2022
    SMeW 学生指导研讨会 导师(Mentor)
  • FSE 2021
    Architectures & Design — Cloud Computing 分会场主席

荣誉与项目

  • 2022
    ACM SIGSOFT 杰出论文奖,ESEC/FSE 2022(SPINE)
  • 2021
    最佳论文奖,ISSRE 2021(故障缓解时间预测)
  • 2016, 2017
    全国软件与应用学术会议(NASAC)软件研究成果原型比赛三等奖(中国计算机学会软件工程专委会);2016 年获奖成果为 DiagDroid
  • 2017
    下一代互联网技术创新大赛三等奖(中国教育和科研计算机网网络中心)
  • 2013
    微软亚洲研究院“明日之星”奖
  • 项目
    主持国家自然科学基金青年项目、中国博士后科学基金
  • 专利
    获专利 10 余项
07 — 加入我们

团队正在招聘

华为 · 软件工程应用技术实验室

一起打造能自我进化的智能体

我们的研究团队正在扩充。如果你希望研究智能体进化、Agentic RL,以及能应对真实产品全部复杂性的编程智能体,欢迎联系我。

  • 全职研究员与工程师Agentic RL 与大模型训练、智能体进化、编程智能体的环境与评测。
  • 研究实习生面向博士和硕士研究生,实习成果既可以发表在顶会,也可以落地到真实产品中。
  • 科研合作欢迎高校与业界实验室围绕自进化智能体和智能体训练开展联合研究。