예더헝

🏷️ 인물 강화학습

개요

Deheng Ye(예더헝, 叶德珩)는 텐센트(Tencent) AI Applications 디렉터로, 대규모 머신러닝 플랫폼과 지능형 AI 에이전트 개발 팀을 이끕니다. MOBA 게임 AI JueWu(絕悟) 프로젝트를 주도하며 게임 AI 분야에서 이름을 알렸으며, 이후 대규모 LLM과 AI 에이전트 전반으로 연구 영역을 확장했습니다.

50편 이상의 논문을 발표했으며, AI 에이전트, 심층강화학습, 대규모 머신러닝, LLM과 이들의 상용화·산업화를 연구 관심사로 삼습니다.

생애

난양공과대학교(NTU, Nanyang Technological University) 컴퓨터과학과에서 2016년 박사 학위를 받았습니다. 박사 졸업 후 마이크로소프트 리서치 아시아(MSRA)의 Data Knowledge Intelligence 그룹 연구원으로 근무하며 대규모 데이터 분석과 ML 연구 경험을 쌓았습니다.

이후 텐센트에 합류해 AI 게임 에이전트 프로젝트를 이끌었습니다. JueWu 프로젝트를 통해 MOBA 장르의 리그 오브 레전드 계열 게임인 왕자영요(Honor of Kings)에서 인간 수준의 플레이를 달성한 AI를 개발했습니다. 이 성과는 AAAI와 IEEE TNNLS 등 주요 학술지에 발표되었습니다.

현재는 선전(Shenzhen) 텐센트 본사에서 AI Applications 디렉터를 맡으며, LLM과 AI 에이전트의 산업화 적용을 이끌고 있습니다. AIware 2025 컨퍼런스에 프로그램 위원으로 참여하는 등 학술 커뮤니티 활동도 이어가고 있습니다.

업적

대표 성과는 JueWu 시리즈입니다. JueWu-SL은 지도학습 기반으로 MOBA 게임에서 인간 수준 성능을 달성한 첫 AI로, 매크로 전략과 마이크로 조작을 신경망으로 end-to-end 통합했습니다("Supervised Learning Achieves Human-Level Performance in MOBA Games: A Case Study of Honor of Kings"). JueWu-RL은 심층강화학습으로 훈련된 버전이며, 복잡한 제어 문제를 심층강화학습으로 해결하는 방법론("Mastering Complex Control in MOBA Games with Deep Reinforcement Learning")을 AAAI에 발표했습니다.

JueWu-MC는 마인크래프트(Minecraft)를 대상으로 한 후속 작업입니다. 표본 효율적인 계층적 강화학습 방법론을 적용해, 지각과 탐색이 어려운 3D 오픈월드 환경에서 에이전트를 훈련시키는 접근법을 제시했습니다(IJCAI 2022).

이후 연구에서는 vision-language 모델과 멀티모달 에이전트 방향으로 확장했습니다. 텐센트 AI Lab에서 발표한 취약점 자동 수정 연구 "Vul-R2: A Reasoning LLM for Automated Vulnerability Repair"에도 공동 저자로 참여했습니다. Diffusion 모델을 대상으로 한 "Aligning Few-Step Diffusion Models with Dense Reward Difference Learning"(2025) 등 강화학습을 생성 모델에 응용하는 연구도 진행했습니다.

Audio Interaction Model 논문에는 공동 교신저자로 참여했습니다. always-on 모델이 매 청크마다 응답할지 침묵할지를 스스로 결정하는 구조는, 에이전트가 환경을 관찰하며 행동 타이밍을 결정하는 강화학습적 의사결정 문제와 닮아 있어, 그의 에이전트·대규모 학습 경험이 맞닿는 지점입니다.

여담

게임 AI를 연구 발판으로 삼아 산업 AI 전반으로 영향력을 확장한 경력이 특징적입니다. MOBA 게임은 복수의 에이전트가 실시간으로 협력·경쟁하며 불완전 정보 아래 장기 계획을 세워야 하는 문제로, 강화학습 연구자들에게 체스나 바둑과는 다른 종류의 어려움을 제공합니다. 이 환경에서 쌓은 멀티에이전트 협력·경쟁 설계 경험이 이후 LLM 에이전트 연구와 자연스럽게 이어졌습니다.

NTU 라인의 셰즈페이, 공동 교신저자 먀오춘옌과 함께 작업했습니다.

주요 논문