왕멍디

🏷️ 인물 강화학습 LLM 에이전트 교수

개요

왕멍디(Mengdi Wang, 王梦迪)는 프린스턴 대학교(Princeton University) 전기컴퓨터공학과 및 통계기계학습센터(CSML) 정교수입니다. 데이터 기반 확률적 최적화(stochastic optimization)와 강화학습 이론을 기반으로, 최근에는 LLM 추론과 에이전트 시스템에서의 강화학습 적용 연구로 초점을 확장하고 있습니다.

MIT Technology Review "35세 이하 35인"(2018) 선정을 비롯해 Mathematical Optimization Society 청년 연구자상(2016), NSF Career Award(2017), Google Faculty Award(2017), AACC Donald Eckman Award(2024) 등 다수의 수상 이력을 가진 프린스턴의 대표 AI 연구자 중 한 명입니다. 2025년 7월 1일부로 정교수로 승진이 확정되었습니다.

2026년에는 에이전트가 서빙을 중단하지 않고 실시간 대화 피드백만으로 스스로 개선되는 OpenClaw-RL을 발표하며, 이론 연구와 실제 배포 환경 사이의 간극을 메우는 방향으로 연구를 심화하고 있습니다.

생애

왕멍디는 중국에서 태어나 칭화대학교(Tsinghua University) 자동화학부에서 학부 과정을 마쳤습니다. 18세에 미국으로 건너가 MIT(Massachusetts Institute of Technology) 전기컴퓨터공학과 대학원에 입학했으며, 확률적 최적화 분야의 선구자인 Dimitri Bertsekas 교수의 지도 아래 연구했습니다.

2013년 박사학위를 취득한 뒤 2014년 프린스턴 대학교에 조교수로 합류했습니다. Bertsekas 교수의 지도 아래 확률적 최적화 이론을 깊이 연마한 경험은 이후 강화학습 이론 연구의 수학적 토대가 되었습니다.

프린스턴 재직 기간 동안 연구 범위를 순수 최적화 이론에서 강화학습, 생성형 AI, LLM 에이전트 학습으로 지속적으로 확장해 왔습니다. 이 과정에서 의료, 스포츠, 에너지 등 다양한 실제 응용 분야에 강화학습을 적용하는 협력 연구도 다수 진행했으며, 2025년 7월 정교수로 승진하며 커리어 궤적을 한 단계 더 올렸습니다.

업적

왕멍디의 초기 대표 업적은 합성 최적화(compositional stochastic optimization)에 대한 이론적 기여입니다. 두 함수가 중첩된 형태의 목적함수를 확률적 경사 하강법으로 효율적으로 최적화하는 알고리즘을 최초로 제안했으며, 이는 강화학습과 메타학습 등 다양한 머신러닝 문제에 직접 활용되었습니다.

강화학습 이론 측면에서는 마르코프 결정 과정(MDP)에서의 표본 효율성, 수렴 보장, 오프-폴리시 학습의 이론적 분석에 기여했습니다. "Demystifying Reinforcement Learning in Agentic Reasoning"(2025)은 에이전트 추론에서 RL이 어떻게 작동하는지 원리를 체계적으로 분석한 저작으로, LLM-에이전트 연구 커뮤니티에서 이론적 기준 문서로 활용됩니다.

2026년 발표한 OpenClaw-RL은 비동기 강화학습 파이프라인을 통해 배포된 에이전트가 실시간 사용자 피드백만으로 스스로 개선되는 시스템입니다. 수동 레이블링 없이 개인화와 범용 에이전트 학습을 하나의 프레임워크에서 처리할 수 있음을 보여, 이론과 실제 배포의 간극을 줄이는 작업으로 주목받았습니다.

여담

왕멍디는 18세에 MIT 대학원에 입학한 것으로도 화제가 되었습니다. 이례적으로 이른 대학원 진학은 이후의 빠른 커리어 궤적과 맥락을 같이합니다.

그의 연구 스타일은 이론에 탄탄히 뿌리를 두면서도 실용적인 응용을 놓치지 않는 균형감이 특징입니다. 확률적 최적화 이론에서 시작해 RL 수렴 분석, LLM 에이전트, 실제 배포 시스템으로 이어지는 연구 흐름은 "수학적으로 엄밀하면서도 현실 문제를 다룬다"는 원칙이 일관되게 관철된 결과입니다.

NeurIPS 2024에서 발표된 조직화된 팀 구조 학습 연구는 멀티 에이전트 협력에 RL을 접목하는 방향을 탐색한 것으로, 이후 OpenClaw-RL 같은 실제 다중 에이전트 배포 시스템 연구로 자연스럽게 이어졌습니다.

주요 논문