왕융
개요
왕융(Yong Wang)은 알리바바 AMAP-ML에서 LLM 에이전트 계열 프로젝트의 리드를 맡고 있는 연구자입니다. 추샹샹이 이끄는 100명 규모 팀 안에서 에이전트 강화학습 라인을 실제로 굴리는 자리에 있습니다.
업적
Tree-GRPO(ICLR 2026)에 프로젝트 리드로 참여했습니다. 체인 롤아웃 대신 ReAct 단계를 노드로 삼는 트리 탐색 롤아웃을 도입한 연구입니다.
CoEvolve에서는 프로젝트 리드이자 교신저자입니다. 학습 분포가 변하는 상황에서 롤아웃의 실패 신호를 뽑아 에이전트와 데이터가 서로를 갱신하도록 고리를 닫는 접근입니다.
GPG와 AdaCuRL 등 황하이랑이 주도한 강화학습 연구에도 공저자로 이름을 올립니다.
LongHorizon-Harness(2026)에서는 공동 1저자이자 프로젝트 리드입니다. 알리바바 DreamX Team 소속으로 표기됩니다.