황하이랑

🏷️ 인물 강화학습 LLM 추론

개요

황하이랑(Hailang Huang)은 알리바바 AMAP-ML 소속 연구자입니다. 모델 추론 능력을 강화학습으로 끌어올리는 쪽에 집중해 왔고, 최근에는 그 관심이 에이전트 하네스 설계로 이어졌습니다.

업적

GPG(Group Policy Gradient)는 모델 추론을 위한 단순하면서 강한 강화학습 베이스라인을 목표로 한 연구로, 추샹샹 등과 함께 작업해 ICLR 2026에 채택되었습니다.

AdaCuRL은 무효 샘플을 걸러내고 과거 샘플을 다시 방문하는 적응형 커리큘럼 강화학습입니다. LLM과 멀티모달 LLM 양쪽에서 여러 추론 벤치마크의 성능을 끌어올렸습니다.

ACL 2026 Findings에 채택된 Thinking with Map(지도 증강 병렬 에이전트를 이용한 지리 위치 추론)에도 참여했습니다.

LongHorizon-Harness(2026)에서는 공동 1저자입니다.