리윈헝
리윈헝(Yunheng Li)은 난카이대학 컴퓨터과학원 톈진시 시각컴퓨팅·지능인지 중점실험실(VCIP)과 미디어컴퓨팅랩(MCLab) 소속 박사과정 연구자입니다. 청밍밍과 허우치빈이 공동 지도합니다. 학부와 석사 7년을 다롄이공대학에서 마치고 난카이로 옮겼습니다.
연구 관심은 시간 축 모델링(temporal modeling), 개방어휘 이해(open-vocabulary understanding), 멀티모달 학습입니다. MaskCLIP++처럼 마스크 기반으로 CLIP을 파인튜닝해 개방어휘 분할을 다루는 작업, DenseVLM처럼 개방어휘 밀집 예측의 영역-언어 정렬 편향을 다루는 작업이 이 계열입니다. 산출물은 대부분 HVision-NKU 조직 아래 공개합니다.
Annotations as Rollouts의 직전 작업인 Tempsamp-R1이 같은 저자의 것입니다. Tempsamp-R1은 시간 그라운딩에서 정답을 그룹에 섞을 때 생기는 학습 붕괴를 태스크별로 손수 설계한 보상 변환으로 눌렀는데, 그 변환이 왜 필요한지는 설명하지 못했습니다. OraRL은 그 미완의 지점을 advantage inversion이라는 이름으로 규정하고 보상 의미에 의존하지 않는 갱신 규칙으로 바꾼 후속작입니다. 개방어휘 밀집 예측에서 쌓은 "정답이 촘촘히 붙어 있는 데이터를 어떻게 쓸 것인가"라는 문제의식이 강화학습 쪽으로 옮겨간 셈입니다.