마진밍

🏷️ 인물 강화학습

개요

마진밍(Jinming Ma)은 중국과학기술대학(USTC) 컴퓨터과학기술학원에서 강화학습과 멀티에이전트 시스템을 연구했고, 2026년 HiFi-UMI - Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone에 공동 1저자로 참여했습니다.

연구 이력

USTC 시절 주제는 오프라인 강화학습과 대규모 멀티에이전트 조율이었습니다. 부정확한 시뮬레이터를 써서 오프라인 강화학습을 개선하는 연구, 도시 규모 교통 신호 제어를 명시적 멀티에이전트 조율로 푸는 연구 등이 대표적입니다. 시뮬레이터와 실제 환경 사이의 격차를 어떻게 다룰 것인가라는 문제의식이 이어져 있고, HiFi-UMI에서 모든 재구성 궤적을 시뮬레이션 리플레이로 검증하는 파이프라인 설계와도 결이 맞습니다.

관련 문서