슝웨이민

🏷️ 인물 NLP 에이전트

개요

슝웨이민(Weimin Xiong)은 베이징대학교(PKU) EECS 학과 리수젠 그룹 소속 박사과정 연구자입니다. NLP 전반에서 출발해 최근에는 GUI 에이전트 사전학습 데이터 합성과 비디오로부터의 인터랙션 트래젝토리 추출에 연구 초점을 맞추고 있습니다. 박사과정 중 샤오미(Xiaomi) LLM-Core 팀 인턴십을 수행하며 대형 GUI 에이전트 사전학습 데이터셋 구축 프로젝트를 이끌었습니다.

멀티모달 에이전트 연구에서 데이터 측 병목을 해소하는 방향을 일관되게 추구합니다. 특히 인터넷에 공개된 대규모 비레이블 비디오로부터 구조화된 상호작용 데이터를 자동으로 추출하는 파이프라인 설계가 핵심 기여입니다. PKU 리수젠 그룹과 Xiaomi 연구 조직을 연결하는 학생 측 허브 역할을 맡았습니다.

2026년 현재 Google Scholar 누적 인용은 두 자리 수준으로 아직 초기 단계이지만, 박사 1저자로 구축한 데이터셋 규모(약 4.16M 비디오 / 300K 시간 / 12.7M 트래젝토리)는 분야 평균을 크게 웃돕니다.

생애

슝웨이민은 베이징대학교 전자공학 및 컴퓨터과학(EECS) 학부 과정을 마치고 동 대학 리수젠 지도 아래 박사과정에 진학했습니다. 석사를 거치지 않고 박사 직행 트랙을 밟았으며, 박사 초기에는 자연어처리 일반 과제를 다루다가 멀티모달 에이전트 연구로 연구 방향을 전환했습니다.

박사과정 중 샤오미 LLM-Core 팀에서 연구 인턴십을 수행했습니다. 이 기간에 Video2GUI 프로젝트를 제안하고 설계 전반을 주도했습니다. 인턴십 기간에 산업 인프라와 대규모 비디오 크롤 파이프라인에 접근해 학계 단독으로는 구축하기 어려운 스케일의 데이터셋을 완성했습니다.

2026년 현재 PKU 박사과정에 재학 중이며, Video2GUI 논문이 ICML 2026(서울 코엑스, 2026년 7월)에 채택되어 처음으로 주요 ML 학회에서 1저자 발표를 앞두고 있습니다.

업적

슝웨이민의 핵심 업적은 Video2GUI 논문 및 그 산출물인 WildGUI 데이터셋입니다. 이 연구는 5억 개 비디오 메타데이터를 거칠게 필터링한 뒤 품질 기반 정제를 반복하는 coarse-to-fine 파이프라인으로 약 4.16M 개 GUI 튜토리얼 비디오를 선별하고, 최종적으로 1,500개 이상의 앱·웹사이트에 걸친 1,270만 개의 구조화된 상호작용 트래젝토리를 추출했습니다.

WildGUI로 Qwen2.5-VL 및 Mimo-VL을 사전학습한 결과, 복수의 GUI 그라운딩 및 액션 벤치마크에서 5~20%의 일관된 성능 향상이 확인되었습니다. 별도 파인튜닝 없이도 최신 특화 모델과 동등하거나 그 이상의 성능을 보인다는 점에서 비레이블 비디오 기반 사전학습의 가능성을 실증했습니다. 이 논문은 ICML 2026에 채택되었습니다.

또한 공저자로서 다수의 NLP 및 GUI 에이전트 관련 논문에 참여해 왔습니다. 리수젠 그룹의 대형 언어 모델 데이터 구축 라인에서 지속적으로 기여하고 있으며, 트래젝토리 합성 외에도 자동 레이블링 방법론 연구를 병행하고 있습니다.

여담

슝웨이민의 Video2GUI 프로젝트는 처음에는 Xiaomi 인턴십의 실험적 사이드 프로젝트로 시작되었습니다. 당시 GUI 에이전트 분야에서는 인간이 직접 수집한 소규모 데이터셋이 주류였고, 비레이블 비디오를 활용한 대규모 자동 합성은 시도 자체가 드물었습니다. 파이프라인 초기 버전은 노이즈가 많아 폐기를 고려했다는 후문이 있으나, coarse-to-fine 필터링 체계를 도입하면서 품질 문제가 해결됐습니다.

데이터셋 규모가 방대하다 보니 저자 본인이 직접 모든 샘플을 검수하는 것은 불가능해, 자동 품질 평가 메트릭을 별도로 설계하는 작업이 논문 준비 과정에서 상당한 시간을 차지했다고 합니다.

리수젠 지도교수는 PKU 자연어처리 연구 그룹의 핵심 인사이며, 이 그룹에서 배출된 학생들이 최근 멀티모달 에이전트 분야에서 두각을 나타내고 있습니다.

주요 논문