펑샤오쿤

🏷️ 인물 컴퓨터비전 영상처리 교수

개요

펑샤오쿤(Feng Xiaokun)은 중국과학원 자동화연구소(CASIA) 박사과정 연구자로, 황카이치(Kaiqi Huang) 교수 그룹 소속입니다. 비전-언어 단일 객체 추적(vision-language single object tracking)을 본 전공으로 삼고 있으며, 박사과정 인턴 기간에 알리바바 AMAP CV 라인과 협업하면서 train-free 비디오 생성 강화 연구로 영역을 확장하였습니다.

NeurIPS 2024의 MemVLT, ICCV 2025 Highlight 논문 ATCTrack이 추적 분야 대표 논문이며, CVPRW DTLLM-VLT로 Best Paper Honorable Mention을 받은 이력도 있습니다. 비디오 생성 쪽에서는 MIGA를 1저자로 주도하였고, 장편 비디오 내러티브 평가 벤치마크 NarrLV(arXiv:2507.11245)도 1저자로 발표하였습니다.

2022년 박사과정에 입학하여 2026년 현재도 재학 중이며, 추적과 생성이라는 두 트랙을 병렬로 소화하는 다작형 신진 연구자입니다. 개인 홈페이지(xiaokunfeng.github.io)와 GitHub에서 주요 논문의 코드를 직접 배포하고 있습니다.

생애

중국과학원대학교(UCAS, University of Chinese Academy of Sciences) 인공지능학부 박사과정에 2022년 입학하였습니다. 지도교수는 황카이치(Kaiqi Huang) 교수로, IAPR 펠로우이자 CASIA 복잡계 인지결정지능 핵심 실험실 소속 연구자입니다. 황카이치 그룹은 GOT-10k, VideoCube 등 추적 분야 표준 벤치마크를 다수 제안한 팀으로, 펑샤오쿤은 그 연구 전통을 이어받아 추적 알고리즘과 벤치마크를 함께 다루는 방식으로 훈련받았습니다.

박사과정 도중 알리바바(Alibaba) AMAP-ML 팀에 인턴으로 합류하였습니다. AMAP은 알리바바의 지도 및 위치 서비스 부문으로, 컴퓨터 비전과 생성 AI를 실세계 서비스에 접목하는 연구를 산하에서 활발히 수행하고 있습니다. 이 인턴십에서 train-free 비디오 생성 관련 논문을 여러 편 공저하며 생성 모델 연구 경험을 축적하였습니다. ICLR 2026에 게재된 S2-Guidance와 AAAI 2026에 게재된 ImagerySearch가 이 인턴십 기간의 성과입니다. VMBench라는 비디오 모션 생성 인지 정렬 벤치마크 연구도 ICCV 2025에 발표하며 생성 모델 평가 방향으로도 기여를 넓혔습니다.

업적

추적 분야 첫 대표 논문은 NeurIPS 2024에 게재된 MemVLT(Vision-Language Tracking with Adaptive Memory-based Prompts)입니다. 비전-언어 추적 모델에 적응형 메모리 기반 프롬프트를 도입하여, 추적 과정에서 쌓이는 시각언어 맥락을 동적으로 관리할 수 있도록 하였습니다. 비전-언어 통합 추적 분야에서 메모리 구조의 중요성을 명시적으로 다룬 초기 연구 중 하나입니다.

2025년 CVPRW에서는 DTLLM-VLT(Diverse Text Generation for Visual Language Tracking Based on LLM)로 Best Paper Honorable Mention을 받았습니다. LLM을 이용해 추적 대상을 설명하는 다양한 텍스트를 생성하고, 이를 통해 비전-언어 추적 모델의 견고성을 높이는 접근입니다. ICCV 2025 Highlight로 선정된 ATCTrack(Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking)은 추적 대상의 동적 상태와 대상-맥락 단서를 정렬하는 메커니즘을 제안하여, 배경 잡음이나 유사 대상이 있는 어려운 시나리오에서의 추적 성능을 개선하였습니다. ICML 2025에서도 CSTrack(Enhancing RGB-X Tracking via Compact Spatiotemporal Features)을 발표하였습니다.

비디오 생성 방향에서는 MIGA(Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos)를 1저자로 수행하였습니다. 추적 도메인에서 익힌 프레임 간 일관성 평가 감각을 생성 모델에 적용하여, cosine similarity 기반 self-reflection 메커니즘으로 생성 이상을 탐지하는 구조를 설계하였습니다. 장편 비디오 생성 평가 벤치마크 NarrLV(arXiv:2507.11245)도 1저자로 제안하였으며, 영화 내러티브 이론에서 영감을 받아 생성 모델의 서사 표현 능력을 체계적으로 측정합니다.

여담

펑샤오쿤의 연구 궤적에서 가장 눈에 띄는 점은 추적(tracking)과 생성(generation)이라는 언뜻 무관해 보이는 두 영역을 넘나든다는 것입니다. 두 영역 모두 프레임 간 시간적 일관성을 다룬다는 공통점이 있으며, 추적 기술에서 쌓인 직관이 생성 모델의 시간 일관성 문제 해결에 실질적으로 이어졌음을 MIGA 논문의 self-reflection 메커니즘에서 확인할 수 있습니다.

박사과정 중에 산업계 인턴십과 다수의 주저자 논문을 병행하는 방식도 눈에 띕니다. CASIA 지도교수 그룹의 연구와 알리바바 AMAP 인턴십 라인을 독립적으로 유지하면서, 두 쪽 모두에서 1저자 또는 핵심 공저자로 성과를 내고 있습니다. 2024-2026년 사이 주저자 논문만 5편 이상으로, 박사 연차 대비 상당히 활발한 생산성을 보여줍니다.

주요 논문