두안난
개요
두안난(段楠, Nan Duan)은 JD.COM 부사장(VP)이자 JD Future Academy 부원장 겸 Vision and Multimodal Lab 디렉터입니다. 마이크로소프트 리서치 아시아(MSRA) NLP 그룹에서 약 12년간 Senior Principal Researcher 겸 리서치 매니저로 재직하며 Unicoder, CodeBERT, CodeXGLUE 등 NLP 및 코드 인텔리전스 분야의 핵심 성과를 냈습니다. 이후 StepFun Technical Fellow를 거쳐 현재 JD.COM에서 언어, 음성, 비전, 체화 AI를 아우르는 파운데이션 모델 연구를 총괄하고 있습니다.
200편 이상의 상위 학회 논문, 누적 인용 3만 회 이상, h-index 80 이상, 특허 20건 이상을 보유한 중국 NLP, 멀티모달 연구계의 시니어 그룹에 속합니다. 중국과학기술대학교(USTC), 시안교통대학교, 톈진대학교 겸임 교수로 박사 지도도 병행합니다.
2025년에는 JD에서 JoyAI-Image-Edit, Step-Video-T2V 등 통합 이미지 이해 및 생성 모델 프로젝트를 주도하며 산업 파운데이션 모델 개발의 최전선에서 활동하고 있습니다. 멀티모달 기반 모델 연구와 산업 배포를 동시에 추구하는 방식이 그의 연구 전반을 관통합니다.
생애
두안난은 중국에서 태어났습니다. 박사 논문 제목은 "통계적 기계 번역에서 일관성 디코딩 방법의 응용 연구"로, 2011년 박사 학위를 취득했습니다. 박사 취득 후 곧바로 마이크로소프트 리서치 아시아(MSRA)에 합류했고, 2012년부터 NLP 그룹의 Senior Principal Researcher 겸 리서치 매니저로 재직했습니다. MSRA에서 약 12년을 보내며 다국어 사전학습 모델, 코드 인텔리전스, 멀티모달 파운데이션 모델 등 여러 연구 영역을 개척했습니다.
2024년 StepFun의 Technical Fellow로 이직해 대형 언어, 멀티모달 모델 연구를 이어갔고, 이후 JD.COM에 합류해 JD Future Academy 내 Vision and Multimodal Lab을 이끌게 되었습니다. 2019년 CCF-NLPCC Distinguished Young Scientist로 선정되었고, 2023년에는 딥테크 선정 중국 지능 컴퓨팅 혁신가 명단에 포함되었습니다. 2025년에는 Machine Learning Summit 2025 연사로 초청되어 파운데이션 모델 연구 방향을 발표하기도 했습니다.
업적
두안난의 초기 핵심 기여는 Bing에 실제 배포된 다국어, 멀티모달 사전학습 모델 시리즈입니다. EMNLP 2019에 발표된 Unicoder는 100개 이상의 언어를 지원하는 최초의 다국어 사전학습 모델로 Bing에 실제 적용되었습니다. AAAI 2020의 Unicoder-VL은 최초의 멀티모달 사전학습 모델로 Bing 주요 언어 서비스에 배포되었습니다. 연구에서 실제 서비스로 이어지는 경로를 직접 만든 드문 사례입니다.
코드 인텔리전스 분야에서는 EMNLP 2020의 CodeBERT와 NeurIPS 2021의 CodeXGLUE가 대표 성과입니다. CodeBERT는 자연어와 코드를 함께 사전학습한 모델로 OpenAI Codex 논문에서 인용되었으며, CodeXGLUE는 코드 이해, 생성 평가를 위한 통합 벤치마크로 커뮤니티 표준에 가까운 지위를 갖게 되었습니다.
JD 이직 후에는 비전, 음성, 체화 AI 방향으로 연구를 확장하고 있습니다. 2025년에는 Step-Video-T2V 기술 보고서에 시니어 저자로 참여했는데, 이 모델은 최대 204프레임을 생성할 수 있는 30B 파라미터 텍스트-투-비디오 모델로 공개 당시 최고 수준의 성능을 기록했습니다. 2026년에는 JoyAI-Image-Edit 기술 보고서를 발표하며 공간 지능을 통합한 이미지 이해, 생성 통합 모델 연구를 이어가고 있습니다. NeurIPS 2025에 게재된 Generative Pre-trained Autoregressive Diffusion Transformer 연구에도 참여하며 오토레그레시브 확산 모델이라는 새로운 방향도 탐색 중입니다.
여담
MSRA 시절 두안난의 그룹은 연구와 서비스 배포를 동시에 추구하는 방식으로 알려져 있었습니다. Unicoder와 Unicoder-VL이 실제 Bing 검색 서비스에 적용된 것은 산업 연구소 특유의 배포 중심 문화를 잘 보여 주는 사례입니다. 이 경험이 StepFun과 JD.COM에서 대형 모델 연구를 총괄하는 역할로 이어진 배경으로 읽힙니다.
JD Future Academy는 징둥닷컴(JD.COM) 산하 연구 기관으로, 산업 데이터와 인프라를 연구에 활용할 수 있는 환경이 특징입니다. USTC 학생 그룹과의 협업 구조에서 두안난이 산업 쪽 디렉터 역할을 맡는 패턴은 여러 논문에서 반복되며, 학계, 산업계 연결 고리 역할을 합니다. JD 내 직함이 VP로 상향된 점은 AI 연구를 경영 의사결정에 통합하려는 JD의 방향성과도 맞닿아 있습니다.
StepFun 시절 발표된 Step-Video-T2V가 JD 이직 후에도 중요한 기여로 남는 것은, 대형 모델 연구에서 기관 이동과 무관하게 프로젝트 연속성이 유지되는 중국 AI 생태계의 특성을 반영합니다. 텍스트, 이미지, 음성, 비디오를 단일 파이프라인으로 통합하려는 연구 방향은 향후 JD의 산업 배포 역량과 맞물려 더욱 구체화될 것으로 보입니다.
주요 논문
- Unicoder: A Universal Language Encoder by Pre-training with Multiple Cross-lingual Tasks (EMNLP 2019)
- Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training (AAAI 2020)
- CodeBERT: A Pre-Trained Model for Programming and Natural Languages (EMNLP 2020)
- CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation (NeurIPS 2021)
- Step-Video-T2V: The Practice, Challenges, and Future of Video Foundation Model (Technical Report, 2025)
- JoyAI-Image-Edit: A Unified Image Understanding and Generation Model with Spatial Intelligence (Technical Report, 2026)
- DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training (ASPLOS 2026)
- SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks (2025)
- OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation (2025)