둥인펑
개요
둥인펑(董胤蓬, Yinpeng Dong)은 칭화대학교 AI 칼리지 조교수로, 딥러닝 모델의 적대적 견고성(adversarial robustness)과 신뢰 가능한 AI(trustworthy AI) 연구를 전문으로 합니다. 적대적 공격과 방어, 분포적 적대 학습(adversarial distributional training), 멀티모달 대형 모델의 안전성 평가 등을 아우르는 폭넓은 연구를 이어오고 있습니다.
그가 2018년 CVPR Spotlight로 발표한 Momentum Iterative Method(MI-FGSM)는 이후 3,600회 이상 인용되며 적대적 공격 알고리즘의 기준 지표로 자리 잡았고, Google, OpenAI, IBM이 개발한 적대적 공격·방어 플랫폼에 벤치마크 알고리즘으로 등재되었습니다. OpenAI는 GPT-o1 모델의 견고성 평가에 그의 연구를 활용했습니다.
생애
둥인펑은 칭화대학교에서 학사와 박사 학위를 모두 마쳤습니다. 박사 과정 중 적대적 공격과 방어 알고리즘 연구로 여러 상을 받았고, 2022년 CCF(중국컴퓨터학회) 우수박사학위논문상을 수상했습니다. 마이크로소프트 리서치 아시아(MSRA) 펠로십과 바이두 펠로십도 재학 중 받았습니다.
박사 졸업 후에는 칭화대 THBI Lab과 BNRist에서 박사후 연구원으로 일했으며, 2023년에는 칭화 우수 포닥에 선정되었습니다. 2025년 2월부터는 칭화대 AI 칼리지 조교수로 정식 임용되어 신뢰 가능 AI 연구 그룹(T-STAR Lab)을 이끌고 있습니다. 2024년에는 Asian Trustworthy ML 펠로십을 받았습니다.
학술 서비스 면에서는 ICLR 2025, ICML 2025, NeurIPS 2025의 Area Chair를 맡았고, AAAI 2026, ICLR 2026에서도 같은 역할을 수행합니다. ICCV 2025에서는 SaFeMM-AI(안전하고 신뢰 가능한 멀티모달 AI) 워크숍을, CVPR 2025에서는 테스트 시간 스케일링(test-time scaling) 워크숍을 조직했습니다.
업적
둥인펑의 첫 번째 주요 기여는 적대적 공격 분야에서의 Momentum Iterative Method(MI-FGSM)입니다. 기존 반복 공격법(I-FGSM)이 이전 그래디언트 방향만 사용하는 데 비해, 모멘텀을 축적해 블랙박스 모델에 대한 전이 가능성(transferability)을 크게 높였습니다. 이 방법은 현재 적대적 공격 연구의 기준 알고리즘으로 광범위하게 사용됩니다.
신뢰 가능 멀티모달 AI 평가 분야에서는 두 편의 NeurIPS 2024 논문이 주목을 받았습니다. MultiTrust는 멀티모달 대형 모델의 신뢰성을 종합적으로 평가하는 최초의 벤치마크이며, T2VSafetyBench는 텍스트-비디오(text-to-video) 생성 모델의 안전성을 평가하는 첫 번째 벤치마크입니다.
분포적 적대 학습(Adversarial Distributional Training) 연구도 그의 주요 업적입니다. 기존 적대적 학습(adversarial training)이 샘플 단위로 최악의 경우를 최적화하는 방식이라면, 분포적 접근은 가중치 분포 수준에서 견고성을 향상시키는 관점을 취합니다. 이 연구는 TPAMI, IJCV, CVPR, NeurIPS 등 저명 학술지와 학회에 다수 발표되었습니다.
여담
둥인펑은 "모델이 어디서 무너지는가"를 집요하게 파고드는 견고성 연구자입니다. 이 시선은 최신 멀티모달 모델이 공간 추론에서 실패하는 패턴을 드러내는 평가 연구와 자연스럽게 연결됩니다. 방어를 연구하기 위해 먼저 공격을 깊이 이해해야 한다는 접근법은 보안 연구 전반에서도 보편적인 방법론이지만, 딥러닝 견고성 분야에서 이를 일관되게 실천해온 연구자 중 한 명입니다.
그의 그룹 T-STAR Lab 홈페이지(collegeai.tsinghua.edu.cn)에서 최신 논문과 연구 방향을 확인할 수 있으며, 개인 학술 페이지는 dongyp13.github.io에서 관리됩니다.
주요 논문
- Boosting Adversarial Attacks with Momentum (Dong 외, CVPR 2018 Spotlight) - MI-FGSM, 전이 가능 적대적 공격의 기준 알고리즘
- Evading Defenses to Transferable Adversarial Examples by Translation-Invariant Attacks (Dong 외, CVPR 2019) - 이동 불변 공격법
- MultiTrust: A Comprehensive Benchmark towards Trustworthy Multimodal Large Language Models (NeurIPS 2024) - 멀티모달 LLM 신뢰성 종합 평가 벤치마크
- T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models (NeurIPS 2024) - 텍스트-비디오 모델 안전성 평가
- Adversarial Distributional Training for Robust Deep Learning (Dong 외, NeurIPS 2020) - 분포적 적대 학습
- Towards Robust Detection of Adversarial Examples (Dong 외, NeurIPS 2018) - 적대적 예제 탐지
- Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training (2025) - 적대적 학습 트레이드오프 완화 메타러닝
- SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks (교신저자) - 공간 추론 평가 벤치마크