션즈치앙
개요
션즈치앙(Zhiqiang Shen)은 아랍에미리트 아부다비에 위치한 모하메드 빈 자예드 인공지능 대학교(MBZUAI) 머신러닝학과 조교수로, VILA Lab을 공동 운영하고 있습니다. 효율적인 딥러닝, 지식 증류, 데이터셋 증류 분야에서 1만 2천 회 이상의 피인용 실적을 보유한 연구자로, CVPR, ECCV, ICLR, NeurIPS, ICML 등 주요 학회에 고르게 발표 이력이 있습니다.
연구 범위는 이진 신경망 최적화, 파라미터 효율 파인튜닝, 확산 모델, 비전-언어 모델 평가로 폭넓게 이어집니다. 2026년 기준 ICLR 2026 Emergency Area Chair, ICML 2026 Area Chair를 맡는 등 학회 운영에도 적극 참여하고 있습니다.
2026년에는 VILA Lab 학생들과 함께 Anthropic의 Claude Code 소스코드를 체계적으로 역분석한 에이전트 설계 보고서 "Dive into Claude Code"(arXiv:2604.14228)를 공개해 AI 커뮤니티에서 폭넓은 주목을 받았습니다. 같은 해 비디오-언어 모델의 시간 인식 한계를 측정하는 SpookyBench와 모바일 언어 이해 벤치마크 Mobile-MMLU도 발표했습니다.
생애
중국 푸단대학교와 미국 일리노이대학교 어바나-샴페인(UIUC) 공동 박사 과정을 통해 학위를 받았습니다. 딥러닝의 효율성과 일반화 문제를 중심 주제로 삼은 박사 연구를 마친 뒤, 카네기멜론대학교 CyLab에서 박사후 연구원으로 보안과 딥러닝의 접점을 탐구했습니다.
이후 홍콩과학기술대학교(HKUST) 조교수 겸 IAS Junior Fellow를 역임했으며, 2022년부터 MBZUAI에 정착해 독립적인 연구 그룹을 운영하기 시작했습니다. MBZUAI는 UAE 정부가 설립한 AI 전문 대학원으로, 아부다비를 AI 허브로 육성하려는 국가 전략의 일환입니다. 션즈치앙은 이 기관에서 이진 신경망, 지식 증류, 비전-언어 모델 등을 다루는 VILA Lab을 공동 운영하며 국제적인 연구 협력을 이어가고 있습니다.
X(트위터) 핸들 @szq0214로 연구 성과를 꾸준히 공유하며, VILA Lab GitHub 조직을 통해 코드와 데이터를 공개 관리합니다. 연구실 홈페이지(zhiqiangshen.com)를 통해 그룹 구성원과 진행 중인 프로젝트를 공개합니다.
업적
효율적인 딥러닝 분야에서 지식 증류의 이론적·실용적 기반을 다진 연구들이 핵심 기여입니다. ICLR 2021에 발표한 "Is Label Smoothing Truly Incompatible with Knowledge Distillation?"은 레이블 스무딩과 지식 증류가 충돌한다는 기존 통념을 정면으로 반박하며 두 기법의 관계를 재정립했습니다. ECCV 2022에서는 빠른 시각 인식 증류 프레임워크를 제안했고, ICLR 2026에서는 객체 탐지를 위한 최적화 불필요 데이터셋 증류 연구 OD3를 발표했습니다.
2026년 4월에는 VILA Lab 학생들과 함께 Anthropic의 Claude Code TypeScript 소스코드(v2.1.88)를 직접 역분석한 "Dive into Claude Code"(arXiv:2604.14228)를 공개했습니다. 에이전트 시스템의 5개 핵심 가치, 13개 설계 원칙, 7개 컴포넌트를 구조화한 이 분석 보고서에서 "코드베이스의 98.4%가 운영 인프라"라는 발견이 AI 커뮤니티에서 광범위하게 인용되었습니다. X와 HuggingFace Papers에서 빠르게 확산되었으며, 에이전트 시스템 설계 철학을 논의하는 맥락에서 자주 참조됩니다.
비전-언어 모델 평가 연구도 VILA Lab의 또 다른 축을 이루고 있습니다. SpookyBench를 통해 현재 모델들이 영상 내 순수 시간적 패턴을 제대로 포착하지 못한다는 한계를 체계적으로 측정했으며, Mobile-MMLU를 통해 모바일 환경에서 언어 이해 능력을 종합 평가하는 벤치마크도 2026년에 공개했습니다. 2026년 6월에는 확산 언어 모델을 다룬 종합 서베이에도 공저자로 참여하는 등 연구 범위를 지속 확장하고 있습니다.
여담
MBZUAI가 위치한 아부다비는 세계 최상위 AI 연구자들을 적극 유치하고 있어, 션즈치앙처럼 동아시아 배경을 가진 연구자가 중동 기반 기관에서 독립 연구실을 운영하는 사례가 늘어나고 있습니다. 국가가 주도하는 AI 대학원이라는 독특한 설립 배경 덕분에 MBZUAI는 비교적 짧은 역사에도 불구하고 세계 각지의 연구자들을 끌어들이고 있습니다.
Claude Code 역분석 논문은 원래 에이전트 아키텍처 탐구가 목적이었으나, 결과적으로 에이전트 시스템 설계를 공부하려는 연구자들 사이에서 입문 자료로 자리 잡았습니다. Anthropic의 공개 코드를 직접 분석했다는 점에서 독특한 위치를 차지하며, 프롬프트 설계보다 인프라 설계가 에이전트 시스템의 핵심이라는 통찰이 커뮤니티에서 적극 공유되었습니다.
2026년 기준 VILA Lab은 데이터셋 증류, 비전-언어 모델 평가, 에이전트 시스템 분석이라는 세 방향을 동시에 추구합니다. 소규모 그룹이 특정 틈새 분야에 집중하는 일반적인 패턴과 다소 다른 이 방식은 션즈치앙 개인의 폭넓은 관심사를 직접적으로 반영합니다.
주요 논문
- Is Label Smoothing Truly Incompatible with Knowledge Distillation? (ICLR 2021)
- A Fast Knowledge Distillation Framework for Visual Recognition (ECCV 2022)
- Revisiting the Accuracy vs. Robustness Paradox in Deep Learning (NeurIPS 2022)
- Efficient Diffusion Training via Min-SNR Weighting Strategy (ICCV 2023)
- Towards the Fundamental Limits of Knowledge Over-Parameterization (2023)
- Customizable Combination of Parameter-Efficient Modules for Multi-Task Learning (2023)
- DELT: A Simple Diversity-driven EarlyLate Training for Dataset Distillation (2024)
- OD3: Optimization-free Dataset Distillation for Object Detection (ICLR 2026)
- Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems (arXiv:2604.14228, 2026)
- Time Blindness: Why Video-Language Models Can't See What Humans Can? (arXiv 2026)