린 다후아
개요
린 다후아(Dahua Lin, 林达华)는 홍콩중문대학교(CUHK) 정보공학과 부교수이자 CUHK-SenseTime Joint Laboratory 디렉터, 상하이 AI 연구소(Shanghai AI Laboratory) 핵심 연구자입니다. 컴퓨터비전, 머신러닝, 확률적 추론을 주축으로 120편 이상의 논문을 CVPR, ICCV, ECCV, NeurIPS, ICML에 발표했으며, 피인용 연구자 수가 9만 7천 명을 넘는 중국 컴퓨터비전 연구의 핵심 인물입니다.
학문적 기여와 산업적 임팩트를 동시에 이어 온 인물로, CUHK MMLab을 통해 객체 탐지, 행동 인식, 영상 이해의 기반 도구를 오픈소스로 공급하는 한편, SenseTime 공동 창업으로 AI 산업에 직접 뛰어들었습니다. 2025~2026년 현재는 SenseNova-U1 프로젝트의 단독 스폰서 겸 어드바이저로서 통합 멀티모달 모델 라인 전체를 총괄하는 위치에 있습니다.
OpenMMLab 프로젝트의 주도자이기도 합니다. MMDetection, MMAction2, MMPose, MMSeg 등 모듈식 컴퓨터비전 툴박스 패밀리가 바로 그의 연구실에서 출발했으며, 현재 GitHub에서 수만 개의 스타를 유지하는 업계 표준 라이브러리로 자리잡고 있습니다.
생애
린 다후아는 2004년 중국과학기술대학교(USTC) 전기공학 및 정보과학과를 졸업한 뒤, 2006년 CUHK 정보공학과 석사를 마쳤습니다. 이후 MIT 컴퓨터과학 및 전기공학부(EECS)로 옮겨 2012년 박사 학위를 취득했으며, 박사 재학 중인 2010년 NeurIPS에서 베이즈 비모수 모델 신구성 연구로 최우수 학생 논문상을 수상했습니다.
박사 졸업 직후 2012년부터 2014년까지 도요타 공과대학 시카고(Toyota Technological Institute at Chicago)에서 연구 조교수로 재직했습니다. 2014년 8월 CUHK 정보공학과 조교수로 부임했고, 2020년 8월 부교수로 승진했습니다. 같은 해인 2014년 11월에는 CUHK 동료 Tang Xiaoou, Wang Xiaogang과 함께 SenseTime을 공동 창업하고 수석 과학자(Chief Scientist for AI Infrastructure and Large Models) 및 집행 부사장직을 맡았습니다.
2021년 4월에는 CUHK 학제간 인공지능 연구소(IAIRI) 디렉터를 겸임하기 시작했으며, 같은 해 11월 상하이 AI 연구소 수석 과학자로 이중 임명되었습니다. 2026년에는 홍콩 중국은행(BOCHK) 과학기술 혁신상 4기를 수상하며 멀티모달 AI 분야의 공헌을 공식적으로 인정받았습니다.
CUHK-SenseTime 조인트 랩은 산학연 협력의 성공 사례로 꼽히며, 이 구조 덕분에 그의 연구실이 대규모 실제 데이터와 연산 자원에 접근할 수 있었습니다. 그의 지도 아래 Haodong Duan, Bolei Zhou, Kaiming He 등 다수의 저명한 연구자가 배출되었고, CUHK MMLab 동문 네트워크는 상하이 AI 연구소, NTU, 구글, 메타 등으로 퍼져 중화권 AI 연구 생태계에서 가장 넓은 동문 네트워크 중 하나로 꼽힙니다.
업적
린 다후아의 연구는 컴퓨터비전 전 영역에 걸쳐 있습니다. 초기에는 베이즈 비모수 모델, 확률적 추론 기법을 이미지와 텍스트 이해에 적용하는 연구에 집중했습니다. 이 흐름은 이후 딥러닝 기반 특징 학습, 비지도 표현 학습으로 자연스럽게 이어졌습니다. 비모수 인스턴스 판별을 통한 비지도 특징 학습(Unsupervised Feature Learning via Non-parametric Instance Discrimination) 연구는 셀프-슈퍼바이즈드 러닝의 방향을 정리하는 데 기여한 논문입니다.
객체 탐지 분야에서는 MMDetection 툴박스를 통해 Faster R-CNN, Cascade R-CNN, RetinaNet 등 주요 탐지기를 단일 코드베이스로 통합하고, 연구자 누구나 공정한 조건에서 비교 실험을 할 수 있도록 했습니다. 이 플랫폼은 컴퓨터비전 커뮤니티에서 사실상 표준 검출 벤치마크 환경으로 정착했습니다. CARAFE(Content-Aware ReAssembly of FEatures) 논문은 특징 업샘플링 방식을 재설계해 탐지와 분할 모두에서 성능을 끌어올렸습니다.
행동 인식 분야에서는 Temporal Segment Networks(TSN)로 희소 시간 샘플링과 비디오 수준 지도 학습을 결합해 긴 영상에서도 효율적으로 행동을 인식하는 방법을 제시했습니다. 2021년부터는 대규모 언어 모델 및 멀티모달 모델 영역으로 연구 범위를 확장해, InternLM과 InternVL 시리즈를 상하이 AI 연구소, CUHK 팀과 함께 개발하고 있습니다. 2025년 공개된 InternLM3는 8B 파라미터 모델임에도 학습 데이터 효율을 75% 이상 절감하면서 동급 오픈소스 모델을 앞서는 성능을 달성했습니다.
여담
린 다후아는 SenseTime 창업을 주도한 인물 중 하나임에도, 창업자 중 가장 낮은 대중 노출도를 유지해 왔습니다. 그의 역할은 기술 인프라와 학술 연구 품질을 담보하는 쪽에 집중되어 있으며, 경영과 홍보 전면보다 연구 현장을 선호하는 스타일로 알려져 있습니다.
OpenMMLab이라는 이름 자체도 그가 CUHK MMLab에서 쌓아온 오픈소스 철학의 연장선입니다. 단일 논문에 그치지 않고 커뮤니티가 쉽게 재사용할 수 있는 도구 생태계를 만드는 것을 연구 문화로 정착시켰으며, 이는 중국 AI 연구가 단순 발표 중심에서 인프라 중심으로 전환하는 데 일조했다는 평가를 받습니다.
SenseNova-U1 스폰서, 어드바이저 단독 1인 기재는 조직 내 그의 위상을 잘 보여 줍니다. SenseTime의 NEO-unify 라인이 Apache 2.0 기반 통합 멀티모달 모델로 재편되는 과정에서 학술-산업 간 가교 역할을 맡았으며, 핵심 연구자 상당수가 그의 연구실 출신이거나 직접 협업 관계에 있습니다. 2026년 BOCHK 수상은 이 활동 전반에 대한 홍콩 학술, 산업계의 공식적인 평가로 읽힙니다.
주요 논문
- Temporal Segment Networks: Towards Good Practices for Deep Action Recognition (ECCV 2016)
- Unsupervised Feature Learning via Non-parametric Instance Discrimination (CVPR 2018)
- MMDetection: Open MMLab Detection Toolbox and Benchmark (arXiv 2019)
- CARAFE: Content-Aware ReAssembly of FEatures (ICCV 2019)
- CARAFE++: Unified Content-Aware ReAssembly of FEatures (T-PAMI 2020)
- InternLM: A Multilingual Language Model with Progressively Enhanced Capabilities (2023)
- InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks (CVPR 2024)
- InternLM-XComposer: A Vision-Language Large Model for Advanced Text-Image Comprehension and Composition
- InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model (ACL Findings 2025)
- MMBench: Is Your Multi-modal Model an All-around Player? (공동 지도)
- VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models (공동 지도)
- SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition
- Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models (2025)
- InternLM3: Achieving High-Performance Models with 4T Data (2025)
- Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games