디아오 하이웬
개요
Haiwen Diao(刁海文)는 픽셀과 단어를 별도의 vision encoder 없이 하나의 트랜스포머 안에서 직접 처리하는 encoder-free vision-language 모델 연구 노선을 이끌어온 연구자입니다. 다롄공과대학교(Dalian University of Technology) 박사과정을 거쳐 현재 난양공과대학교(Nanyang Technological University) S-Lab과 SenseTime Research에서 원격 협력 형태로 연구를 이어가고 있습니다. 이메일은 haiwen.diao@ntu.edu.sg입니다.
EVE(NeurIPS 2024)와 EVEv2(ICCV 2025)로 encoder-free VLM의 가능성을 체계적으로 입증했고, NEO 아키텍처(arXiv:2510.14979)를 거쳐 SenseNova-U1 Project Lead로서 산업적 구현까지 완성한 이력이 있습니다. BAAI, 칭화대, Peking University, NTU, SenseTime 등 여러 기관과의 다자 협력을 통해 연구를 진행해왔습니다.
연구의 핵심 질문은 "vision encoder가 정말 필요한가"입니다. 기존 모듈형 VLM이 당연하게 여기던 ViT 같은 외부 시각 인코더를 걷어내고, 디코더 하나로 언어와 시각 정보를 동시에 학습할 수 있다는 것을 여러 단계에 걸쳐 실증해왔습니다.
생애
다롄공과대학교에서 컴퓨터 비전 관련 박사과정을 밟으며 리우즈웨이, 린 다후아와 협력 연구를 시작했습니다. 이 시기부터 SenseTime Research와 원격 협력 관계를 형성했고, BAAI(Beijing Academy of Artificial Intelligence)와도 공동 연구를 진행했습니다.
EVE 시리즈의 첫 번째 논문(arXiv:2406.11832, 2024)을 BAAI, 다롄공대, Peking University 공동 연구로 발표하며 encoder-free VLM 분야에서 이름을 알렸습니다. 이 작업이 NeurIPS 2024에 수록되며 본격적인 인지도를 얻었고, 곧이어 ICCV 2025를 목표로 한 EVEv2 연구로 이어졌습니다.
NEO 시리즈(2025)와 SenseNova-U1(2026)은 SenseTime과의 협력 성과로, 박사 연구 라인이 산업 모델로 구현된 사례입니다. SenseTime은 NEO 아키텍처가 자사 차세대 멀티모달 모델의 토대가 된다고 공식 발표했습니다.
업적
EVE(NeurIPS 2024)는 ViT 같은 외부 vision encoder 없이 디코더 단독으로 vision-language 학습이 가능하다는 것을 실증한 첫 번째 대규모 연구입니다. 최소한의 패치 임베딩 레이어와 임의 화면 비율 지원을 통해 모듈형 VLM에 근접하는 성능을 보였고, encoder-free 구조의 실용 가능성을 열었습니다.
EVEv2(arXiv:2502.06788, ICCV 2025)는 EVE의 한계를 체계적으로 보완한 개선판입니다. OpenImages, SAM, LAION, Datacomp 기반 9,200만 건 데이터로 사전학습하고 Infinity-MM, LLaVA-onevision 기반 730만 건으로 파인튜닝한 EVEv2-7B-HD-v2.0은 데이터 효율과 시각 추론 능력 양쪽에서 기존 모듈형 VLM과의 격차를 더 좁혔습니다.
NEO(arXiv:2510.14979)에서는 픽셀과 단어를 처음부터 같은 스트림에서 학습하는 "native pixel-word primitive"를 제안했습니다. 별도 모듈 경계를 완전히 제거함으로써 크로스프레임·픽셀-단어 대응 관계가 모델 내부에서 자연스럽게 창발하도록 설계했습니다. NEO-unify(2026년 3월 HuggingFace 블로그 공개)는 이 NEO 위에 unified understanding-generation 레이어를 얹은 아키텍처이며, SenseNova-U1 - Unifying Multimodal Understanding and Generation with NEO-unify Architecture의 골격이 됩니다.
SenseNova-U1에서는 Project Lead로 이름을 올렸습니다. dense 8B(SenseNova-U1-8B-MoT)와 30B-A3B MoE(SenseNova-U1-A3B-MoT) 두 변종을 Apache 2.0으로 공개했으며, VAE와 visual encoder를 모두 제거한 first-principle 설계를 커뮤니티에 그대로 넘겼습니다.
여담
encoder-free VLM은 주류가 아닌 소수 노선이었습니다. ViT 기반 모듈형 구조가 당연시되던 시기에 "vision encoder가 없어도 된다"는 주장은 비주류 포지셔닝이었고, EVE에서 EVEv2, NEO, SenseNova-U1로 이어지는 작업들은 그 주장을 단계적으로 입증하는 누적 증거가 됩니다.
SenseTime이 NEO 아키텍처를 차세대 모델의 핵심으로 채택하고 Apache 2.0으로 공개한 것은 이 노선이 산업적 검증을 받은 사건으로 볼 수 있습니다. 박사 연구 라인과 산업 모델 설계가 하나로 이어진 드문 사례입니다.
BAAI, 다롄공대, NTU, SenseTime, 칭화대 등 다수 기관과의 교차 협력은 단일 기관에 묶이지 않는 연구 스타일을 반영합니다. 여러 그룹의 컴퓨팅 자원과 데이터를 활용하는 방식이 encoder-free 연구를 규모 있게 진행하는 데 중요한 역할을 했을 것입니다.
주요 논문
- EVE: Unveiling Encoder-Free Vision-Language Models (NeurIPS 2024, arXiv:2406.11832)
- EVEv2: Improved Baselines for Encoder-Free Vision-Language Models (ICCV 2025, arXiv:2502.06788)
- NEO: Towards Native One-Vision Models from First Principles (arXiv:2510.14979, 2025)
- From Pixels to Words: Towards Native One-Vision Models at Scale (arXiv:2605.28820, 2026)
- SenseNova-U1 - Unifying Multimodal Understanding and Generation with NEO-unify Architecture (arXiv:2605.12500, 2026)