VideoChat3 - Fully Open Video MLLM for Efficient and Generalist Video Understanding
X. Li, Y. Zhu, X. Zeng, Y. Dong, H. Wu, Z. Zhang, et al., "VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding," arXiv:2607.14935, 2026.
오픈소스 비디오 이해 모델의 반복된 약점은 세 가지였습니다. 짧은 영상에 최적화된 모델은 긴 영상에서 무너지고, 긴 영상 모델은 실시간 스트리밍을 못 하고, 학습 데이터와 코드는 절반쯤 잠겨 있어 재현이 어렵습니다. Limin Wang 교수 팀이 이끄는 난징대-상하이 AI 연구소-NTU 공동 프로젝트 VideoChat3는 이 세 문제를 하나의 4B 모델로 묶고, 모델 가중치부터 학습 코드·데이터 구축 파이프라인까지 전부 공개했습니다.
저자
제1저자 여섯 명(공동 1저자)은 Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang입니다. Xinhao Li는 왕리민 교수 지도 석사과정생으로, VideoChat-Flash(ICLR 2026)를 이미 냈고 바이트댄스 Seed 인턴십에서 Kimi K2.5의 비전 인코더 아키텍처를 설계한 이력이 있습니다. Haoning Wu는 NTU S-Lab 출신으로 현재 Moonshot AI 재직 중이며 비디오 품질 평가와 MLLM 환각 연구로 이름이 알려져 있습니다. 교신저자 왕리민은 TSN·VideoMAE·InternVideo2 시리즈를 통해 비디오 이해 분야의 핵심 인물로 자리 잡은 교수입니다. VideoChat 시리즈(2023 → VideoChat2 → VideoChat-Flash ICLR 2026 → VideoChat3 2026)는 이 팀이 3년째 진행 중인 장기 과제입니다.
배경
Video MLLM은 이미지 MLLM의 프레임 샘플링 방식을 물려받았습니다. 영상을 \(N\)장 프레임으로 드문드문 나눠 각각 독립적으로 토큰화한 뒤 LLM에 넘기는 구조입니다. 이 방식에는 두 가지 구조적 결함이 있습니다. 첫째, 인접 프레임 사이의 시간적 중복을 전혀 활용하지 못해 토큰 수가 영상 길이에 비례해 폭발합니다. 2048프레임을 처리하면 Qwen3-VL 기준 20만 개가 넘는 시각 토큰이 LLM 컨텍스트를 잠식합니다. 둘째, 실시간 스트리밍을 위해서는 영상이 끝나기 전에 응답 시점을 스스로 판단해야 하는데, 오프라인 가정으로 훈련된 모델은 이 능력이 없습니다.
VideoChat-Flash(VideoChat3의 전작, ICLR 2026)는 긴 영상을 계층적으로 압축해 일부 문제를 해결했지만 스트리밍 지원이 없었습니다. VideoChat3는 ViT 수준에서 시공간을 함께 압축하는 설계로 두 문제를 동시에 공략합니다.
어떻게 만들었나
I3D-ViT: 토크나이저 안에서 압축
핵심 발상은 "압축을 LLM 직전이 아니라 ViT 안에서 한다"입니다. 사전학습된 이미지 ViT의 2D 공간 셀프 어텐션을 3D 시공간 셀프 어텐션으로 팽창(inflate)시켜 I3D-ViT를 만듭니다. 구체적으로는 세 가지 설계가 합쳐집니다.
청크 단위 프레임 묶음. 연속 \(T\)개 프레임을 하나의 로컬 시공간 단위로 묶습니다. 같은 청크 안에서만 시공간 어텐션을 계산하므로 계산량이 \(O(T^2)\)이 아닌 \(O(T)\) 수준으로 묶입니다.
청크 단위 시간 풀링. 청크 내 어텐션 후 시간 축으로 \(T\)배 풀링합니다. 공간 축의 픽셀 셔플(Pixel Shuffle) \(2 \times 2\) 다운샘플링과 합쳐지면
\[\text{압축 비율} = 4T\]
이 됩니다. 기본값 \(T = 4\) 적용 시 \(16\times\) 시공간 압축이 이루어집니다. 2048 프레임 기준으로 Qwen3-VL의 200,704개 토큰이 VideoChat3에서 100,352개로 줄어듭니다.
가변 길이 네이티브 해상도 지원. I3D-ViT는 임의 종횡비·해상도의 입력을 받습니다. 짧은 영상은 고해상도·고프레임으로, 긴 스트림은 저해상도로 처리해 LLM 컨텍스트 예산 안에서 최대한 많은 시각 증거를 담습니다.
Adaptive Frame Resolution: 스트리밍 주의 조절
스트리밍 영상은 "언제 응답할지"도 모델이 결정해야 합니다. VideoChat3는 각 스트리밍 스텝에서 LLM이 세 가지 상태 토큰 중 하나를 예측하도록 설계합니다.
- *
</Silence>*: 현재 윈도우에 관련 증거 없음. 응답 억제, 낮은 해상도로 계속 모니터링. - *
</Standby>*: 잠재적 증거 발견. 아직 충분하지 않으나 다음 윈도우를 고해상도로 전환. - *
</Response>*: 충분한 증거 확보. 자연어 응답 생성 후 Silence로 복귀.
다음 윈도우의 픽셀 예산은 이전 상태 토큰으로 결정됩니다.
\[b_{t+1} = \begin{cases} B_\text{low} & \text{if } s_t \in \{\text{Silence, Response}\} \\ B_\text{high} & \text{if } s_t = \text{Standby} \end{cases}\]
여기서 \(B_\text{low} = 224^2\) 픽셀, \(B_\text{high} = 448^2\) 픽셀입니다. 결과적으로 전체 스트림의 70% 가까운 윈도우를 저해상도로 처리하면서, 중요한 순간에만 집중합니다(실험에서 동적 예산의 평균 소비 비율은 30.2%).
데이터 파이프라인
세 가지 목적 데이터셋을 직접 구축했습니다.
VideoChat3-Academic2M (2.27M 인스턴스). LLaVA-Video, Spoken-MIT, Vript 등 기존 학술 데이터셋을 재주석합니다. 원본의 단답형 레이블을 Qwen3-VL-235B-A22B로 시간 증거를 명시한 풍부한 응답으로 다시 씁니다(평균 33.5배 단어 확장). 동일한 모델을 판정자로 삼아 의미 일관성을 검증하고 지지되지 않는 추가 내용을 걸러냅니다.
VideoChat3-LV116K (116.2K 인스턴스). 엔터테인먼트·교육·스포츠·과학 등 다양한 장르의 장시간 영상을 PySceneDetect로 경계를 나눈 뒤 세그먼트별로 주석을 달고, 이를 조합해 긴 시간 범위의 QA·시간선·시간적 그라운딩 데이터를 합성합니다. 세그먼트 평균 길이 156s~1.3K초로, 기존 학술 데이터(평균 3~59초)와 시간 스케일이 크게 다릅니다.
VideoChat3-OL617K (617.2K 인스턴스). 기존 오프라인 비디오 QA를 스트리밍 시퀀스로 변환합니다. 시각 단서가 등장하는 시점을 VLM으로 로컬라이징한 뒤 검증하고, </Silence>, </Standby>, </Response> 타겟 토큰과 답변 텍스트를 인터리브한 학습 시퀀스를 생성합니다.
4단계 학습
단계 |
목적 |
학습 샘플 |
컨텍스트 길이 |
|---|---|---|---|
Stage 0 |
시각 토크나이저 사전학습 |
7.59M |
8,192 |
Stage 1 |
비디오-언어 정렬 |
3.47M |
16,384 |
Stage 2 |
일반 비디오 instruction tuning |
10.33M |
32,768 |
Stage 3 |
장시간·스트리밍 instruction tuning |
3.41M |
98,304 |
Stage 3에서 스트리밍 학습의 특이점은 상태 전이 마스킹입니다. 연속된 </Silence> 토큰이 압도적으로 많아 모델이 보수적 정책을 학습하는 문제를 막기 위해, 상태가 바뀌는 전환 위치(transitions)에는 무조건 손실을 적용하고, 상태가 유지되는 위치(continuations)에서는 전환 개수만큼만 무작위 샘플링해 균형을 맞춥니다.
\[\mathcal{L}_\text{state} = -\frac{1}{\sum_t m_t} \sum_t m_t \log p_\theta(s_t \mid V_{\leq t}, y_{<t})\]
이로써 효과적인 상태 토큰 비율이 </Silence> : </Standby> : </Response> = 2 : 2 : 1로 균형잡힙니다.
결과
일반·장시간 비디오 이해
모델 |
MotionBench |
TempCompass |
Video-MME |
MMVU |
Charades mIoU |
ActivityNet mIoU |
QVHighlights mIoU |
VUE-TR V2 mIoU |
|---|---|---|---|---|---|---|---|---|
VideoChat3-4B |
61.7 |
75.6 |
70.1 |
56.4 |
54.6 |
67.0 |
47.9 |
40.2 |
Qwen3-VL-4B |
58.6 |
69.3 |
70.8 |
50.5 |
46.4 |
58.7 |
32.9 |
19.6 |
Molmo2-4B |
61.6 |
72.8 |
69.6 |
51.2 |
39.8 |
58.7 |
46.0 |
32.7 |
PLM-8B |
61.4 |
72.7 |
58.3 |
43.2 |
7.6 |
4.2 |
5.9 |
3.0 |
4B 모델로 8B급 완전 공개 모델을 대부분 벤치마크에서 넘습니다. Qwen3-VL-4B 대비 19개 직접 비교 지표 중 18개에서 우위이며, 시간적 그라운딩(TimeLens 3개 분할 합산: +24.4p)과 VUE-TR(+15.0/+20.6p)에서 특히 두드러집니다. 상용 모델과 비교하면 GPT-5, Gemini 2.5 Flash를 TimeLens 3개 분할에서 모두 앞섭니다.
스트리밍 비디오 이해
모델 |
ODVBench |
StreamingBench |
River Avg. |
OVO-Timing F1 |
|---|---|---|---|---|
VideoChat3-4B |
72.3 |
83.0 |
42.8 |
35.5 |
Qwen3-VL-4B |
57.4 |
80.2 |
37.8 |
8.1 |
StreamForest-7B |
59.9 |
77.3 |
N/A |
N/A |
Em-Garde (7B+2B) |
47.7 |
76.7 |
33.4 |
31.0 |
ODVBench에서 StreamForest(7B)를 12.4p 앞서고, 2B 보조 모듈을 붙인 Em-Garde보다 OVO-Timing F1이 4.5p 높습니다. Qwen3-VL-4B 대비 OVO-Timing F1이 8.1 → 35.5로 27.4p 점프한 것이 핵심입니다. 스트리밍 능력이 사실상 처음 발현된 것으로 볼 수 있습니다.
추론 효율
입력 프레임 |
Qwen3-VL 시각 토큰 |
VideoChat3 시각 토큰 |
Qwen3-VL 지연 (s) |
VideoChat3 지연 (s) |
|---|---|---|---|---|
256 |
25,088 |
12,544 |
1.363 |
1.652 |
512 |
50,176 |
25,088 |
3.838 |
3.596 |
1,024 |
100,352 |
50,176 |
12.251 |
8.099 |
2,048 |
200,704 |
100,352 |
44.449 |
20.412 |
ViT 인코더 지연은 더 크지만 LLM 지연이 대폭 줄어, 512프레임 이상부터 전체 지연이 역전됩니다. 2048프레임에서는 총 지연이 44.4s → 20.4s로 절반 이하입니다. LLM 컨텍스트 비용이 시퀀스 길이의 제곱에 비례하므로 토큰을 절반으로 줄이면 LLM 단계가 \(\frac{1}{4}\)에 가까워지는 구조입니다.
회고
저자들이 솔직하게 인정한 한계는 세 가지입니다.
첫째, I3D-ViT의 청크 단위 어텐션 설계는 청크 경계를 넘나드는 장거리 시간 의존성을 ViT 레벨에서 포착하지 못합니다. 긴 비디오의 의미론적 연결은 여전히 LLM 컨텍스트에 의존해야 합니다.
둘째, ProactiveVQA 벤치마크에서는 전문 스트리밍 모델인 MMDuet-2(3B)에 뒤집니다. 범용 모델과 전문 모델 사이의 간극은 아직 존재합니다.
셋째, 스트리밍 OL617K 데이터는 기존 오프라인 QA에서 변환한 것이어서 순수 실시간 시나리오(예: 실시간 방송 중 갑작스러운 이벤트 탐지)에서의 일반화 여부는 별도 검증이 필요합니다. Ablation에서 VideoChat3-OL617K를 넣었을 때 offline QA 지표가 안정적으로 유지된 것은 긍정적이지만, 분포 외 실시간 데이터에서의 성능은 논문 밖 문제입니다.
정리
- I3D-ViT의 \(16\times\) 시공간 압축이 2048프레임 영상에서 지연을 절반으로 줄이고, 긴 영상 성능을 함께 높입니다.
- Silence/Standby/Response 상태 토큰과 동적 픽셀 예산 제어가 스트리밍 영상에서 "언제 응답할지"를 처음으로 실용적인 수준으로 구현합니다.
- 모델 가중치·학습 코드·데이터셋·구축 파이프라인 전체 공개로 재현 가능한 비디오 MLLM 기준선을 제시합니다.