DINOv2
Meta AI가 공개한 자기지도 시각 표현 학습 모델입니다. 라벨 없이 대규모 큐레이션 이미지 코퍼스로 학습해, 파인튜닝 없이 얼린 특징만으로도 분류·분할·깊이 추정 같은 다운스트림 과제에서 쓸 만한 성능을 냅니다.
실무에서 자주 쓰이는 방식이 이 얼린 특징을 그대로 두고 가벼운 프로젝션이나 헤드만 학습시키는 것입니다. 자기지도 표현이 온전히 보존되고, 인코더의 활성값과 옵티마이저 상태가 학습 메모리 예산에서 빠지며, 처음 보는 입력 도메인을 붙일 때 프로젝션만 다시 학습하면 됩니다.
로보틱스 쪽에서도 이 성질을 활용합니다. N0-VTLA - Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens는 촉각 차분 이미지를 얼린 DINOv2로 인코딩해 촉각 토큰을 만듭니다. 촉각 전용 인코더를 새로 학습시키지 않고 시각 인코더를 재사용하는 선택입니다.