텍스트 한 줄에서 걸어 다닐 수 있는 3D 월드를 만들되, 한 모델이 전부 생성하지 않고 계획·지형·지역 세 단계 에이전트로 나눈 프레임워크입니다. 전역 일관성은 지형이 붙잡고, 디테일은 필요한 지역에서만 자랍니다.
태그: 컴퓨터비전
86개의 게시물
-
-
미래를 픽셀로 바로 예측하는 대신, 월드 상태 전이를 256개 이산 심볼로 압축한 physical language로 먼저 추론하고 그다음 영상으로 렌더링하는 월드 모델입니다. 인터넷 영상에서 자기지도로 이 표현을 학습하고, 외형과 분리돼 있어 사람 동작을 휴머노이드로 제로샷 전이하는 것까지 같은 인터페이스로 처리합니다.
-
TurboVLA - Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM 2026-07-31로봇 조작 정책의 중심에 대형 언어 모델을 두는 V→L→A 경로를 걷어내고, 시각과 언어를 따로 인코딩해 양방향 크로스어텐션으로만 섞는 V+L→A 설계를 제안한 논문입니다. 0.2B 파라미터로 LIBERO 평균 97.7%, RTX 4090 한 장에서 0.9GB VRAM, 31.2ms 지연을 기록했습니다.
-
Mage-Flow - An Efficient Native-Resolution Foundation Model for Image Generation and Editing 2026-07-25Microsoft가 공개한 4B 규모 이미지 생성·편집 스택입니다. 백본을 키우는 대신 토크나이저와 학습 시스템을 함께 설계해, A100 한 장에서 1024² 이미지를 0.59초에 만들면서 GenEval 최고점을 기록했습니다.
-
비디오 생성 모델의 사전학습 표현을 활용해 깊이·법선·분할·포즈 등 다양한 비전 과제를 단일 피드포워드 모델로 처리하는 GenCeption을 제안한다. WAN 2.1 기반으로 V-JEPA·VideoMAE를 큰 폭으로 앞서며, 7x~500x 적은 데이터로 전문 모델에 준하는 성능을 냈다.
-
PDF 페이지를 이미지 그대로 오토리그레시브 학습하면, 같은 코퍼스에서 텍스트만 학습한 것보다 과학 추론 성능이 일관되게 높아진다는 실증 연구.
-
의미 불변성에 치우친 시각 사전학습이 조밀한 공간 정보를 잃는 문제를 경계 중심 자기지도학습으로 다룹니다. LingBot-Vision은 경계 토큰을 의도적으로 가리고 의미와 기하를 함께 복원해 깊이 추정과 분할 성능을 높입니다.
-
DiT 활성화의 타임스텝·프롬프트별 드리프트 문제를 RPBH 회전으로 정규화된 분포로 고정하고, 단일 Lloyd-Max 코드북으로 캘리브레이션 없이 가중치와 활성화를 동시에 양자화합니다. GenEval W2A4에서 기존 방법들이 모두 붕괴할 때 유일하게 생성 가능한 품질을 유지합니다.
-
Multi-Resolution Flow Matching - Training-Free Diffusion Acceleration via Staged Sampling 2026-07-05재훈련 없이 FLUX·Qwen-Image 같은 플로우 매칭 확산 모델을 10× 가속하는 MrFlow를 제안합니다. 초반 스텝은 저해상도 잠재 공간에서 처리하고, 픽셀 공간 GAN 슈퍼해상도를 거쳐 단 1스텝 고해상도 정제로 마무리하는 단계별 파이프라인입니다.
-
로봇 조작 데이터가 비싸고 편향된 문제를 인간 1인칭 영상 1,478시간으로 보완한 VLA 사전학습 프레임워크. 공간·구조·시간 세 축의 표현 통합과 신뢰도 가중 보조 손실로 RoboCasa, RoboTwin 2.0 모두에서 최고 성능을 달성했습니다.
-
DragMesh-2 - Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects 2026-06-22관절형 오브젝트(서랍, 문)의 가동 부위를 손-핸들 접촉만으로 움직이는 접촉 주도 프레임워크 DragMesh-2. PICA는 물리 신호를 PPO에 주입해 감쇠 4배 조건에서 State-only PPO 대비 두 배 이상의 성공률을 달성합니다.
-
0.22B 파라미터로 11.9B짜리 FLUX.1-Fill-Dev와 맞먹는 이미지 인페인팅을 구현한 Moebius. 표현 병목을 깨기 위해 Local-λ Mix Interaction 블록과 잠재 공간 다중 입도 증류를 결합했습니다.
-
VLM 공간 추론 에이전트에서 어떤 도구를 쓰느냐보다 어떻게 도구를 호출하느냐가 더 중요하다. NVIDIA 연구팀이 persistent Python kernel을 활용한 SpatialClaw를 제안해 20개 벤치마크에서 기존 최고 에이전트 대비 평균 +11.2pp를 달성했습니다.
-
단일 시각 토크나이저 HYDRA-XTok으로 이미지·비디오 이해·생성·편집을 하나의 모델에 통합한 네이티브 멀티모달 프레임워크. 튜블릿 인과 어텐션과 계층적 패치파이, 잠재 공간 기반 STI 편집으로 다섯 가지 태스크를 단일 7B 모델에서 처리합니다.
-
ABot-Earth 0.5 - Generative 3D Earth Model 2026-06-16알리바바 AMAP CV Lab의 생성형 3D 지구 모델입니다. 위성 영상만으로 도시 규모 3DGS 장면을 10분/km² 속도로 생성하며, 3.2조 개의 Gaussian primitive로 전 세계를 커버하는 지구 규모 배포 시스템을 함께 제시합니다.
-
산야 피들러 2026-06-06NVIDIA AI 연구 부사장이자 토론토대 교수. NVIDIA 토론토의 Spatial Intelligence Lab을 이끌며 3D 비전과 월드 모델을 연구합니다.
-
얀 카우츠 2026-06-06NVIDIA Learning and Perception Research 부사장. 컴퓨터비전, 생성 모델, 효율적 딥러닝, 임바디드 AI를 폭넓게 연구합니다.
-
ALVINN 2026-04-101989년 개발된 자율 주행 신경망으로, 머신러닝 역사의 초기 사례 중 하나
-
비전 트랜스포머 2026-04-10이미지를 패치 단위로 분할하여 트랜스포머 인코더로 처리하는 이미지 인식 아키텍처
-
얀 르쿤과 바렐스트리에로의 최신 연구입니다! 자기 지도 학습(Self-Supervised Learning)에서 표현 붕괴(representation collapse)를 막기 위해 쓰던 여러 임시방편(stop-gradient, teacher-student network 등)들을 이론적으로 정당화하고 이를 단 50줄의 코드로 구현한 LeJEPA 논문입니다. 핵심은 '임베딩이 등방성 가우시안 분포를 따라야 한다'는 수학적 증명에 있습니다.
-
Detect Anything via Next Point Prediction 2025-10-22멀티모달 LLM으로 객체 탐지에 도전한 모델입니다. Qwen과 대규모 영상 데이터로 학습해 각종 탐지 벤치마크에서 높은 성능을 보입니다.
-
서울과학기술대학의 VFF-Net을 소개합니다. 딥러닝은 역전파라는 방식으로 학습하는 것이 기본입니다. 역전파 알고리즘을 제안한 제프리 힌턴은 딥러닝 대부로 불리며 모든 현대 AI의 기초를 마련한 인물입니다. 제프리 힌턴은 역전파가 아닌 새로운 학습 알고리즘을 2022년에 발표했습니다. 이것이 FFN인데요, 실제 학습에 적용하기에는 복잡한 네트워크에 잘 맞지 않고, 특히 CNN과 어울리지 않았습니다. 이 문제를 한국에서 해결합니다. 방대한 계산량이 필요한 역전파 대신 FFN의 성능을 끌어올려 실제로 사용할 수 있는 알고리즘으로 만든 것입니다.
-
실시간 객체 탐지의 시대를 연 YOLO(You Only Look Once) 논문을 요약합니다. 전체 이미지를 단일 신경망에 한 번만 통과시켜 객체의 경계 상자와 클래스를 동시에 예측하는 혁신적인 통합 아키텍처의 원리와 성능을 설명합니다.
-
군중 상황에서 정확한 다중 사람의 자세 인식을 위한 군중 자세 주석 데이터 세트 2025-04-05군중 상황에서의 객체 탐지와 포즈 추정의 어려움을 다룹니다. CrowdPose 데이터셋과 Crowd Index를 분석하고, 객체 수까지 고려한 새로운 데이터셋 'HuPoAnt'와 전용 라벨링 도구를 개발한 경험과 추후 연구 방향을 공유합니다.
-
JD Explore Academy 연구원. CVPR 2024 YOLO-World(Real-Time Open-Vocabulary Object Detection)의 공동·교신 저자로 알려진 비전 연구자. OmniNFT의 프로젝트 리더.
-
싱가포르국립대학교 연구자이자 텐센트 유투랩 소속. 통합 멀티모달 모델의 이미지 생성·편집이 주 분야
-
Joint-Embedding Predictive Architecture. 원 감각 신호를 재구성하는 대신 학습된 잠재 공간에서 예측하는 자기지도 학습 원리
-
알리바바 AMAP의 Senior Director로 멀티모달·생성·기반 모델 라인을 이끄는 시니어 연구자이며 FairNAS·Twins·CPVT 등 영향력 큰 논문의 1저자
-
토론토대 박사과정, Google DeepMind 연구 인턴. 4D 인간 인식·범용 비전 모델 전공.
-
KAIST 박사과정 연구원. NVIDIA와의 공동 연구를 통해 VLM 기반 공간 추론 에이전트 SpatialClaw를 제안한 제1저자.
-
홍콩중문대학교 Choh-Ming Li 석좌교수. 의료 AI와 VR, 수술 시뮬레이션을 30년간 이끌어온 컴퓨터 그래픽스·비전 연구자
-
알리바바 그룹 산하 지도 서비스 부문 AMAP(高德地图)의 컴퓨터비전 연구팀. 위성 영상 기반 3D 장면 생성과 대규모 지리공간 AI 연구를 수행합니다.
-
KAIST 컴퓨터비전 연구자. 밀집 대응 및 시각적 매칭 분야 전문가로 SpatialClaw 논문의 지도 교수급 공동 저자.
-
CASIA NLPR 소속 연구자. Drive-WM 등 자율주행 월드 모델 계열을 이끌었고 PhiZero 프로젝트 리더
-
Meta AI가 공개한 자기지도 시각 표현 학습 모델. 라벨 없이 학습한 특징을 다운스트림 과제에 얼린 채로 재사용할 수 있습니다
-
난징대학 소속 연구자로 HYDRA-X 통합 멀티모달 모델의 공동 제1저자이며 시각 토크나이저와 멀티모달 생성 연구에 기여
-
2012년 ImageNet을 압도하며 딥러닝 시대를 연 합성곱 신경망
-
난징대학 컴퓨터학과 교수로 비디오 이해·행동 인식 분야 권위자이며 HYDRA-X 통합 멀티모달 모델의 교신저자
-
세탁소 집 딸로 자라 ImageNet을 만든 컴퓨터 비전 학자. 2만 2천 개 범주에 걸쳐 이미지 1400만 장을 레이블링했다
-
중국과학원 자동화연구소(CASIA) 정교수이자 패턴인식국가중점실험실(NLPR) 시각 감시·추적 분야 시니어 PI
-
푸단대 컴퓨터과학대 부교수, Fudan Vision and Learning Lab 소속. 대규모 영상 이해·영상 생성·효율적 아키텍처 연구자
-
중국과학원 원사이자 CASIA 자동화연구소 전 소장. 홍채 인식을 비롯한 생체인식·컴퓨터비전 분야를 중국에서 개척한 연구자
-
2012년 AlexNet이 top-5 오류율을 전년도 26.2%에서 15.3%로 낮추며 딥러닝 시대를 연 이미지 인식 챌린지
-
알리바바 AMAP CV Lab 연구원으로 ABot-World-0의 Data 팀을 이끌며 에이전트 주도 데이터 수집 인프라를 담당
-
CUHK MMLab 교수. 컴퓨터비전·멀티모달 학습·Embodied AI 전공. ACE-Ego-0 교신저자.
-
BIGAI(베이징범용인공지능연구원) 연구원. Embodied AI·3D 장면 이해·VLA 모델 전공. ACE-Ego-0 프로젝트 리더.
-
NVIDIA Research Santa Clara 연구 과학자. 공간 전파 네트워크 및 4D 장면 생성 전문가.
-
홍콩이공대(PolyU) 영상 복원·생성 연구자, 전 Microsoft Bing 응용과학자. HiFi-UMI 공동저자
-
CASIA NLPR 소속 연구자. 희소 트랜스포머 기반 LiDAR 3D 검출과 자율주행 월드 모델을 연구
-
화중과기대(HUST) 연구자. TurboVLA 공동 1저자. 경량 Vision-Language-Action 모델 연구.
-
CASIA 지능지각계산연구센터 교수. 자율주행 월드 모델 Drive-WM 계열을 이끌며 생체모방 시각 계산을 연구
-
Tencent Hunyuan 3D 연구원. WorldClaw에서 지역 씬 생성을 주도하고 전역 지형 생성에도 참여했습니다.
-
CUHK 교수·SenseTime 공동창업자·Shanghai AI Lab 핵심 연구자. CUHK MMLab과 OpenMMLab을 이끄는 컴퓨터비전·멀티모달 AI 대가.
-
Stanford 생의학 데이터과학 조교수. Medical AI and Computer Vision Lab(MARVL) 수장. 딥러닝·컴퓨터비전의 생의학 응용.
-
중국과학원 자동화연구소(CASIA) 박사과정 연구자로 비전·언어 객체 추적과 train-free 비디오 생성 작업을 병행하는 1저자급 연구자
-
저장대-UIUC 연구소 조교수. 컴퓨터비전·멀티모달·체화 지능 연구. CVNext Lab 리더.
-
CUHK CSE Choh-Ming Li 석좌교수. 의료 AI, 컴퓨터 비전, VR/XR 전공. Orchestra-o1 교신저자.
-
화중과기대(HUST) 전자정보통신학원 교수. IEEE·IAPR Fellow. 장면 텍스트 인식과 OCR, 형상 분석, 대형 멀티모달 모델 연구.
-
홍콩대학교(HKU) 전기전자공학과 부교수. 3D 비전, 월드 모델, 멀티모달 공간 이해를 연구하며 효율적 학습·추론 방향을 함께 다룹니다.
-
워터셰드 분할과 segmentation tree 이론의 권위자, ESIEE Paris 정교수, 수리형태학 표준 교과서 공저자
-
화중과기대(HUST) 연구자. TurboVLA 공동 1저자. 경량 Vision-Language-Action 모델 연구.
-
홍콩중문대 출신이 창업한 중국 컴퓨터비전 AI 기업, 상탕테크놀로지
-
베이징대학교 컴퓨터과학대학 조교수, Embodied and Generative Intelligence Lab 리더. 체화 AI, 생성 AI, 컴퓨터비전 연구.
-
알리바바 AMAP CV Lab을 총괄하며 ABot 시리즈 월드 모델과 WorldRoamBench 벤치마크의 프로젝트 스폰서 역할을 맡은 연구 책임자
-
Google DeepMind 리서치 사이언티스트. I3D·Perceiver·Kinetics 데이터셋 공동 저자. 비디오 이해 전공.
-
화중과기대(HUST) 연구자. 구현 AI·VLA·월드 모델·자율주행 인식 연구. TurboVLA 프로젝트 리드.
-
상하이AI랩 대형 모델 센터장. InternLM·InternVL·OpenMMLab 리더. 홍콩중문대 박사.
-
칭화대학교 컴퓨터기술 석사이자 JD Joy Future Academy 연구자. 자기회귀 영상 확산의 장문 외삽을 연구.
-
중국과학원(CASIA)/중관촌학원 소속 박사과정생으로 뉴로모픽 컴퓨팅·컴퓨터비전·LLM 양자화를 넘나들며 HYDRA-X 통합 멀티모달 모델에서 공동 제1저자로 활약
-
Google DeepMind 엔지니어링 매니저 + 룬드대 교수. 인간 포즈 추정·아바타 모델링 전문가. BlazePose·GHUM 개발.
-
화중과기대(HUST) 전자정보통신학부 교수. 컴퓨터비전·딥러닝 분야 연구 그룹 HUST Vision Lab 주재. CVPR·NeurIPS 등 100편 이상 논문 발표.
-
Microsoft Research Asia 연구 과학자. Mage-Flow 프로젝트 리드이자 공동 1저자, 효율적 시각 생성 모델과 신경 압축 전문가.
-
Tencent Hunyuan 수석 연구원. 시맨틱 세그멘테이션과 픽셀 단위 예측, 멀티모달 사전학습을 연구했고 ByteDance Seed를 거쳤습니다.
-
Grounding DINO 저자, 프린스턴 AI Lab 박사후연구원. 2026년 가을 컬럼비아대 조교수 부임 예정
-
상하이AI랩 영 리서치 사이언티스트. OpenMMLab 핵심 멤버. MMDetection·Intern-S1 개발자.
-
홍콩중문대학교 소속 연구자. 실행 가능한 Blender 코드를 영상 생성의 사고 사슬로 쓰는 VideoCoCo의 1저자이자 프로젝트 리더
-
푸단대 신뢰가능 임바디드 AI 연구소(TEAI) 조교수. 엔드투엔드 자율주행·궤적 예측 연구자로 Bench2Drive·DriveTransformer 저자
-
Tencent 수석 연구과학자이자 Hunyuan 3D 팀 리더. 3D 생성 대형 모델과 월드 모델을 이끌며 HunyuanWorld 공개를 총괄했습니다.
-
홍콩중문대 정보공학과 조교수, MMLab 소속. UC 버클리 박사, Lotfi A. Zadeh Prize 수상. 전이학습·레이블 효율 학습·멀티모달 연구자.
-
화중과기대(HUST) 박사과정 연구원. 이미지 인페인팅 특화. PixelHacker(2504.20438), Moebius(2606.19195) 제1저자.
-
알리바바 Qwen 사업부 연구자. UC 샌디에이고 출신으로 레이아웃-이미지 생성 벤치마크 OverLayBench 1저자. CFG 기반 on-policy 증류의 분기 모호성을 처음 형식화.
-
Tencent Hunyuan 3D 연구원. WorldClaw의 프로젝트 리더 중 한 명으로 전역 지형 생성과 지역 씬 생성 양쪽에 이름을 올렸습니다.
-
NVIDIA Learning and Perception Research 수석 연구 과학자. 스테레오 깊이 추정, 광학 흐름, 4D 인식 전문가.
-
KAIST 석좌교수. 생성모델·이미지 변환·멀티모달 연구자. StarGAN 공저자.
-
화중과기대(HUST) Vision Lab 연구원. 이미지 인페인팅 분야. PixelHacker(2504.20438)·Moebius(2606.19195) 공동 제1저자.
-
MIT 부교수 + Google DeepMind Distinguished Scientist. ResNet·MAE·MoCo 저자. 21세기 최다 인용 논문 보유.