덩호킨

🏷️ 인물 멀티모달 AI평가 벤치마크

카네기멜런대학교에 소속돼 있고 GrowAI(Growing AI Like a Child) 프로젝트의 중심 인물입니다. 존스홉킨스 CLSP에서 같은 제목으로 발표한 이력도 있습니다.

이 프로젝트의 문제의식이 그의 작업 전체를 설명합니다. 지금 언어모델은 고차 추론에서는 뛰어난데 사람에게는 직관적인 기초 문제 해결에서 취약하고, 실세계 상황에서 견고하지 않습니다. 그는 이 두 가지가 같은 뿌리에서 나온다고 봅니다. 인간과 기계의 인지 발달 경로가 어긋나 있다는 것입니다.

그래서 측정 도구를 발달심리학에서 가져왔습니다. GrowAI 팀은 2년에 걸쳐 대상 영속성, A-not-B 과제, 시각 절벽 같은 고전 실험을 정리해 12개 핵심 인지 개념에 걸친 1,503개 실험 데이터셋을 만들었습니다. 이후 작업들도 같은 형식입니다. 비전언어모델 108종을 세 가지 고전적 갈등 과제로 평가한 인지 통제 연구, 시선 방향 추론을 통제 실험으로 검증한 연구, 26개 모델을 물리 상식 6개 영역 155개 실험에 걸어본 연구가 있습니다.

VBVR-Pro - A Scalable and Verifiable Suite for Native Visual Reasoning의 과제 분류가 지각, 공간, 변환, 추상, 지식이라는 다섯 인지 능력으로 짜인 배경에 이 사람이 있습니다. 벤치마크를 태스크 목록이 아니라 인지 능력의 지도로 조직하는 방식이 그의 앞선 작업들과 같습니다.