쑹신하오
개요
쑹신하오(Xinhao Song, 宋鑫豪)는 상하이교통대학교(Shanghai Jiao Tong University, SJTU) 소속 연구자로, 멀티모달 에이전트의 평가와 인간-AI 경계 분석을 연구하고 있습니다. CAPTCHA를 에이전트 평가의 마지막 관문으로 재정의한 HLL 벤치마크의 1저자로, 에이전트 연구 커뮤니티에서 주목을 받고 있습니다.
생애
쑹신하오는 SJTU 소속으로 박사 과정이나 연구원 자격으로 활동하고 있습니다. 세부 학력 경로나 지도 교수에 대한 공개 정보는 제한적입니다. 교신저자를 맡은 장린펑과 류둥루이가 SJTU 소속 시니어 연구자들로, 이들의 지도 아래 에이전트 벤치마크 연구를 진행하고 있습니다.
HLL 논문은 2026년 6월 arXiv에 공개되었으며, CAPTCHA라는 구체적이고 측정 가능한 인간 검증 메커니즘을 에이전트 능력 평가에 활용한 점에서 신선한 접근으로 받아들여졌습니다. 코드는 GitHub(XinhaoS0101/HLL)에 공개되어 있습니다.
업적
쑹신하오의 대표 작업은 "HLL: Can Agents Cross Humanity's Last Line of Verification?"(2026)입니다. 이 논문은 CAPTCHA를 단순한 보안 도구가 아닌, 멀티모달 에이전트가 인간을 대체할 수 있는지를 측정하는 구조적 테스트베드로 재정의했습니다.
벤치마크는 10개 과제군을 세 가지 현실성 축인 난이도, 방해 요소, 동적 검증 조건으로 평가합니다. 현재 최상위 에이전트들도 이 벤치마크에서 취약함을 드러낸다는 점이 핵심 발견입니다. 에이전트가 정답을 맞히더라도 유효한 행동 트레이스를 구성하지 못하면 실패로 처리하는 설계 덕분에, 단순 답변 정확도가 아닌 절차적 일관성까지 평가합니다.
성능 저하 요인을 분석한 결과 위치 파악 오류, 행동 보정 실패, 상태 추적 한계, 프로세스 일관성 부족으로 정리됩니다. 이 분석은 현 에이전트 설계가 어디서 구체적으로 취약한지를 명확히 지목하는 진단으로 작용합니다.
여담
CAPTCHA는 인터넷에서 인간과 봇을 구별하기 위해 설계된 메커니즘입니다. 이것을 역으로 에이전트 평가에 활용한다는 발상은, "사람만 통과할 수 있어야 한다"는 전제가 AI 시대에 얼마나 빠르게 흔들리고 있는지를 보여주는 역설적 프레임이기도 합니다.
HLL이 단지 기술적 취약점 측정에 그치지 않고, 에이전트가 보호된 실제 워크플로에서 인간을 대체할 수 있는 시점을 정량화하는 척도로 설계되었다는 점에서 사회적 함의도 담고 있습니다.
주요 논문
- HLL: Can Agents Cross Humanity's Last Line of Verification? (1저자, arXiv 2606.02449, 2026)