류둥루이
개요
Dongrui Liu(刘东瑞)는 상하이 인공지능 연구소(Shanghai AI Lab) 연구원으로, 상하이교통대학교에도 적을 두고 있습니다. 연구 관심사는 AI 안전·보안(AI Safety and Security)과 설명가능 AI(XAI)이며, 신뢰할 수 있는 대규모 언어 모델 구축을 핵심 목표로 삼고 있습니다. 개인 홈페이지는 shenqildr.github.io에서 확인할 수 있습니다.
주요 협력자로는 Jing Shao, Chaochao Lu, Linfeng Zhang 등이 있으며, EMNLP 2025, NeurIPS 2025, ICLR 2026, AAAI 2026, ICML 2026 등 최상위 학회에 꾸준히 논문을 발표하고 있습니다. 2026년 기준으로도 활발한 연구 활동을 이어 가고 있는 신진 연구자입니다.
생애
상하이 인공지능 연구소와 상하이교통대학교를 기반으로 연구 활동을 이어 가고 있습니다. 공개된 학력 정보는 제한적이나, Shanghai AI Lab의 Jing Shao 그룹과 긴밀히 협력하는 박사 과정 또는 포스트닥 연구자로 알려져 있습니다. AI 안전이라는 주제를 중심으로 LLM 해석 가능성, 에이전트 보안, 멀티모달 지식 충돌 등 다방면의 세부 문제를 다루며 연구 영역을 빠르게 확장해 왔습니다.
2025년에는 LLM 추론 동역학 해석 연구로 NeurIPS 2025에 논문을 게재했으며, 같은 해 컴퓨터 사용 에이전트의 위험성을 다룬 RiOSWorld 벤치마크도 NeurIPS 2025에 발표했습니다. 2026년에는 디퓨전 LLM의 안전 취약점, 에이전트의 기만적 행동, AI 위험 관리 프레임워크 등으로 연구의 폭을 넓혔습니다.
업적
LLM 추론 과정의 정보 흐름을 상호 정보량(Mutual Information)으로 분석한 연구는 "Thinking Tokens"가 추론 과정에서 정보 밀도가 높은 피크 지점임을 보여 주었습니다. 이 논문은 NeurIPS 2025에 발표됐으며, 모델 내부의 추론 동역학을 해석 가능한 방식으로 측정한 사례로 주목받았습니다.
RiOSWorld는 멀티모달 컴퓨터 사용 에이전트가 실제 운영 환경에서 초래할 수 있는 위험을 체계적으로 벤치마킹한 연구입니다. 에이전트가 파일 시스템, 브라우저, 터미널 등 실제 OS 환경에서 어떤 위험 행동을 취하는지 측정하는 프레임워크를 제시했습니다.
ICLR 2026에서는 디퓨전 LLM의 안전 취약점을 다룬 "The Devil behind the mask" 논문을 공동 저술했습니다. 이 연구는 디퓨전 기반 언어 모델이 마스크 복원 과정에서 기존 자기회귀 모델과는 다른 형태의 보안 취약점을 갖는다는 점을 실증했습니다. ICML 2026에서는 에이전트의 상향 기만(Upward Deception) 위험성을 분석한 논문도 발표했습니다.
2026년 2월에는 "Frontier AI Risk Management Framework in Practice"(v1.5) 기술 리포트 공동 저술에 참여했습니다. 사이버 공격, 설득·조작, 전략적 기만, 비통제 AI R&D, 자기 복제 등 다섯 가지 핵심 위험 차원을 체계적으로 평가한 문서입니다.
여담
Dongrui Liu의 연구는 AI 안전이라는 큰 우산 아래 구체적인 취약점을 실증하는 방향으로 일관됩니다. CAPTCHA, 에이전트 기만, 디퓨전 LLM 취약점처럼 자칫 산만해 보이는 주제들도 "봇과 인간을 구분하는 경계를 AI가 어떻게 위협하는가"라는 하나의 질문으로 수렴됩니다.
HLL - Can Agents Cross Humanity's Last Line of Verification에서는 장린펑과 함께 교신저자를 맡아 AI 에이전트가 CAPTCHA 방어선을 넘을 수 있는지를 직접 검증했습니다. AI 안전 연구자가 자신의 연구를 구체적인 보안 공격 시나리오로 연결한 드문 사례입니다.
상하이 AI Lab이 안전 연구에 집중 투자하는 흐름 속에서, 류둥루이는 이론적 해석 가능성 연구와 실용적 취약점 발견을 동시에 수행하는 연구자로 자리매김하고 있습니다.
주요 논문
- REEF: Representation Encoding Fingerprints for Large Language Models (ICLR 2025)
- Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning (NeurIPS 2025)
- RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents (NeurIPS 2025)
- HLL - Can Agents Cross Humanity's Last Line of Verification (2025)
- The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs (ICLR 2026)
- Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents (ICLR 2026)
- Are Your Agents Upward Deceivers? (ICML 2026)
- Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5 (2026)
- Towards AI-45 Law: A Roadmap to Trustworthy AGI (arXiv 2024)
- AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security (2025)