류궁선
개요
류궁선(劉功申, Gongshen Liu)은 상하이교통대학교(SJTU) 전자정보전기공학원(School of Electronic Information and Electrical Engineering) 교수입니다. 자연어 처리, 머신러닝, 인공지능 보안을 주요 연구 영역으로 삼고 있습니다.
특히 대형 언어모델(LLM)의 백도어 공격과 적대적 위협을 중심으로 NLP 시스템의 취약점과 방어 방법론을 연구합니다. LLM이 NLP 전반에서 뛰어난 성능을 내면서도 동시에 새로운 보안 위협을 만들어낸다는 문제의식이 연구 전반의 출발점입니다.
2025~2026년에는 연구 범위를 멀티모달 LLM 기반 GUI 에이전트 백도어, 연합 학습 환경의 백도어 방어, CAPTCHA 보안 분석까지 확장하며 LLM 보안 분야의 폭넓은 문제를 다루고 있습니다. 백도어 공격의 탐지, 방어, 전이 경로를 포괄적으로 분석하는 연구 방향이 이 시기의 특징입니다.
생애
상하이교통대학교 컴퓨터과학과에서 박사학위를 취득했습니다. 졸업 후 같은 대학 전자정보전기공학원에 교수로 임용되어 현재까지 재직 중입니다.
연구실에서는 다수의 박사과정생과 함께 NLP 보안 주제를 연구하고 있습니다. 다국어 LLM의 교차 언어 백도어 공격, 연합 학습 환경에서의 언어모델 워터마킹, 생성형 LLM에 대한 백도어 방어 등 폭넓은 주제를 다룹니다.
학부생 지도도 활발하게 진행하며, 상하이교통대학교 전자정보전기공학원 재학생들을 연구 그룹에 일찍 합류시켜 보안 연구 감각을 키우는 방식으로 지도하는 것으로 알려져 있습니다. 2026년에는 ICASSP에 연합 학습 환경의 백도어 위협 관련 논문을 발표하며 연구 영역을 더욱 넓히고 있습니다.
업적
류궁선의 가장 영향력 있는 연구는 NLP 모델의 백도어 공격 및 방어에 대한 포괄적 서베이 논문입니다. 2023년 IEEE Transactions on Neural Networks and Learning Systems에 게재된 이 논문은 NLP 커뮤니티에 백도어 위협의 체계적인 분류 체계와 방어 방향을 제시했습니다.
생성형 LLM에 특화된 백도어 방어 연구도 주목받습니다. 기존 BERT 계열 판별 모델용 방어 기법이 GPT 계열 생성 모델에는 효과가 없다는 점을 지적하고, 재학습 없이 백도어 샘플을 필터링하는 기법을 제안했습니다. 또한 지식 증류(knowledge distillation)를 통해 교사 LLM에서 학생 LLM으로 백도어가 전이될 수 있음을 증명하는 연구도 발표했습니다. 이 연구들은 백도어 위협이 단일 모델에 국한되지 않고 모델 파이프라인 전체로 확산될 수 있음을 보여준다는 점에서 중요한 함의를 갖습니다.
2025년에는 EMNLP Findings에 "Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents"를 발표했습니다. MLLM 기반 GUI 에이전트에서 오픈소스 사용 또는 API 공급망에 의해 발생하는 백도어 취약점을 분석하며 멀티모달 보안 연구로 외연을 넓혔습니다. 2026년에는 연합 학습 환경에서 신호 집합 관점으로 백도어 위협을 재분석한 연구를 ICASSP 2026에 발표하며, 분산 학습 생태계의 보안 문제까지 다루고 있습니다.
여담
류궁선은 NLP 연구자이면서도 순수 언어 성능 향상보다 보안 위협 탐지에 초점을 맞추는 독특한 연구자입니다. LLM 성능 경쟁이 치열해질수록 그 이면의 보안 취약점 연구의 중요성도 커지는 만큼, 그의 연구 방향은 시대적 흐름과 맞닿아 있습니다.
상하이교통대학교에서 학위를 취득하고 같은 학교에서 교수 생활을 이어가는 점에서, 기관과의 강한 연속성을 보여줍니다. 이는 연구 그룹의 장기적 축적과 학생 멘토링 문화의 형성으로 이어집니다.
다국어 백도어 공격 연구는 영어권 중심으로 진행되던 NLP 보안 연구를 다양한 언어 환경으로 확장한다는 점에서 의의가 있습니다. 중국어권 연구자로서 갖는 언어적 감수성이 이런 방향성에 영향을 준 것으로 보입니다. GUI 에이전트 보안, 연합 학습 보안으로 이어지는 연구 확장은 AI 시스템의 배포 환경이 복잡해질수록 보안 위협의 표면도 넓어진다는 사실을 반영합니다.
주요 논문
- Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review (IEEE TNNLS 2023)
- Setting the Trap: Capturing and Defeating Backdoors in Pretrained Language Models through Honeypots (2023)
- PromptFix: Few-shot Backdoor Removal via Adversarial Prompt Tuning (2024)
- Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining (2024)
- Transferring Backdoors between Large Language Models by Knowledge Distillation (2024)
- Char-mander Use mBackdoor! A Study of Cross-lingual Backdoor Attacks in Multilingual LLMs (2025)
- Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents (EMNLP Findings 2025)
- Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models (2025)
- EmbTracker: Traceable Black-box Watermarking for Federated Language Models (2026)
- HLL - Can Agents Cross Humanity's Last Line of Verification