후젠
개요
후젠(Jian Hu)은 NVIDIA 시니어 딥러닝 엔지니어로, 강화학습과 머신러닝 시스템의 접점에서 일합니다. Ray 기반 아키텍처를 채택한 첫 오픈소스 RLHF 프레임워크 OpenRLHF의 프로젝트 리더이며, 이후에도 RL 학습 인프라를 계속 만들어 왔습니다.
생애
세부 학력에 대한 공개 정보는 제한적입니다. OpenRLHF를 오픈소스로 내놓으며 이름을 알렸고, 이후 NVIDIA에 합류해 RL 학습 스택 작업을 이어가고 있습니다.
업적
OpenRLHF(arXiv:2405.11143)는 Ray를 오케스트레이션 계층으로 쓰는 첫 오픈소스 RLHF 프레임워크입니다. Google, ByteDance, Baidu, NVIDIA, Tencent, UC Berkeley Starling 팀 등 여러 기업과 연구 그룹이 채택했습니다.
REINFORCE++는 PPO의 크리틱 네트워크가 만드는 계산 부담을 덜면서 프롬프트와 보상 모델 변화에 견고하게 동작하도록 설계한 RLHF 알고리즘입니다. 크리틱 없이 그룹 평균 베이스라인을 쓰는 계열로, GRPO와 함께 크리틱 프리 RL의 표준 선택지 중 하나가 됐습니다.
2026년 7월에는 Molt - A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning의 1저자이자 교신저자로 참여했습니다. OpenRLHF에서 얻은 교훈을 에이전트 RL 쪽으로 옮기면서, 프레임워크 크기 자체를 설계 제약으로 못 박은 점이 이전 작업과의 차이입니다.