로널드 윌리엄스
개요
로널드 제임스 윌리엄스(Ronald James Williams, 1945~2024)는 미국의 수학자이자 전산학자입니다. 딥러닝과 강화학습 분야의 초기 개척자 중 한 명으로, 역전파 알고리즘의 공동 저자이자 정책 그래디언트 계열의 출발점인 REINFORCE 알고리즘의 창시자입니다.
데이비드 루멜하트, 제프리 힌턴과 함께 1986년 Nature에 발표한 역전파 논문은 신경망 연구의 폭발적 성장을 이끈 이정표 논문 중 하나입니다. 이 논문은 현재 피인용 횟수가 수만 회에 달하며 딥러닝 역사에서 가장 중요한 논문으로 꼽힙니다. 1992년에 제안한 REINFORCE 알고리즘은 현대 강화학습의 표준 도구로 자리잡았으며, 인용 횟수가 1만 회를 넘습니다.
노스이스턴대학교 컴퓨터과학과에서 22년간 교수로 재직하며 후학을 양성했고, 2024년 2월 16일 매사추세츠주 프레이밍햄에서 별세했습니다.
생애
로널드 윌리엄스는 1945년 미국 캘리포니아주 로스앤젤레스에서 태어났습니다. 캘리포니아 공과대학교(Caltech)에서 수학을 전공하여 1966년 학사 학위를 받았습니다. 이후 캘리포니아대학교 샌디에이고(UCSD)에서 수학 석사(1972)와 박사(1975) 학위를 취득했으며, 박사 논문 지도교수는 도널드 베르너 앤더슨(Donald Werner Anderson)이었습니다.
박사 학위 취득 후 대잠수함전을 전문으로 하는 국방 계약업체에서 근무했습니다. 이후 1983년부터 1986년까지 데이비드 루멜하트가 이끄는 UCSD 인지과학 연구소 PDP(Parallel Distributed Processing) 연구 그룹에 합류하여 신경망 연구를 시작했습니다. 이 시기에 루멜하트, 힌턴과의 공동 연구로 역전파 논문을 완성했습니다.
1986년 노스이스턴대학교 컴퓨터과학과 교수로 부임하여 2008년 정년퇴직까지 22년간 재직했습니다. 이 기간 동안 강화학습과 순환 신경망 학습 방법에 관한 연구를 꾸준히 이어갔습니다. 2024년 2월 16일 향년 78세로 세상을 떠났으며, 노스이스턴대학교 컴퓨터과학과는 추도문을 공개하며 그의 교육자로서의 역할과 학문적 유산을 기렸습니다.
업적
윌리엄스의 가장 널리 알려진 업적은 1986년 역전파 논문입니다. 데이비드 루멜하트, 제프리 힌턴과 함께 Nature에 발표한 Learning representations by back-propagating errors에서 그는 수식적 엄밀성을 보강하고 누적 그래디언트 업데이트와 모멘텀 항을 형식화하는 역할을 담당했습니다. 이 논문은 다층 신경망 학습의 이론적 기반을 확립하여 이후의 딥러닝 붐을 가능하게 했습니다.
1992년 발표한 REINFORCE 알고리즘은 강화학습 분야에서의 핵심 기여입니다. "Simple statistical gradient-following algorithms for connectionist reinforcement learning"에서 제안된 이 방법은 기대 보상의 그래디언트 방향으로 가중치를 조정하는 정책 그래디언트 계열의 첫 번째 알고리즘입니다. 현대 강화학습에서 PPO, GRPO 등 수많은 방법론의 이론적 뿌리가 되며, 특히 LLM의 RLHF 훈련에서도 이 틀이 직접 활용됩니다.
순환 신경망 학습에도 기여했습니다. 데이비드 집서(David Zipser)와 함께 teacher forcing 알고리즘을 고안했고, 시간을 거슬러 그래디언트를 전파하는 BPTT(Backpropagation Through Time)의 정립에도 참여했습니다. LSTM 등장 이전 시대 RNN 연구의 토대가 된 작업들입니다.
여담
윌리엄스는 박사 학위를 수학으로 받은 뒤 국방 계약업체에서 대잠수함전 관련 업무를 하다가 신경망 연구로 전환한 특이한 이력의 소유자입니다. 이 경로는 당시 AI 연구자들의 다양한 배경을 보여주는 사례로 언급됩니다.
역전파 논문의 세 저자 중 루멜하트와 힌턴이 선명하게 기억되는 반면, 윌리엄스는 상대적으로 덜 알려진 편입니다. 하지만 REINFORCE 알고리즘만 놓고 보면 강화학습 역사에서 그가 단독으로 남긴 자국이 뚜렷합니다. 현대 LLM의 RLHF, GRPO, DAPO 등은 모두 윌리엄스가 제시한 정책 그래디언트 틀 위에서 작동합니다. 딥러닝 붐이 일어나기 수십 년 전에 이미 핵심 알고리즘을 정립했다는 점에서, 그의 연구는 시대를 앞선 것이기도 했습니다.
그의 별세는 신경망 연구 1세대의 마지막 퇴장 중 하나로 받아들여졌습니다. 노스이스턴대학교 추도문은 그를 탁월한 교육자이자 조용한 개척자로 기억했습니다.
주요 논문
- Learning representations by back-propagating errors (Nature, 1986, D. Rumelhart, G. Hinton 공저) -- 역전파 알고리즘을 정립한 기념비적 논문.
- Simple statistical gradient-following algorithms for connectionist reinforcement learning (Machine Learning, 1992) -- REINFORCE 알고리즘을 제안한 정책 그래디언트의 출발점.
- A learning algorithm for continually running fully recurrent neural networks (Neural Computation, 1989, David Zipser 공저) -- teacher forcing 알고리즘을 처음 제안한 논문.
- Gradient-based learning algorithms for recurrent networks and their computational complexity (1995) -- RNN 그래디언트 기반 학습의 계산 복잡도 분석.
- Training recurrent networks using the extended Kalman filter (1992) -- 확장 칼만 필터를 활용한 순환 신경망 학습 방법.
- Experimental analysis of the real-time recurrent learning algorithm (1989) -- RTRL(Real-Time Recurrent Learning) 알고리즘의 실험적 분석.
- Reinforcement learning is direct adaptive optimal control (1992) -- 강화학습을 직접 적응 최적 제어로 해석한 이론 논문.