조엘 헤스트니스
Cerebras Systems의 Principal Research Scientist이자 코어 머신러닝 팀 리드입니다. 자연어 응용을 만들고 그 스케일링·학습 동역학·효율 특성을 연구합니다.
스케일링 법칙
바이두 실리콘밸리 AI 랩(SVAIL) 시절 발표한 Deep Learning Scaling is Predictable, Empirically(2017)가 대표작입니다. 현대 딥러닝 알고리즘의 정확도가 데이터·모델 규모에 따라 예측 가능한 멱함수로 움직인다는 것을 처음으로 실증했습니다. 이후 쏟아진 스케일링 법칙 연구의 출발점으로 인용됩니다. Kaplan et al.(2020)이나 Chinchilla보다 앞선 작업입니다.
Cerebras에서는 Cerebras-GPT로 이 노선을 이어갔습니다. 공개 데이터셋(The Pile)에 대해 모델 성능을 예측하는 첫 스케일링 법칙이라는 점이 핵심이고, Chinchilla 공식에 맞춰 학습해 주어진 연산 예산에서 최고 정확도를 냈습니다. BTLM, Jais, CrystalCoder 등에도 기여했습니다.
AMD Research와 NVIDIA Research를 거쳤습니다.
이 논문에서
Unlocking Lossless Speedups in LLMs via Discrete Diffusion에는 Cerebras 소속 저자 그룹(Mostafa Elhoushi, Nolan Dey, Shane Bergsma와 함께)으로 참여했습니다. 논문이 배치 크기 1이 아니라 디바이스가 감당하는 최대 배치에서 처리량을 재야 한다고 주장하는 대목에, 실제 추론 하드웨어를 만드는 쪽의 관점이 들어가 있습니다.