Cerebras

🏷️ 반도체 GPU LLM

2016년 설립된 미국 AI 반도체 회사입니다. 웨이퍼 한 장을 통째로 칩 하나로 쓰는 웨이퍼 스케일 엔진을 만듭니다. 칩을 여러 개로 자르지 않으니 칩 간 통신 비용이 사라지고, 온칩 SRAM 대역폭이 GPU 대비 압도적으로 커집니다. 이 구조가 추론 속도로 직결돼, 클라우드 추론 서비스에서 토큰 생성 속도 순위 상단을 차지하는 일이 잦습니다.

연구 조직도 함께 굴립니다. 조엘 헤스트니스가 코어 머신러닝 팀을 이끌며 Cerebras-GPT, BTLM, Jais, CrystalCoder 같은 공개 모델과 컴퓨트 최적 스케일링 법칙 연구를 내놨습니다.

Unlocking Lossless Speedups in LLMs via Discrete Diffusion에는 Mostafa Elhoushi, Nolan Dey, Shane Bergsma, 조엘 헤스트니스가 공저로 참여했습니다.