Slowbeam.dev
🤖 Computer Science

Cerebras WSE-3: 웨이퍼 한 장을 하나의 AI 칩으로 만든 이유

language
kor
date
Aug 12, 2026
slug
cerebras-wse-3-wafer-scale-engine
author
status
Public
tags
AI CHIP
Semiconductor
Computer Architecture
LLM
Hardware
summary
Cerebras는 4조 개 트랜지스터와 44GB 온칩 SRAM을 집적한 WSE-3로 AI 추론의 메모리 대역폭 병목에 도전한다. 웨이퍼 스케일 설계의 장점, 결함 우회 구조, OpenAI·AWS 협업, 그리고 NVIDIA·Groq과의 경쟁 구도를 살펴본다.
type
Post
thumbnail
image.png
category
🤖 Computer Science
updatedAt
Aug 11, 2026 08:54 PM
한국 주식시장인 KOSPI는 2026년 6월 9,000을 찍었다. 현재 다시 6,000대까지 내려왔지만, 2,000 박스피라고 불리던 작년까지만 해도 상상하기 어려운 장세다. 이 엄청난 성장을 이끈 것은 삼성전자와 SK하이닉스 같은 반도체 대형주였고, 그 중심에는 DRAM 산업이 있었다. 메모리는 AI 시대에 너무나도 중요한 기본 구성 요소로 자리 잡았다. 우리가 매일같이 사용하는 LLM AI의 주요 한계 중 하나는 컨텍스트 길이와 속도다. 기억량은 Codex나 Claude Code에서 context window로 한 세션에서 얼마나 많은 내용을 다룰 수 있는지와 관련이 있고, 속도는 초당 얼마나 많은 토큰을 입력하고 출력할 수 있는지를 나타낸다. 물론 두 요소 모두 하드웨어 메모리만이 아니라 모델 구조와 소프트웨어의 영향도 받는다. Cerebras는 다른 trade-off를 감수하더라도 속도를 가장 중요하게 생각하는 지금, 가장 매력적인 추론용 칩 중 하나로 자리 잡았다. 이걸 단순히 칩이라고 부를 수 있는 스케일인지는 모르겠지만.
notion image
Cerebras는 OpenAI와 750MW 규모의 다년 계약을 맺었고 AWS와도 추론 인프라 협업을 진행하면서, AI 인프라 투자에서 큰 성공을 이루고 있다. 수많은 NPU 회사 중 Cerebras가 선택받은 이유는 뭘까? Cerebras는 기존 통념을 뒤집는 WSE(Wafer Scale Engine)를 통해 웨이퍼 한 장의 84개 레티클 영역을 연결해 하나의 거대한 칩처럼 사용한다. 이런 구조가 갖는 장점은 명확하다. SRAM 스케일링을 통해 Cerebras 발표 기준 B200 대비 1,000~2,000배 높은 유효 메모리 대역폭을 확보한다. 44GB SRAM, 21PB/s 대역폭. 그에 따라 메모리 대역폭 병목을 크게 줄여 매우 빠른 추론이 가능하다. 그것을 위해 다른 trade-off를 감수한다. SRAM의 셀 크기는 이미 한계에 가까워졌기 때문에 SRAM 용량을 칩 안에서 계속 확장하는 것은 쉽지 않다. 외부 I/O와 시스템 간 스케일링도 여전히 어려운 문제다. 웨이퍼 전체를 칩으로 사용하니 전력 전달, 냉각, 패키징도 모두 맞춤형으로 설계해야 한다.
notion image
양산 입장에서도 규모의 경제가 쉽게 실현되지 않는 웨이퍼 스케일 방식 때문에 어려운 길을 간다. 웨이퍼 한 장에서도 불량 다이가 나오는 판에, 웨이퍼 전체를 칩으로 사용한다? 정말 말도 안 되는 상상을 현실로 실현했다. 약간의 결함에도 웨이퍼 전체를 버리지 않기 위해 약 97만 개의 물리 코어 중 결함 코어를 비활성화하고, 예비 코어와 여분의 통신 경로로 우회한다. 이렇게 출하 제품에서는 90만 개의 활성 코어를 확보한다. 게다가 전력 전달과 냉각 모듈도 모두 맞춤형으로 만들어야 하고, 조립과 패키징도 특수한 상황이다. 누가 봐도 성공이 불가능해 보이는 조건 같다. 대부분의 평범한 사고방식에서는 절대 도전하지 않았을 방법이지만, Cerebras는 해냈다. 빠른 토큰에 얼마나 진심인 걸까.
수많은 NPU 회사가 전력 효율화와 엣지화에 베팅해 치열한 경쟁을 벌이고 있을 때, Cerebras는 경쟁이 적은 부분을 뚫고 나왔다. Codex fast mode와 일반 Claude Code를 사용해 본 사람이라면 토큰 속도가 얼마나 중요한지 체감할 수 있다. Claude Code가 느리면 일을 시키고 다른 일을 하다가 다시 돌아와야 해서 사용자의 context switching 비용이 커진다. 이 기가 막힌 타이밍에 SRAM을 통째로 박아 넣은 Cerebras는 저지연 추론이라는 분명한 시장을 확보했다.
Cerebras가 보여주는 전략은 다른 분야에서도 한 번쯤 고려해 볼 만하다. 목표는 단순하고, 그 목표에 집착한다. 구현 수단은 직관적이지만 모두가 불가능하거나 불합리하다고 생각한다. 구현에 따른 모든 병목과 장애물을 제대로 정의하고 해결해 나간다. 언뜻 생각하면 불가능해 보이는 수단을 현실로 가능하게 만든 그들의 성과에 경이로움까지 느껴진다.
그들의 다음 step은 무엇일까? 우선 경쟁 제품을 살펴보자. NVIDIA도 SRAM 머신에 적극적이다. 2025년 12월 NVIDIA는 Groq을 인수한 것이 아니라 비독점 추론 기술 라이선스 계약을 맺었고, Groq의 창업자와 일부 핵심 인력이 NVIDIA에 합류했다. Groq 법인과 GroqCloud는 독립적으로 계속 운영된다. Groq은 Cerebras처럼 SRAM 기반 머신이지만 웨이퍼 레벨은 아니고 die level이다. NVIDIA가 공개한 Groq 3 LPX는 여러 LPU를 C2C 링크로 연결하고 Vera Rubin GPU와 조합하는 방향으로 확장하고 있다. Cerebras는 SRAM 셀이 작아져 한 웨이퍼에 더 많은 SRAM을 넣을 수 있는 스케일링을 바라겠지만, 당분간 SRAM 셀 미세화에는 병목이 있을 것이다. 다른 방향은 wafer-to-wafer hybrid bonding으로 SRAM을 확장하는 방식이다. 이는 Cerebras가 발표한 공식 로드맵은 아니고 현재 구조를 바탕으로 한 나의 추측이다. 기술적·양산 난도가 높지만 가능한 방향 중 하나로 보인다.
Cerebras를 보면 AI 대항해시대에 홀로 다른 방향으로 출항하는 개척선을 보는 것 같다. 아무도 가보지 않은 방향으로 수많은 risk와 모험을 헤쳐 나가고 있다. 그들은 끝내 신대륙에 도착할 수 있을까?

← Back

Related posts

AI와 만든 첫 PCB 샘플, 설계보다 어려웠던 것은

Aug 31, 2026

회사 업무용 보조 보드를 처음 설계·발주해 PCBA로 받아본 기록이다. AI가 회로와 생산 준비를 빠르게 밀어줬지만, 커넥터 수급과 실물 크기·배치 검증은 결국 직접 해결해야 했다.

ThunderScope: 화면과 연산을 PC로 옮긴 오픈소스 오실로스코프

Aug 12, 2026

ThunderScope는 4채널 1 GS/s 데이터를 Thunderbolt·USB4 또는 PCI Express로 PC에 실시간 전송하는 오픈소스 오실로스코프다. 화면과 연산을 PC로 옮긴 구조, ngscopeclient와 TS.NET 소프트웨어 스택, 다채널 동기화 및 커스텀 게이트웨어의 가능성을 살펴본다.

CPU는 어떻게 생각할까? C로 16비트 CPU를 직접 만들어보는 아주 좋은 입문 글

Mar 15, 2026

C 코드로 16비트 CPU를 직접 구현하면서 레지스터, 메모리, ALU, 플래그, 분기, 스택, 어셈블러까지 이해하게 해주는 글이다. 컴퓨터 구조를 추상적인 설명이 아니라 동작하는 코드로 연결해서 보고 싶은 사람에게 특히 추천할 만하다.