웨이퍼 규모 가속기는 분산 시스템의 복잡성을 없앤 장치처럼 보입니다. 모델을 실리콘 한 장에 올리면 클러스터 네트워크를 거치지 않아도 되기 때문입니다. 그러나 OSDI 2025의 WaferLLM 논문은 물리적으로 하나인 웨이퍼가 논리적으로는 거대한 분산 메모리 시스템이라는 점부터 짚습니다[1]. Cerebras WSE-2에는 85만 개 코어와 총 40 GB SRAM이 있지만, 코어 하나가 직접 쓰는 메모리는 48 KB입니다. 다른 코어의 데이터는 2차원 메쉬를 건너서 가져와야 하고, 코어별 라우터가 유지할 수 있는 경로 수도 제한됩니다.

따라서 GPU의 공유 HBM을 전제로 만든 커널을 그대로 옮기면 웨이퍼의 총 대역폭을 쓰지 못합니다. WaferLLM은 최대 병렬 코어 수, 접근 거리, 로컬 메모리 용량과 라우팅 경로 수를 PLMR이라는 네 가지 조건으로 묶고, 프리필과 디코드를 이 조건에 맞춰 다시 설계합니다. 핵심은 더 큰 칩이 아니라, 데이터의 위치와 연산 순서를 함께 정하는 런타임입니다.

하나의 패키지에 분산된 메모리

논문이 사용한 WSE-2는 최대 1.1 GHz로 동작하는 85만 개 코어와 22 PB/s의 총 온칩 메모리 대역폭을 제공합니다[1][2]. 하지만 이 합계는 임의의 코어가 임의의 주소를 같은 지연시간에 읽을 수 있다는 뜻이 아닙니다. 가까운 코어의 SRAM과 먼 코어의 SRAM은 거치는 홉 수가 다르고, 논문은 접근 지연시간의 차이가 최대 1,000배에 이를 수 있다고 설명합니다. 평가 장치에서 코어 하나가 하드웨어로 설정할 수 있는 라우팅 경로도 25개 미만입니다.

GPU 커널은 보통 레지스터와 공유 메모리에 타일을 두고, HBM을 넓고 균일한 후방 메모리로 취급합니다. 웨이퍼에서는 타일마다 주소뿐 아니라 물리적인 좌표가 있습니다. 용량을 고르게 쓰는 배치는 통신 거리를 늘릴 수 있고, 병렬성을 키운 스케줄은 경로 수를 초과할 수 있습니다. 데이터를 복제하면 거리는 줄지만 48 KB라는 코어별 용량을 빠르게 소비합니다. 네 조건은 따로 조정할 수 있는 항목이 아니라 서로 비용을 바꾸는 관계입니다.

WaferLLM은 기존 설계를 이 조건으로 점검합니다. 모든 SRAM을 공유 메모리처럼 추상화하면 먼 접근의 비용을 숨기게 됩니다. 반대로 일반적인 분산 알고리즘을 적용하면 성능 좋은 집단 통신 장치를 가진 수천 노드라는 전제를 수십만 개의 작은 라우터에 가져오게 됩니다. 이 장치를 이해하는 적절한 단위는 ‘거대한 GPU’도 ‘거대한 클러스터’도 아닙니다. 연산과 데이터를 함께 놓아야 하는 메쉬입니다.

WaferLLM의 PLMR 모델을 다시 구성한 도판. 웨이퍼 규모 메쉬에서는 대규모 코어 병렬성, 최대 1,000배의 접근 지연시간 차이, 코어당 수십 KB의 로컬 SRAM, 코어당 25개 미만의 설정 경로를 함께 만족해야 합니다. 실제 제품 사진이나 제조 배치도가 아닌 개념적 구성입니다. 이 글을 위해 새로 만든 도판.

메쉬에 맞춘 프리필 행렬곱

프리필의 주된 연산은 행렬과 행렬의 곱입니다. WaferLLM의 MeshGEMM은 행렬을 잘게 나눠 2차원 코어 격자에 놓고, 순환 이동과 통신 순서 교차 배치를 결합합니다. 순환 이동으로 각 코어가 결과 계산에 필요한 블록을 차례로 만나되 작업 집합을 로컬 메모리 안에 유지합니다. 통신을 교차 배치하면 먼 거리 메시지가 같은 순간에 몰리지 않아 임계 경로와 라우팅 자원 압력을 줄일 수 있습니다.

SUMMA와 Cannon처럼 분산 행렬곱 알고리즘은 이미 존재합니다. 차이는 어느 네트워크와 메모리를 전제했는지입니다. WaferLLM은 각 패턴이 코어별 메모리, 경로 수와 거리별 지연시간을 지키는지 검토합니다. MeshGEMM은 세 조건을 만족하면서 코어 수를 수십만 개까지 늘리기 위해 선택한 패턴입니다.

연산 사이의 텐서 배치도 함께 고정합니다. GPU에서는 감당할 수 있는 전치 형태의 재배치가 메쉬에서는 긴 이동을 유발할 수 있습니다. 다음 레이어가 현재 배치를 바로 소비하도록 두면 개별 GEMM의 최고 속도보다 전체 추론 경로의 이동량을 줄일 수 있습니다. 커널 최적화처럼 보이지만, 실제로는 여러 연산에 걸친 데이터 배치 문제입니다.

분할만으로 채울 수 없는 디코드

디코드에서는 매 단계의 쿼리 길이가 1입니다. 쿼리 차원을 나누는 것만으로는 웨이퍼를 채울 만큼의 독립 작업이 나오지 않습니다. WaferLLM은 세밀한 복제와 메쉬 전용 행렬·벡터 곱으로 병렬성을 만듭니다. 가중치와 부분 합을 분산하되 결과를 하나의 긴 순차 경로로 모으지 않습니다.

MeshGEMV의 K-트리 올리듀스는 라우팅 경로 수와 통신 깊이를 교환합니다. 파이프라인이나 링 방식은 코어별 경로를 적게 쓰지만 부분 합이 많은 참가자를 차례로 거칩니다. K-트리는 여러 그룹이 동시에 합산하도록 깊이를 줄입니다. K를 키우면 단계는 줄지만 코어가 유지해야 할 경로가 늘기 때문에, 논문 구현은 WSE-2에서 K=2를 사용합니다. 라우터 상태도 메모리나 연산량처럼 배정해야 하는 자원이라는 뜻입니다.

KV 캐시 역시 같은 원리로 이동합니다. 새 키와 값을 기존 영역 뒤에 계속 붙이면 일부 코어에 용량과 작업이 몰립니다. WaferLLM은 캐시 블록을 메쉬 안에서 이동시켜 토큰이 늘어도 사용량을 고르게 유지합니다. 비교한 배치 방식보다 저장 가능한 토큰 수가 360~385배 많다는 결과는 물리 메모리가 늘었다는 뜻이 아닙니다. 잘못된 배치 때문에 쓰지 못하던 분산 용량을 실제로 사용할 수 있게 됐다는 의미입니다.

요청당 처리량으로 본 평가

주 시험 장치는 Cerebras WSE-2입니다. GPU 비교에는 같은 7 nm 공정의 A100을 사용했고, 노드 안의 GPU 8장은 NVLink로 연결했으며 두 번째 8-GPU 노드는 InfiniBand를 거쳤습니다. GPU 서빙 소프트웨어는 SGLang입니다. 전체 모델 평가는 LLaMA3-8B와 LLaMA2-13B로 수행했고, 한 WSE-2에 모두 들어가지 않는 CodeLLaMA-34B와 Qwen2-72B는 일부 레이어를 측정했습니다. 지표는 배치 전체 처리량이 아니라 출력 토큰 시간의 역수인 요청당 처리량입니다.

WSE-2에 기존 컴파일러를 올린 비교에서는 차이가 매우 큽니다. 짧은 출력에서 WaferLLM은 T10보다 평균 160배, Ladder보다 평균 625배 높은 결과를 냈습니다. 이 수치는 실리콘이 수백 배 빨라졌다는 의미보다 메모리 추상화가 맞지 않으면 웨이퍼 대부분이 놀 수 있음을 보여 주는 실험으로 읽는 편이 정확합니다.

A100과의 비교는 추론 운영 판단에 더 가깝습니다. 공개된 입력·출력 길이에서 WaferLLM의 요청당 종단 처리량은 최적의 SGLang 구성보다 10~20배, A100 한 장보다 약 30~40배 높았습니다. 전체 모델의 에너지 효율은 약 2~2.5배입니다. 선택된 GEMV만 보면 A100 한 장보다 지연시간이 606배 짧고 에너지 효율이 16배 높은 경우도 있지만, 전체 추론에는 같은 배율로 줄지 않는 다른 연산과 소프트웨어 경로가 포함됩니다.

코어 수를 늘린다고 항상 빨라지지는 않습니다. 메쉬가 커지면 통신 거리가 늘고, 일부 디코드 구성에서는 올리듀스 증가분이 유효 작업보다 커집니다. 그래서 논문은 모델과 단계에 따라 다른 코어 격자를 선택합니다. LLaMA3-8B도 프리필 격자가 디코드 격자보다 큽니다. 웨이퍼는 무조건 모두 켜야 하는 자원이 아니라 연산에 맞는 사용 범위를 골라야 하는 토폴로지입니다.

장비군 비교에 빠진 비용

WSE-2와 A100 클러스터는 공정 외에도 다릅니다. 웨이퍼는 훨씬 큰 실리콘 면적과 SRAM 대역폭을 가지며, GPU 시스템은 더 큰 HBM과 성숙한 컴파일러, 연속 배칭과 여러 장비로 용량을 늘리는 네트워크를 갖습니다. 요청당 처리량은 한 요청이 얼마나 빨리 진행되는지는 보여 주지만, 랙당 토큰, 비용당 토큰, 지연시간 목표를 지킨 동시 처리량과 장애 영역 비용은 알려 주지 않습니다.

소프트웨어 성숙도도 계산해야 합니다. WaferLLM은 약 7,000줄의 Cerebras CSL과 2,000줄의 Python으로 구현됐고, 모든 모델 연산이 GEMM·GEMV만큼 웨이퍼를 잘 활용하는 것은 아닙니다. 총 40 GB SRAM보다 큰 모델은 여러 웨이퍼를 사용하거나 레이어 단위로 다뤄야 합니다. 구매 검토에서는 같은 모델과 정밀도, 요청 분포, 배칭 정책, 전력 측정 경계와 가용성 목표를 맞춰 다시 시험해야 합니다.

장애와 정비 비용도 별도 항목입니다. 웨이퍼 장치는 결함 영역을 우회하지만, 웨이퍼 한 장은 GPU 한 장보다 큰 서비스 단위입니다. 논문은 중복 코어와 재매핑으로 높은 기능 면적을 유지할 수 있다고 설명하지만 이를 장비군 가용성이나 교체 비용으로 환산하지는 않습니다. 낮은 지연시간의 가치는 정비 중에도 충분한 용량을 남길 때 유지됩니다.

토폴로지 전용 런타임의 점검 항목

새 가속기 런타임은 코어별 로컬 메모리, 거리에 따른 접근 비용, 라우팅 경로 수, 가능한 집단 통신 형태와 연산 사이 배치 변경 비용을 드러내야 합니다. 최대 FLOPS와 총 대역폭만으로는 실제 활용률을 예측할 수 없습니다.

평가는 세 층으로 나누는 편이 좋습니다. 커널 효율은 로컬 구현의 완성도를 나타내고, 요청당 지연시간은 토폴로지가 임계 경로를 줄였는지 알려 줍니다. 지연시간 목표를 지킨 장비군 처리량은 동시 요청과 장애, 대기열이 이점을 유지하는지 확인합니다. WaferLLM은 앞의 두 항목에 강한 근거를 제공합니다. 운영 도입 전에는 세 번째와 모델 적재 시간, 웨이퍼 용량을 넘는 작업의 동작을 추가해야 합니다.

컴파일러의 이식성도 별도 예산으로 봐야 합니다. PLMR 개념은 다른 메쉬 장치에 적용할 수 있지만, WSE-2에서 찾은 스케줄을 그대로 옮길 수는 없습니다. 로컬 SRAM이 크면 복제를 늘릴 수 있고, 라우터 기능이 많으면 K-트리 제약이 줄어듭니다. 칩 사이 메쉬에는 새로운 지연시간 계층이 생깁니다. 이식되는 것은 스케줄이 아니라 실제 토폴로지에서 스케줄을 다시 찾는 절차입니다.

시스템 도입의 기준

WaferLLM은 웨이퍼 규모 장치가 GPU 클러스터를 대체한다고 증명하지 않습니다. GPU용 런타임으로 웨이퍼를 시험한 뒤 활용률이 낮다고 결론 내리면 안 된다는 점을 증명합니다. 데이터 배치, 라우팅 상태와 단계별 병렬성이 메쉬에 맞으면 시험한 모델에서 요청당 지연시간과 에너지 효율이 크게 개선됩니다.

인프라 팀의 최종 질문은 칩 사양보다 소프트웨어 소유권입니다. 표준과 다른 메모리 토폴로지를 구매하면 모델이 바뀔 때마다 이를 이해하는 컴파일러와 런타임도 함께 운영해야 합니다. 호환 계층과 최고 수치만 제공하면 많은 하드웨어가 놀 수 있습니다. 반대로 실제 토폴로지를 드러내고 배치를 최적화할 수 있다면, 웨이퍼는 단순히 큰 다이가 아니라 핵심 통신을 실리콘 안에 가둔 하나의 추론 시스템이 됩니다.

출처와 저작권 안내

이 글은 OSDI 2025 논문[1]을 우리 표현으로 다시 분석한 편집 다이제스트입니다. 논문의 문장·도판·표를 옮기지 않았으며, 본문 도판은 Silicon & Systems가 새로 제작했습니다. 수치와 사실은 저자들이 공개한 평가 조건에 따라 인용했습니다. 원 논문의 저작권은 저자와 USENIX 프로시딩(2025)에 있습니다.