2017년 수백만 개 수준이던 AI 모델의 파라미터 수는 5년 만에 수조 개 규모로 늘었습니다[1]. 이제 하나의 가속기나 서버만으로 처리할 수 없는 모델은 파라미터와 액티베이션, 중간 결과를 여러 장치에 나누어 저장하고 계산합니다. 한 번의 학습 스텝에 수백에서 수천 개의 가속기가 참여하고, 그 사이에서 테라바이트 규모의 데이터가 오갈 수 있습니다.
분산 학습은 여러 장치가 각자 계산한 결과를 마지막에 한 번 합치는 작업이 아닙니다. 가속기들은 중간 결과를 계속 주고받고, 가장 늦은 장치가 동기화 지점에 도착해야 다음 계산을 시작합니다. 가속기를 늘리면 연산 능력과 함께 장치별 지연 차이와 장애 가능성도 커집니다. 따라서 패브릭에서 생기는 지연과 편차가 전체 시스템의 대기 시간과 한 스텝의 완료 시간을 결정합니다.
파네시아와 Meta Infra 연구진이 Nature Reviews Electrical Engineering에 발표한 리뷰는 이 문제를 링크 대역폭보다 시스템 구조의 차이로 설명합니다[1]. 질문은 CXL이 NVLink보다 빠르냐가 아닙니다. 서버 밖으로 나가는 순간 소프트웨어가 맡게 되는 주소 관리와 요청 순서, 장애 복구를 다시 하나의 하드웨어 패브릭 안에서 처리할 수 있느냐가 비교의 기준입니다. 이를 이해하려면 링크의 최고 속도보다 두 구조가 어디까지 하나의 시스템처럼 동작하는지를 먼저 봐야 합니다.
링크 속도가 아닌 시스템 구조의 비교
비교 대상부터 정확히 잡아야 합니다. GB200·GB300 NVL72의 현재 배치 구조는 NVLink와 NVLink-C2C로 랙 안에 고속 스케일업 영역을 만들고, 랙 사이는 이더넷 또는 InfiniBand 스케일아웃 네트워크로 연결할 수 있습니다[5]. 로컬 NVLink 영역을 벗어난 RDMA 트래픽은 NIC와 스위치 네트워크, 소프트웨어 조율 절차를 거칩니다. 이때 주소 관리와 통신 순서, 장애 처리도 별도의 시스템 경계로 넘어갑니다. 원칩형 CXL은 CPU와 가속기, 메모리에 같은 주소 체계와 트랜잭션 처리 규칙을 적용해 이 경계를 줄이려는 구조입니다.
그림 1에서는 파란색으로 표시한 로컬 NVLink가 아니라 주황색의 서버 간 경로를 봐야 합니다. 서버 안에서는 CPU와 가속기가 NVLink로 빠르게 통신합니다. 그러나 다른 서버의 상태를 읽거나 바꾸려면 NIC와 RDMA 처리, 이더넷 또는 InfiniBand 스케일아웃 패브릭, 서로 다른 주소·요청 순서·장애 영역을 맞추는 소프트웨어 절차를 차례로 거칩니다. 가운데 구름은 가까이 놓인 스위치 하나가 아니라 여러 경로와 스위치 큐가 있는 네트워크 전체를 뜻합니다. 요청이 이동하는 거리와 경로가 길어지고, 트래픽에 따라 큐에서 기다리는 시간도 달라집니다. 이 글에서 비교하는 256바이트 왕복 지연이 마이크로초급이며 완료 시간의 편차도 커지는 이유입니다. 따라서 모든 가속기를 기다리는 동기화 작업은 로컬 NVLink가 빨라도 서버 경계에서 멈출 수 있습니다.

그림 2에서는 서버를 나란히 그리지 않고 데이터센터 전체를 하나의 큰 칩으로 표현했습니다. CPU 그룹은 칩 내부의 코히어런스 타일이 되고, 랙과 파드는 여러 타일을 묶은 영역이 되며, CXL 패브릭은 이들을 연결하는 데이터센터 규모의 네트워크 온 칩(NoC) 역할을 합니다. CPU 타일 하나는 리뷰가 가정한 보수적인 CXL.cache 조건에서 코히어런트 가속기 16개를 관리합니다. 이러한 그룹 약 60개가 별도의 스케일아웃 RDMA 영역으로 나뉘지 않고 같은 주소와 트랜잭션 순서 규칙 아래 연결되면, 최대 960개 가속기가 하나의 스케일업 코히어런스 도메인으로 동작합니다. 단일 패브릭에는 최대 4,096개의 CXL 장치를 둘 수 있지만, 이는 CPU 한 개의 관리 범위가 아니라 패브릭 전체의 엔드포인트 상한입니다. 아래 네 카드는 그림 1과 같은 기준으로 접근 지연과 장애 처리 단위까지 비교합니다.

CXL로 얻는 네 가지 시스템 이점
CPU 한 개가 직접 관리하는 가속기는 2개에서 16개로 늘어납니다. 기준 구성에서는 CPU 한 개에 가속기 두 개가 직접 연결됩니다. 리뷰가 가정한 보수적인 CXL.cache 구성에서는 같은 주소 공간에 가속기 16개를 둘 수 있습니다. 관리 범위가 8배로 넓어지므로, 더 큰 작업을 서버 간 메시지와 소프트웨어 조율 없이 하드웨어 관리 범위 안에서 처리할 수 있습니다.
하나의 스케일업 코히어런스 도메인은 수십 개에서 최대 960개 가속기로 넓어집니다. CPU마다 16개 가속기를 연결한 그룹 약 60개가 하나의 CXL 패브릭에서 같은 주소와 트랜잭션 순서 규칙을 공유합니다. 각 그룹 사이를 별도의 스케일아웃 RDMA 네트워크 스택으로 건너지 않으므로, 서버나 로컬 영역마다 상태를 따로 관리하고 소프트웨어로 맞추던 절차가 하드웨어 패브릭의 공통 규칙으로 바뀝니다. 이는 단순히 장치 수가 늘어나는 것이 아니라, 하나의 시스템 버스처럼 동작하는 스케일업 범위의 밀도가 높아진다는 뜻입니다. 원문은 단일 패브릭에 최대 4,096개의 CXL 장치를 둘 수 있다고 별도로 설명합니다. 960개는 같은 코히어런스 규칙으로 묶이는 가속기 범위이고, 4,096개는 패브릭 전체의 엔드포인트 상한입니다.
서버 경계를 넘는 데이터 접근은 마이크로초급에서 수백 나노초급으로 짧아질 수 있습니다. 256바이트를 장치 사이에서 왕복시키는 경우, 이더넷 또는 InfiniBand 기반 RDMA 패브릭을 거치는 경로는 마이크로초급 지연이 발생합니다. 반면 홉 수가 고정되고 프로토콜을 하드웨어에서 처리하는 CXL 경로는 수백 나노초 범위로 제시됩니다[1]. 로컬 NVLink와 CXL 링크 자체의 속도를 비교한 수치가 아닙니다. NVLink의 로컬 영역 밖에 있는 데이터에 접근할 때, 네트워크 스택 대신 CXL 하드웨어 패브릭을 사용하는 경우를 비교한 값입니다.
고장 난 장치만 떼어 내고 나머지 자원은 계속 사용할 수 있습니다. CPU와 메모리, 가속기, 스위치를 기능별 트레이로 나누면 교체 단위가 서버 한 대에서 개별 장치로 줄어듭니다. 가속기 하나를 바꾸기 위해 정상 CPU와 메모리까지 함께 정지시키지 않아도 되므로, 사용할 수 없게 되는 자원과 운영 중단 범위가 작아집니다. CXL 핫플러그와 실행 중 재구성은 이를 위한 하드웨어 기능입니다. 실제 작업을 중단하지 않고 장치를 교체하려면 시스템 소프트웨어와 복구 정책까지 함께 갖춰야 합니다.
네 항목은 하나의 구조 변화가 만드는 서로 다른 이점입니다. CPU 한 개의 직접 관리 범위는 2개에서 16개로 늘어나고, 약 60개 CPU 그룹이 하나의 시스템 버스와 같은 CXL 패브릭에 묶이면서 스케일업 코히어런스 도메인은 최대 960개 가속기로 확장됩니다. 서버 밖의 데이터 접근은 스케일아웃 RDMA 네트워크 스택 대신 홉 수가 고정된 하드웨어 경로를 사용하고, 고장 처리 단위는 서버에서 장치로 작아집니다. 공유 주소, 일정한 홉 수, 공통된 순서 제어, 장치 단위 자원 분리가 함께 구현되기 때문에 규모와 접근 시간, 복구 범위가 동시에 달라집니다.
대역폭만으로 풀리지 않는 이유
칩을 설계할 때는 배선 길이와 파이프라인 단계 수, 중재 방식을 함께 정합니다. 지연 자체를 없앨 수는 없지만 편차를 일정 범위 안에 가둘 수 있으므로, 각 블록의 응답 시간을 예상해 다음 동작을 설계할 수 있습니다. 데이터센터의 원격 전송은 다릅니다. 데이터가 케이블과 어댑터, 스위치 큐, 프로토콜 처리기, 런타임 소프트웨어를 차례로 지나고, 각 단계의 처리 시간은 트래픽과 시스템 상태에 따라 달라집니다. 실제 데이터센터에서 측정한 왕복 지연은 일부 요청만 크게 늦어지는 긴 꼬리 분포를 보입니다. 99퍼센타일 지연이 중앙값의 약 5배에 이른다는 결과도 있습니다[4].

400 Gbit/s 링크는 데이터를 전송하는 시간을 줄입니다. 그러나 스위치 큐의 대기 시간과 소프트웨어 스케줄링 지연, 경로별 홉 수까지 같게 만들지는 못합니다. 이 차이는 동기화 지점에서 가장 늦은 장치의 대기 시간으로 나타납니다. 가속기 일곱 개가 계산을 마쳐도 마지막 한 개가 늦으면 전체 그룹은 다음 스텝으로 넘어갈 수 없습니다. 도판 왼쪽의 옅은 영역이 대역폭만 높여서는 줄이기 어려운 시간입니다.
장애가 미치는 영향도 작업 방식에 따라 달라집니다. 요청 단위로 처리하는 서비스는 느린 호스트를 우회하고 일부 처리량만 포기할 수 있습니다. 그러나 동기화된 학습 그룹은 장치 하나가 멈춰도 공통 체크포인트에서 작업을 다시 시작해야 하는 경우가 많습니다. 따라서 AI 시스템에서는 가동 중인 서버 수보다 전체 그룹이 일정한 속도로 계산을 이어 갈 수 있는지가 더 중요합니다.
장치 수를 늘린다고 장치 한 개당 성능이 그대로 유지되는 것도 아닙니다. 리뷰가 인용한 대규모 AI 시스템 연구에서는 참여 장치를 6배로 늘렸을 때 장치당 효율이 이전 수준의 80%대 중반으로 떨어졌습니다[1]. 계산에 참여하는 장치는 늘었지만, 장치 사이의 의존 관계와 동기화 시간도 함께 증가했기 때문입니다. 이러한 작업부하에서는 최고 대역폭보다 지연 편차와 공유 상태의 갱신 비용, 장애가 발생했을 때 다시 시작해야 하는 작업의 범위가 실제 확장성을 좌우합니다.
원격 자원을 메모리처럼 다루는 CXL
자원 분리(disaggregation)는 CPU와 메모리, 스토리지, 가속기를 기능별로 나누고 필요한 만큼씩 배치해 활용률을 높이는 방법입니다. 모든 부품을 서버 단위로 고정하면 어떤 자원은 남아도 다른 자원이 부족해 서버를 추가해야 합니다. 리뷰가 인용한 운영 사례에서는 이러한 불균형 때문에 자원 활용률이 50%를 밑돌기도 합니다[1]. 자원을 기능별로 분리하면 CPU와 메모리, 가속기를 서로 다른 비율로 증설하고 교체할 수 있습니다. 다만 기존 자원 분리 구조는 각 서버가 대체로 독립적으로 일하는 환경에 알맞습니다. 매 스텝마다 다른 가속기의 상태를 읽고 동기화해야 하는 AI 학습에서는 서버 사이의 통신 경계가 성능과 운영을 제약합니다.
‘주소 공간을 공유한다’는 말부터 풀어볼 필요가 있습니다. 네트워크형 구조에서 다른 서버의 메모리를 사용하려면 데이터가 어느 서버의 어느 버퍼에 있는지 확인하고, 통신 요청을 만든 뒤, 복사가 끝났는지까지 소프트웨어에서 관리해야 합니다. 공유 주소 공간에서는 여러 장치가 같은 데이터 위치를 같은 주소로 가리킵니다. 가속기 A가 값을 바꾼 뒤 가속기 B도 최신 값을 읽게 만드는 규칙이 캐시 일관성(cache coherence)입니다. 같은 주소를 사용하더라도 최신 값을 구분하지 못하면 장치마다 서로 다른 데이터를 볼 수 있으므로, 주소 공유와 캐시 일관성은 함께 구현해야 합니다.
CXL은 원격 자원을 별도의 네트워크 시스템보다 메모리 계층에 가까운 방식으로 다룹니다. CXL.io는 장치를 찾고 입출력을 처리하는 PCIe 호환 경로입니다. CXL.cache는 가속기가 호스트의 캐시 일관성 영역에 참여하게 하고, CXL.mem은 CPU와 가속기가 장치 메모리에 load/store 방식으로 접근하게 합니다. 장치는 지원 기능에 따라 로컬 메모리가 없는 캐시 일관성 가속기(Type 1), 로컬 메모리를 갖춘 가속기(Type 2), 메모리 확장 장치(Type 3)로 나뉩니다. 원칩형 구조는 이 장치들을 특정 서버에 고정된 부품이 아니라, 패브릭 안에서 조합할 수 있는 연산 및 메모리 자원으로 사용합니다.
CXL의 발전 과정은 서버 내부 연결이 패브릭으로 확장된 과정이기도 합니다. CXL 1.0은 CPU 패키지 밖에 있는 장치와 메모리에 하드웨어 경로로 접근할 수 있게 했습니다. CXL 2.0은 스위칭을 도입해 여러 장치를 하나의 도메인에 연결했습니다. CXL 3.0은 패브릭 연결 메모리와 장치 간 직접 전송, 통합 주소 공간을 추가해 연결 범위를 서버 밖으로 넓힐 기반을 마련했습니다. CXL 4.0은 물리 레인 속도를 128 GT/s로 높였습니다. 또한 최대 네 개의 리타이머를 이용해 채널을 연장하고, 여러 물리 포트를 하나의 논리 포트로 묶는 기능을 제시했습니다[2].
장치 수가 늘어나면 일관성 상태를 관리하는 방식도 달라져야 합니다. 패브릭 전체의 상태를 하나의 거대한 중앙 표에서 추적하는 대신, 각 장치가 담당하는 주소 영역에 맞춰 상태와 메타데이터를 나누어 관리합니다. 장치 수에 비례해 중앙의 관리 정보가 급증하는 문제를 줄이기 위한 구조입니다. 리뷰가 소개한 선행 연구에서는 디렉터리 기반 일관성, 스눕 필터링, 장치 간 상태 전달을 하드웨어에 구현했을 때 소프트웨어 기반 방식보다 성능이 25% 이상 향상됐습니다[1]. 이 결과는 일관성 처리를 소프트웨어 조율에서 하드웨어의 고정 경로로 옮기는 설계가 성능에 직접 기여한다는 점을 보여 줍니다. 패브릭 규모가 커질수록 주소와 순서 관리의 핵심 경로를 하드웨어에 두어야 하는 이유입니다.
그러나 CXL 규격을 지원한다는 사실만으로 칩 내부 블록처럼 일정한 응답 시간을 얻는 것은 아닙니다. 포트 수와 버퍼 구조, 라우팅 단계, 각 홉의 프로토콜 처리 방식은 제품마다 다릅니다. 같은 규격을 따르더라도 주요 처리를 펌웨어에서 수행하는 장치와 고정된 하드웨어 파이프라인에서 수행하는 장치의 지연 특성은 달라집니다. 메시와 토러스, 드래곤플라이 토폴로지는 연결성과 처리량을 높일 수 있지만 모든 장치 쌍에 같은 홉 수를 보장하지 않습니다. 따라서 평가에서는 CXL 기능의 지원 여부보다 공유 메모리 요청을 예측 가능한 시간 안에 처리할 수 있는지를 따져야 합니다.
이를 위해 패브릭은 세 가지 규칙을 함께 보장해야 합니다. **처리 순서(ordering)**는 여러 장치가 같은 데이터를 갱신할 때 어느 요청을 먼저 처리할지 정합니다. **가시성(visibility)**은 한 장치가 바꾼 값이 다른 장치에 언제부터 보이는지를 뜻합니다. **처리 완료 보장(forward progress)**은 여러 요청이 서로의 자원을 기다리다가 멈추지 않고 끝까지 처리되게 하는 조건입니다. 칩 안에서는 메모리 컨트롤러와 NoC가 이를 하드웨어로 관리합니다. 원칩형 CXL 패브릭은 같은 역할을 여러 스위치와 랙에 걸쳐 수행해야 합니다.
CXL의 이점을 구현하는 세 가지 하드웨어 요소
**포트 수가 많은 비차단 스위치(high-fanout non-blocking switch)**는 한 단계에서 많은 장치를 연결해 장치 사이의 홉 수를 줄입니다. 연결 가능한 장치가 적으면 규모를 늘릴 때마다 스위치 단계를 추가해야 하고, 경로가 길어질수록 지연과 제어 복잡성이 함께 커집니다. 비차단 구조는 여러 입력이 동시에 들어와도 스위치 내부의 대역폭 부족으로 특정 출력이 막히지 않도록 입력과 출력 용량을 맞춥니다. 모든 포트에 같은 요청 전달 파이프라인과 비슷한 길이의 전기 경로를 적용하면 포트에 따른 지연 차이도 제한할 수 있습니다. AllReduce와 파라미터 교환, 액티베이션 전송처럼 여러 장치가 동시에 통신하는 AI 워크로드에 필요한 조건입니다.
**링크 가속 유닛(LAU)**은 각 홉에서 반복되는 프로토콜 처리를 고정된 하드웨어 파이프라인으로 실행합니다. 패브릭에 처음 들어온 요청은 로컬 주소와 메타데이터를 최대 4 PB 규모의 패브릭 주소 공간에 맞는 헤더로 바꿔야 합니다. 이어서 CXL.io 8종, CXL.cache 6종, CXL.mem 12종의 트랜잭션을 구분하고, 목적지 포트를 선택하며, 재시도와 혼잡을 처리합니다[1]. 이 작업을 펌웨어에 맡기면 같은 물리 경로에서도 관리 명령이나 이벤트가 몰릴 때 처리 시간이 달라질 수 있습니다. 관리 인터페이스에 100개가 넘는 명령과 수십 종의 이벤트 로그가 있으므로, 펌웨어의 실행 순서가 지연 편차를 키울 수 있다는 뜻입니다.
LAU는 주소 변환과 헤더 처리, 트랜잭션 관리, 다음 홉 선택을 고정된 고속 경로에서 수행해 이러한 변수를 줄입니다. 또한 링크 상태를 감시하면서 재시도 범위와 큐 진입 기준, 혼잡 표시를 조절할 수 있습니다. 예를 들어 CXL은 출력 포트 점유율 10%와 25%를 각각 중간·심각 혼잡의 기본 기준으로 삼지만, 구현체는 트래픽 상태에 맞춰 기준과 재시도 정책을 바꿀 수 있습니다[1]. 목표는 모든 요청의 지연을 같은 값으로 만드는 것이 아닙니다. 재전송이나 일시적인 큐 적체가 일부 요청의 완료 시간을 크게 늘리는 빈도를 줄이는 것입니다.
패브릭 컨트롤러는 여러 스위치 포트에 같은 처리 순서와 우선순위 정책을 적용합니다. 트랜잭션 메시지를 물리 전송 단위로 나누고 다시 조립하며, 오류와 데이터 무결성을 검사하고, 재시도와 시퀀스를 확인합니다. CXL 패브릭이 최대 4,096개 장치를 주소로 구분할 만큼 커지면 각 장치가 규격을 지키는 것만으로는 부족합니다. 포트마다 우선순위가 다르면 같은 요청도 혼잡 상황에 따라 다른 순서로 처리될 수 있습니다. 모든 컨트롤러에 공통 정책을 적용해야 SoC의 트랜잭션 엔진이 칩 안에서 하던 일을 패브릭 전체로 확장할 수 있고, 소프트웨어가 처리할 예외와 상태 조합도 줄어듭니다.
모든 제어 기능을 하드웨어에 고정하자는 제안은 아닙니다. 주소 변환과 순서 확인처럼 전송 지연에 직접 영향을 주는 작업은 하드웨어가 맡고, 예외 처리와 장치 관리, 정책 변경처럼 유연성이 필요한 작업은 소프트웨어에 남깁니다. 소프트웨어를 없애는 것이 아니라, 완료 시간의 편차를 키우는 처리를 데이터 전송 경로 밖으로 분리하는 방식입니다.

스위치 다이의 배치는 이러한 조건을 물리적으로 보여 줍니다. 같은 구조의 포트 파이프라인이 중앙 제어 블록을 둘러싸고, 크로스바 또는 다단 네트워크가 포트 사이의 내부 경로를 만듭니다. 포트 수를 늘리면서도 같은 파이프라인과 중재 규칙을 유지해야 스위치 내부에서 다시 지연 편차가 커지는 일을 막을 수 있습니다. 따라서 LAU와 패브릭 컨트롤러의 설계 조건은 다음 단계인 트레이 연결 방식에도 그대로 이어집니다.
트레이에서 하나의 패브릭까지
제안 구조는 자원을 서버 단위가 아니라 트레이 단위로 나눕니다. 트레이는 CPU나 메모리, 가속기처럼 같은 종류의 자원을 모아 외부 CXL 링크로 연결한 장치 묶음입니다. 모든 부품을 서버 한 대에 고정하지 않으므로 부족한 자원만 늘리고, 고장 난 장치가 있는 트레이만 따로 정비할 수 있습니다. 칩 안에서 블록과 타일을 조합하듯 데이터센터의 자원을 구성하려는 방식입니다.
여러 트레이를 묶은 파드에서는 어느 두 트레이든 스위치 한 단계를 거쳐 통신합니다. 길이와 처리 단계가 같은 병렬 경로를 두면 한 경로에 장애가 생겨도 홉 수를 바꾸지 않고 우회할 수 있습니다. 그 위의 패브릭은 파드 사이의 홉 수도 같게 맞춥니다. 다단 Clos나 팻트리를 사용할 수 있고, 목표 지연 범위를 지킬 수 있다면 메시와 토러스, 링도 후보가 됩니다. 파드 내부에서는 더 많은 트레이를 수용하기 위해 제한적인 오버서브스크립션을 허용할 수 있습니다. 다만 파드 사이의 상위 스위치는 비차단 구조를 유지해야 전체 경로의 대역폭과 지연 편차를 함께 관리할 수 있습니다.

트랜잭션의 처리 순서도 이 계층에 맞춰 나눕니다. 파드 스위치는 요청과 응답, 스눕의 내부 순서를 정하고, 상위 스위치는 같은 규칙을 파드 사이에 적용합니다. 여기서 순서를 정한다는 말은 관련 없는 메모리 요청까지 하나의 직렬 큐에 넣는다는 뜻이 아닙니다. 같은 상태를 바꾸려는 요청만 정해진 순서 판정 지점에서 만나며, 모든 장치는 그 결과를 같은 선후관계로 해석합니다.
주소가 같아도 각 장치가 최신 값을 읽지 못하면 데이터를 공유한다고 보기 어렵습니다. 디렉터리 상태와 스눕 필터, 일관성 메시지는 전체 장치에 갱신을 방송하지 않고 해당 캐시 라인을 갖고 있을 가능성이 있는 장치만 찾습니다. 요청이 끝까지 처리되게 하려면 요청·응답·데이터 채널을 나누고, 크레딧 기반 흐름 제어와 교착이 생기지 않는 고정 경로를 함께 사용합니다. 혼잡을 없애는 방식은 아니지만, 혼잡할 때 어떤 요청을 먼저 보내고 언제 재시도할지를 소프트웨어 실행 시점에 맡기지 않습니다.

파드 안에서 처리할 수 있는 트랜잭션은 상위 스위치로 보내지 않습니다. 서로 다른 파드에서 같은 상태를 바꾸려는 요청만 다음 단계의 순서 판정 지점을 거칩니다. 이렇게 해야 패브릭 전체의 일관성을 유지하면서도 모든 요청이 하나의 중앙 제어 지점에 몰리는 일을 피할 수 있습니다. 일관성과 접근 권한도 분리해야 합니다. 하드웨어가 최신 값을 유지하는 것과 모든 사용자가 그 값을 읽고 쓸 수 있게 허용하는 것은 서로 다른 문제입니다.
앞서 본 수치는 이 계층 구조를 구현했을 때 얻을 수 있는 결과입니다. CPU 한 개가 가속기 16개를 관리하려면 주소 공간과 제어 범위를 함께 넓혀야 합니다. 수백 나노초급 접근을 목표로 한다면 장치 사이의 홉 수가 짧고 일정해야 합니다. 고장 난 장치만 교체하려면 자원의 물리적 배치와 장애 관리 단위도 서버에서 분리해야 합니다. 따라서 16개, 수백 나노초, 장치 단위 교체는 서로 독립된 기능이 아니라 같은 아키텍처에서 나온 결과입니다.
전기 링크로 확장할 수 있는 범위
전기 신호를 사용하는 CXL 패브릭에는 거리 제한이 있습니다. 128 GT/s 구리 링크는 신호 손실과 지터 때문에 한 구간을 수 미터 이상 늘리기 어렵습니다. 리타이머 두 개를 사용하면 전체 도달 거리를 약 7 m까지 늘릴 수 있고, 표준 랙 배치에서는 6~7개 랙을 연결할 수 있는 거리입니다. 그보다 넓게 연결하려면 CXL-over-optics와 광 백플레인, 코패키지 광학 기술이 필요합니다. 다만 광 연결은 거리를 늘리는 방법이지, 트랜잭션 순서와 냉각, 검증, 비용까지 해결하는 방법은 아닙니다.
7 m는 모든 케이블 구성에서 보장되는 거리가 아니라, 논문이 검토한 조건에서 배치할 수 있는 범위입니다. 커넥터 손실과 보드 배선 길이, 리타이머 위치, 온도는 모두 같은 링크 손실 한도에 반영됩니다. 랙 수가 같아도 장비와 케이블을 놓는 방식에 따라 경로 길이와 지연 편차가 달라집니다. 따라서 CXL 규격의 주소와 순서 처리 규칙만으로 칩 수준의 일정한 응답 시간을 보장할 수는 없습니다.

랙 안에서 장비와 케이블을 배치하는 방식도 지연 편차와 냉각 효율을 함께 바꿉니다. 수직 배선은 경로를 짧게 만들지만 공기 흐름을 방해하고, 수평 배선은 냉각에 유리한 대신 케이블이 길어집니다. 스위치 트레이를 랙 중앙에 놓으면 각 장치까지 이어지는 케이블 길이의 차이를 줄일 수 있습니다. 가속기와 CPU 트레이의 발열, 메모리 트레이가 차지하는 배선 공간, 온도 변화에 따른 신호 품질도 함께 고려해야 합니다. 이 구조에서는 랙과 케이블의 물리적 배치도 지연 설계의 일부입니다.
공유 주소 공간이 넓어지면 잘못된 설정이나 권한 관리 실패가 미치는 범위도 커집니다. 여러 사용자가 자원을 나눠 쓰는 환경에서는 사용자별 격리 영역을 정하고, 장치와 스위치가 접근 권한을 하드웨어에서 검사해야 합니다. 전송 구간은 CXL IDE(Integrity and Data Encryption)로 보호합니다. 캐시 일관성을 공유한다고 접근 권한까지 공유되는 것은 아닙니다. 핫플러그도 장치를 전기적으로 연결하고 분리하는 기능만으로 끝나지 않습니다. 접근 승인과 장치 검증, 작업 복구 정책이 함께 있어야 실제 운영에 사용할 수 있습니다.
광 연결은 기존 전기 패브릭을 한 번에 대체하기보다 필요한 구간부터 단계적으로 도입될 가능성이 큽니다. CXL-over-optics는 상위 프로토콜의 주소 체계와 순서 규칙을 유지하면서 연결 거리를 늘릴 수 있다는 장점이 있습니다. 그러나 도입 시기는 광소자의 성능뿐 아니라 링크 밀도와 패키징, 장비 인증, 공급망, 운영 도구, 총소유비용에 달려 있습니다. 초기에는 랙 사이의 장거리 구간에 광을 쓰고 랙 내부에는 구리를 유지하는 혼합 구성이 현실적입니다. 전기·광 링크를 함께 관리하려면 패브릭 전체를 감시하고 검증하며 재구성하는 기능도 자동화해야 합니다.
우리의 평가: Nature Reviews가 다룬 데이터센터 아키텍처
이 논문은 CXL을 다뤘다는 사실만으로 평가하기 어렵습니다. Nature Reviews Electrical Engineering의 리뷰는 편집부가 주제를 정해 집필을 의뢰하고, 이미 나온 연구를 정리하는 동시에 앞으로 풀어야 할 문제를 제시합니다[6]. Nature Portfolio의 Computing 컬렉션에서도 소자와 새로운 컴퓨팅 방식, AI 응용을 다룬 글은 많지만, 캐시 일관성과 스위치 마이크로아키텍처, 랙 배치를 하나의 데이터센터 아키텍처 문제로 다룬 글은 드뭅니다[7]. 이번 리뷰는 서버와 랙을 단순히 더 큰 네트워크로 보지 않고, 칩 안에서 사용하던 주소·순서·지연 관리 원칙을 데이터센터까지 확장하는 문제를 Nature Reviews의 독립된 주제로 제시했습니다.
Meta Infra가 참여했다는 점도 중요합니다. Meta의 공개 AI 연구 목록은 약 2천 편에 이르지만, Nature 계열 저널은 주된 발표 경로가 아닙니다[8]. 이번 리뷰에서는 대규모 AI 시스템을 운영하는 Meta Infra의 요구 조건과 파네시아가 CXL 패브릭 컨트롤러와 링크 가속 유닛(LAU)을 실리콘으로 구현하며 얻은 설계 경험을 함께 다룹니다. 운영 환경에서 필요한 조건과 실제로 구현할 수 있는 하드웨어를 같은 구조 안에서 설명했기 때문에, CXL 규격의 기능을 정리한 글과는 성격이 다릅니다.
핵심은 NVLink와 스케일아웃 네트워크를 다른 링크로 대체하자는 데 있지 않습니다. NVLink는 랙 안에서 높은 대역폭과 짧은 지연을 제공하고, 이더넷 또는 InfiniBand는 여러 랙 사이의 통신을 확장합니다. 그러나 하나의 AI 작업이 두 영역에 걸치면 주소와 트랜잭션 순서, 장애 복구를 서로 다른 체계에서 관리해야 합니다. 원칩형 CXL 패브릭은 이러한 규칙을 하나의 하드웨어 관리 영역에 넣습니다. 따라서 비교 기준도 링크의 최고 속도에서 시스템 전체의 예측 가능성과 장애 처리 범위로 바뀝니다.
수치는 이 구조가 바꾸는 시스템 경계를 구체적으로 보여 줍니다. CXL.cache 조건에서 CPU 한 개가 직접 관리하는 가속기는 2개에서 16개로 8배 늘어납니다. 이러한 CPU 그룹 약 60개를 같은 주소와 트랜잭션 순서 규칙으로 연결하면, 최대 960개 가속기가 별도의 스케일아웃 RDMA 네트워크 영역을 거치지 않는 하나의 스케일업 코히어런스 도메인에서 동작합니다. 단일 CXL 패브릭은 별도로 최대 4,096개 장치를 주소로 구분하며, 홉 수가 고정된 하드웨어 경로는 수백 나노초급 접근 시간을 제공합니다. 이 네 수치가 함께 의미하는 변화는 서버를 연결한 네트워크형 시스템에서 데이터센터 규모의 시스템 버스로 넘어가는 것입니다.
시스템 설계자는 네 가지를 하나의 문제로 다뤄야 합니다. 꼬리 지연이 있는 환경의 실제 학습 처리량, 수백 개 가속기가 만드는 일관성 트래픽, 실행 중 장치를 제거한 뒤 작업을 복구하는 과정, 6~7개 랙을 연결하는 데 필요한 전력과 배선 비용입니다. 이를 함께 설계하면 ‘칩 하나처럼 동작하는 데이터센터’는 비유를 넘어, 대규모 AI 시스템의 성능과 복구 범위, 확장 비용을 판단하는 아키텍처 기준이 됩니다.
출처와 저작권 안내
이 글은 Silicon & Systems가 작성한 편집 요약입니다. 리뷰의 논지와 수치를 우리 표현으로 다시 서술했으며, 게재본의 문장과 도판, 표 배열, 용어 해설을 복제하지 않았습니다. 모든 도판은 이 글을 위해 독립적으로 제작했습니다. 전체 도판과 참고문헌을 포함한 정본은 DOI 10.1038/s44287-026-00315-5에서 확인할 수 있습니다. 원문 저작권은 (c) Springer Nature Limited 2026에 있습니다.