CXL 메모리 접근에 시간이 얼마나 걸리는지 독립적인 측정 팀 다섯에게 물으면 답이 좁게 모입니다. 2024~2025년 사이 발표된 연구들에서 시판 확장 장치의 1홉 왕복 지연은 265~442 ns입니다[3][4]. 경로에 스위치를 넣으면 이 지연은 대략 두 배가 되는데, 스위치를 지나는 요청이 DRAM에 닿기 전에 컨트롤러 파이프라인을 최소 두 번 통과하고 라우팅까지 거치기 때문입니다. 업계는 여기서 당연한 운영 결론을 끌어냈습니다. 하이퍼스케일러는 CXL을 1:1 직결로 쓰고, 여러 호스트가 한 장치를 나눠야 하면 멀티헤드 장치(MHD)를 찾으며, 메모리 풀이 있으면 스위치 자체가 필요 없다는 주장까지 나왔습니다[5]. “CXL 패브릭은 느리다”는 측정 결과가 어느새 설계 전제로 굳었습니다.

ISCA 2026에서 발표된 파네시아(Panmnesia)의 논문은 이 전제가 원인을 잘못 짚었다고 주장합니다[1]. 프로토콜 자체는 메모리 시맨틱을 위해 설계되었습니다. PCIe의 가변 길이 패킷 대신 고정 256 B 플릿을 쓰고, 완료 패킷 왕복이 없으며, 이론적인 왕복 예산은 PCIe보다 4~10× 낮습니다. 저자들은 오늘날의 제품이 이 잠재력을 충분히 활용하지 못하는 이유를 PCIe IP 라이브러리에서 물려받은 컨트롤러 실리콘에서 찾습니다. 이 구조가 계층화된 파이프라인과 경계 버퍼링, 호스트 중심 라우팅을 CXL에 다시 가져오기 때문입니다. 해법은 소프트웨어 계층을 하나 더 추가하는 것이 아니라 실리콘을 다시 설계하는 것입니다. 연구진은 프로토콜 스택을 파이프라인 하나로 통합한 컨트롤러와, 변환·라우팅 경로 전체를 고정 사이클 하드웨어로 처리하는 포트 기반 라우팅(PBR) 스위치를 4nm 공정으로 제작했습니다. 아래에서는 그 논지를 우리 표현으로 정리하고, 어디까지가 실리콘 측정이며 어디부터가 보정된 에뮬레이션인지 구분합니다. 먼저 밝혀 둘 것이 있습니다. 이 논문은 본지 편집인이 CEO이자 공저자로 참여한 파네시아의 연구입니다. 우리의 평가는 그 이해관계를 감안해 읽어 주기 바랍니다(자세한 내용은 글 말미에 있습니다).

두 가지 라우팅과 과도기 구현

CXL의 확장성 이야기는 규격 스스로 만든 갈림길에서 출발합니다. 계층 기반 라우팅(HBR)은 PCIe 트리를 그대로 반영합니다. 호스트마다 자기 장치를 담은 가상 스위치를 소유하고, 주소 공간은 호스트별로 갇히며, 계층을 가로지르는 공유는 없습니다. 포트 기반 라우팅은 스위치의 모든 포트에 포트 ID(PID)를 부여하고 목적지 ID로 포워딩합니다. 호스트와 가속기, 메모리 장치가 하나의 평평한 패브릭에 놓이고, 패브릭 매니저가 이를 전역 주소·일관성 도메인으로 매핑합니다. 스위치 캐스케이딩과 임의 토폴로지를 가능하게 하는 것이 PBR이고, CXL 3.1에서 표준에 들어왔습니다[2]. 그러나 2024~2025년에 출하된 컨트롤러와 스위치 대부분은 여전히 HBR 전용이며, 논문은 그 결과를 수치로 보여 줍니다. 스위치 간 연결이 없는 HBR 패브릭은 256레인 예산에서 8노드가 상한입니다.

과도기 해법인 MHD는 여러 논리 헤드를 장치 하나에 넣어 스위치 없이 여러 호스트를 연결합니다[6]. 그러나 실제 장치의 헤드 수는 4개 안팎입니다. 헤드마다 완전한 컨트롤러 인터페이스가 필요하고 다이 면적은 제한되기 때문입니다. 헤드들은 일관성 도메인을 공유하지 않으므로 호스트 간 데이터 공유에는 소프트웨어 플러시나 NUMA 트랜잭션이 필요합니다. 또한 장치 하나의 대역폭을 활성 헤드들이 나눠 쓰므로 호스트가 늘면 호스트당 대역폭이 줄어듭니다. 용량을 모으는 일과 하드웨어 속도로 데이터를 공유하는 일은 서로 다른 문제입니다.

클록 도메인 하나로 합친 컨트롤러

논문의 첫 번째 기여는 컨트롤러 스택 자체를 다시 설계한 데 있습니다. 전형적인 PCIe 유래 컨트롤러는 독립된 파이프라인 세 개를 이어 붙인 구조입니다. 물리 계층(SerDes와 PCS), 신뢰성을 맡는 데이터 링크 계층, 프로토콜의 동작 규칙을 맡는 트랜잭션 계층이 각자 버퍼를 갖고 인접 계층과 핸드셰이크로 동기화합니다. 왕복 지연의 상당 부분은 배선보다 이 경계를 지날 때 발생합니다. 제안된 컨트롤러는 세 계층을 단일 클록 도메인과 단일 타이밍 기준에서 실행하고, 인터페이스 단계마다 버퍼를 두는 대신 공유 버퍼링을 사용합니다.

절감 내역은 항목별로 제시됩니다. PCS에서는 송수신 클록 차이를 흡수하기 위해 엘라스틱 버퍼를 절반 채워 두는 기존 방식(half-full)이 데이터가 준비된 순간에도 추가 대기 사이클을 만듭니다. 제안한 nominal-empty 방식은 비어 있는 버퍼도 유효 상태로 취급해 실시간 클록 정렬을 허용하고 평균 15~20 ns를 줄입니다. 링크 계층은 프레임 구조상 일부 데이터가 도착한 시점부터 오류를 확인할 수 있는 256 B 플릿을 사용해, 수신 측이 전체 프레임을 기다리지 않고 처리를 시작합니다. 기존 256 B 플릿 구현보다 5~10 ns가 추가로 줄어듭니다. 신호 품질이 좋을 때는 순방향 오류 정정(FEC)을 우회하는 모드도 작동합니다. 마지막으로 트랜잭션 계층은 CXL.io, CXL.cache, CXL.mem의 프로토콜별 큐를 하나의 흐름 제어·스케줄링 엔진으로 통합해 혼합 트래픽 처리량을 최대 1.3× 높입니다. 계층을 통합한 결과, 실리콘 평가 기준 컨트롤러 왕복 지연은 50 ns 아래로 내려가고 링크 대역폭은 25% 높아지며 버스트 부하의 지연 편차도 줄어듭니다.

PCIe 유래 컨트롤러가 시간을 쓰는 곳. 물리 계층, 데이터 링크, 트랜잭션, 통합 스케줄러가 하나의 연속된 하드웨어 파이프라인에서 동작합니다. nominal-empty 엘라스틱 버퍼가 15~20 ns, 플릿 조기 검증이 5~10 ns를 줄이고, 통합 스케줄링은 혼합 트래픽 처리량을 최대 1.3× 높이며, 깨끗한 링크에서는 FEC 우회가 작동합니다. 실측한 컨트롤러 왕복 지연은 50 ns 미만입니다. 이 글을 위해 새로 만든 도판.

펌웨어 호출이 아니라 파이프라인 스테이지인 라우팅

두 번째 기여는 스위치가 입구와 출구 사이에서 수행하는 작업을 고정 사이클 하드웨어로 옮긴 것입니다. 각 포트에는 도착 트래픽이 HBR인지 PBR인지 구분하는 분류기, 출발지·목적지 PID를 계산해 헤더를 내부 PBR 형식으로 바꾸는 변환 로직, 기존 호스트로 나가는 패킷을 위한 역방향 매핑이 들어 있습니다. 포워딩은 하드웨어 테이블 두 개를 참조합니다. 목적지 PID 라우팅 테이블(DRT)은 고정 지연 조회로 출구 포트를 결정하고, 라우팅 그룹 테이블(RGT)은 같은 목적지에 도달할 수 있는 포트들의 혼잡을 확인해 경로를 선택합니다. 두 테이블은 조회와 갱신을 동시에 처리하므로 토폴로지 변경과 링크 복구 중에도 기존 트래픽을 멈추지 않습니다. 패브릭 수준의 타이밍 메커니즘은 인접 스위치들을 여러 홉을 거치는 동작에 맞춰 정렬합니다.

주목할 점은 설계 목표가 순수한 속도가 아니라 결정론(determinism)으로 서술된다는 것입니다. 경로 어디에도 펌웨어, 인터럽트, 마이크로코드 스케줄링이 없으므로 모든 패킷이 혼잡 아래에서도, 홉을 거듭해도 같은 파이프라인 스테이지를 유계 지연 안에 통과합니다. 논문의 나머지가 기대는 성질이 바로 이것입니다. 홉당 지연이 포트 수에도, 토폴로지 깊이에도, 관리 코어의 상태에도 좌우되지 않는 패브릭입니다.

포트 뱅크로 조립한 스위치

세 번째 기여는 이 부품들을 패브릭 스위치로 조립한 데 있습니다. 다이는 포트 뱅크 단위로 구성되며, 각 뱅크에는 통합 컨트롤러와 변환·라우팅 로직이 짝을 이뤄 들어갑니다. 비차단 네트워크온칩(NoC)은 이들을 하나의 타이밍 도메인에서 연결합니다. 포트는 지연 특성을 바꾸지 않고 넓은 인터페이스로 합치거나 좁은 포트로 나눌 수 있습니다. 가상 CXL 스위치(VCS)는 단일 루트와 다중 루트 구성을 모두 지원하고, 하드웨어 동적 포트 바인딩이 호스트 사이의 대역폭과 주소 공간을 배분합니다. MHD도 헤드마다 독립 접속점을 갖는 정식 구성 요소로 지원됩니다. 프로토타입은 4nm 공정으로 제작되어 1.0 GHz로 동작하고 SoC 전력 예산은 약 20 W이며, 64 Gbps PAM4 SerDes를 구동합니다. 이는 CXL 3.2에 필요한 PCIe 6.0 물리 계층에 해당합니다. 논문은 사전 양산 단계의 스위치를 2026년 여름에 고객이 시험할 수 있도록 제공할 계획이라고 밝혔습니다.

4 nm 퓨전 스위치 다이의 개념적 하드웨어 도판. 대칭 포트 뱅크 여덟 개가 중앙의 고정 사이클 NoC와 요청 순서 제어 로직을 둘러싸고, 각 뱅크에서 논블로킹 코어까지의 타이밍 기준이 비슷하도록 배선을 균형 있게 배치했습니다. 논문이 제시한 동작점은 1.0 GHz와 약 20 W입니다. 실제 다이 사진이나 축척에 맞춘 물리 설계도는 아닙니다. 이 글을 위해 새로 만든 도판.

포트 뱅크에서 패브릭까지. HBR은 호스트를 각자의 트리에 가두고 스위치 간 연결 없는 패브릭을 8노드로 제한하지만, PBR은 호스트·가속기·메모리를 PID로 주소화되는 단일 영역에 두어 64노드까지 캐스케이드합니다. 각 포트 뱅크는 트래픽을 분류·변환하고, DRT로 출구를 결정하고, RGT로 경로를 선택하고, 논블로킹 NoC를 건넙니다. 전 과정이 펌웨어 없는 고정 사이클 하드웨어입니다. 이 글을 위해 새로 만든 도판.

논문에 제시된 고객 평가 일정은 이미 실행 단계에 들어갔습니다. 파네시아는 2026년 4월부터 제품화한 설계의 사전 양산 패키지 칩을 조기 접근 파트너에게 공급하기 시작했고, 제품명은 PCIe 6.4-CXL 3.2 퓨전 스위치입니다. 발표 내용은 논문의 아키텍처와 대응합니다. 한 다이에서 PBR과 HBR을 함께 처리하고, 캐스케이드 스위치가 여러 랙의 장치를 이더넷으로 전환하지 않은 채 하나의 패브릭으로 연결합니다. 접속 대상은 PCIe 장치와 CXL Type 1, Type 2, Type 3 장치를 모두 포함하며, 자체 컨트롤러는 수십 나노초 수준의 지연을 목표로 합니다. 아래 사진의 패키지 칩은 논문의 다이 마이크로그래프로 제시된 파이프라인이 고객 평가용 실리콘으로 제작됐음을 보여 줍니다.

출하 트레이에 담긴 PCIe 6.4-CXL 3.2 퓨전 스위치의 프리릴리스 실리콘. 패키지마다 일련번호가 새겨진 PanSwitch 칩이 담겨 있고, 화면 위 문구는 PBR-HBR 겸용 라우팅, 멀티 랙 캐스케이딩, PCIe 장치와 CXL Type 1/2/3 장치 연결 등 제조사의 기능 요약입니다. 사진 제공: Panmnesia.

측정 결과와 적용 범위

평가 플랫폼은 주의 깊게 읽어야 합니다. 컨트롤러와 포트별 파이프라인은 측정 가능한 4nm 실리콘으로 제작됐고, 논문에는 다이 마이크로그래프도 실려 있습니다. 반면 시스템 수준 수치는 그 실리콘에서 추출한 타이밍 파라미터(버스 타이밍과 파이프라인 깊이)로 보정하고 Memory Latency Checker 데이터와 대조한 사이클 정확 RTL 에뮬레이션에서 나옵니다. 저자들은 그 이유를 분명히 밝힙니다. CXL 3.2에 필요한 PCIe 6.0 물리 계층을 제공하는 상용 CPU가 아직 없고, CXL 2.0 세대 프로세서는 다중 호스트 공유 시험에 필요한 CXL.cache를 완전하게 지원하지 않습니다. 테스트베드는 128코어 노드 네 대와 10 TB 스토리지 노드를 모델링합니다. 분산 PostgreSQL 17은 하드웨어 일관성을 이용해 모든 노드가 쓰기를 받고 다른 노드가 캐시한 데이터를 재사용하도록 수정했습니다.

일곱 기준 구성은 축약된 이름보다 실험의 의도를 더 잘 보여 줍니다. 네 구성은 장치를 직접 연결합니다. 한 노드와 단일 헤드 장치 하나, 서로 분리된 노드·장치 쌍 네 개, 그리고 MHD를 전용 헤드 또는 소프트웨어 공유 방식으로 사용한 경우입니다. 나머지 세 구성은 노드 네 대와 장치 네 개를 스위치 뒤에 둡니다. 첫 번째는 기존 HBR 스위치와 컨트롤러를 유지하고, 두 번째는 스위치만 PBR로 바꾸며, 마지막은 PBR과 통합 컨트롤러를 함께 사용합니다. 따라서 메모리 공유의 효과, 라우팅 방식의 효과, 컨트롤러 파이프라인의 비용을 차례로 분리해 볼 수 있습니다.

논문의 평가 결과를 읽는 방법. a, 실측한 4 nm 컨트롤러에서 시작해 실리콘 타이밍으로 사이클 정확 RTL을 보정한 뒤 노드 네 대의 데이터베이스 실험을 수행합니다. 50 ns 미만의 컨트롤러 지연은 실리콘 수준의 결과이지만 데이터베이스 수치는 에뮬레이션 결과입니다. b, 일곱 기준 구성은 직결과 스위치 연결, 전용과 공유 메모리, HBR과 PBR, 기존 컨트롤러와 통합 컨트롤러를 한 조건씩 바꿉니다. 이 글을 위해 새로 만든 도판.

이 증거의 연결 관계를 구분해야 결과를 과대 해석하지 않습니다. 실리콘 측정은 짧은 컨트롤러 파이프라인을 실제로 제작하고 목표 타이밍에 맞출 수 있음을 보여 줍니다. 보정 모델은 그 부품으로 시스템을 구성했을 때의 동작을 추정합니다. 아직 실제 CXL 3.2 랙의 케이블 특성, 호스트 상호운용성, 펌웨어 성숙도, 장애 복구까지 입증한 것은 아닙니다. 보정하지 않은 시뮬레이션보다 근거가 강하지만, 운영 시스템에서 직접 잰 결과보다는 적용 범위가 좁습니다.

이 조건에서 대표 마이크로벤치마크 결과는 아키텍처 절의 주장과 맞아떨어집니다. 기존 HBR 스위치 경로는 직결 확장 장치 대비 왕복 지연이 2.8×인데, PBR 스위치로 바꾸면 약 35%가 회수되고, 통합 컨트롤러까지 결합하면 전체가 53% 줄어듭니다. 2.1× 감소입니다. TPC-C에서는 메모리 공유가 스토리지·RDMA 대기(히트율 낮은 트랜잭션에서 전체 지연의 41%)를 줄이고, 완성형 설계는 기존 스위치 대비 평균 지연을 42% 낮춥니다. 꼬리 지연도 같은 방향으로 움직입니다. p99가 p50의 1.9×인 직결 기준 구성과 비교하면 제안 스택은 p50을 29%, p99를 58% 낮춥니다. 열두 개 작업부하의 처리량은 단일 노드 기준의 4.8×로, 기존 스위치의 3.4×보다 높습니다. 노드 수를 늘린 실험에서는 캐스케이드 스위치를 통해 64노드까지 거의 선형으로 확장됩니다. 반면 고립된 확장 장치는 3.7×에서 증가가 멈추고, 전용 MHD는 대역폭이 나뉘면서 1노드에서 4노드로 늘릴 때 오히려 35% 낮아집니다. 쓰기 위주 YCSB-A에서는 포트 기반 스케줄링이 대역폭 활용률을 95% 이상으로 유지하며 전용 MHD의 4× 처리량을 냅니다. 동시성이 올라가도 패브릭은 512개 인스턴스를 처리하면서 부하가 낮거나 높을 때 모두 가장 짧은 지연을 유지합니다. NUMA 실험에서는 소켓별 메모리 경로를 공유 풀로 통합해 소켓 사이의 홉을 없앴습니다. 그 결과 소켓에 따라 최대 1.7×까지 지연이 늘어나는 단일 접속 장치와 달리 모든 소켓에서 지연이 일정하게 유지됐습니다.

측정과 에뮬레이션의 결과. a, 직결 확장 장치로 정규화한 스위치 왕복 지연은 기존 HBR 경로 2.8×, PBR 스위치 1.8×, PBR과 통합 컨트롤러 조합 1.3×입니다. b, 주요 시스템 결과는 스위치 왕복 지연 53% 감소, TPC-C p99 지연 58% 감소, 단일 노드 대비 열두 작업부하 처리량 4.8×, 쓰기 균형화에서 대역폭 활용률 95% 초과, 전용 MHD 대비 처리량 4×, 그리고 모델에서 확인한 64노드까지의 확장입니다. 이 글을 위해 새로 만든 도판.

실험으로 확인되지 않은 범위

검증 범위에는 두 가지 경계가 있습니다. 첫째, 50 ns 미만의 컨트롤러 지연과 파이프라인의 타이밍 동작은 실리콘에서 측정했지만, 종단 간 데이터베이스 수치는 보정한 에뮬레이션을 통해 얻었습니다. 실제 운영 랙에서 같은 결과가 나오는지는 PCIe 6.0 물리 계층과 완전한 CXL.cache를 갖춘 CPU가 나온 뒤 확인해야 합니다. 둘째, 패브릭을 활용한 소프트웨어는 수정된 버전입니다. PostgreSQL은 하드웨어 일관성을 이용해 동시 쓰기를 처리하도록 바뀌었으며, 일반적인 데이터베이스 생태계에는 아직 이런 변경이 적용되지 않았습니다. 본지가 다룬 배포 사례들은 이 두 경계의 반대편에 있습니다. Meta의 Vistara는 스위치를 피한 직결 확장을 출하했고, Beluga는 RDMA보다 빠르다는 이유로 CXL 2.0 스위치의 64 B당 약 750 ns를 받아들였습니다. 이 논문은 두 시스템이 우회한 스위치와 하드웨어 일관성 계층을 직접 다룹니다.

CXL 지연의 원인은 프로토콜보다 실리콘 구조

유보 조건을 감안해도 논문의 핵심 주장은 성립한다고 봅니다. 스위치를 지날 때 발생하는 약 2×의 추가 지연은 CXL 프로토콜 자체보다 PCIe에서 물려받은 실리콘 구조에서 비롯됩니다. 처음부터 설계한 컨트롤러는 스위치를 거치는 패브릭의 지연을 직결 경로에 더 가깝게 낮출 수 있습니다. 대표 결과 하나보다 나노초 단위의 절감 내역(엘라스틱 버퍼, 플릿 검증, 스케줄러 통합)이 더 설득력 있는 이유는 각 메커니즘을 따로 검증할 수 있기 때문입니다. 아직 입증되지 않은 부분은 생태계 전체의 변화를 요구합니다. CXL 3.2를 지원하는 호스트, 하드웨어 일관성을 활용하는 소프트웨어, 데이터센터 규모의 패브릭 관리가 필요합니다. 이 논문은 앞서 다룬 원칩 데이터센터 논증[7]의 부품 수준 연구로 읽힙니다. 그 리뷰가 패브릭 계층 구조를 제안했다면, 이 연구는 그 구조의 스위치에 해당하는 실리콘을 측정 결과와 함께 제시합니다. 이제 남은 변수는 스위치뿐 아니라 여기에 연결될 CPU와 소프트웨어 생태계입니다.

출처와 저작권 안내

이 글은 Silicon & Systems가 작성한 편집 요약으로, 아래 논문의 논지를 우리 표현으로 재서술한 것입니다. 논문의 문장, 도판, 표는 여기에 재수록하지 않았고, 별도 표기가 없는 한 이 페이지의 도판은 이 요약을 위해 새로 만들었습니다. 퓨전 스위치 사진은 파네시아가 제공했습니다. 논문은 ISCA 2026에서 발표되었으며, 공식 판본은 ISCA 2026 프로시딩에 수록됩니다. (c) IEEE 2026.

이해관계 고지: 이 논문은 파네시아의 연구이며, Silicon & Systems의 편집인은 파네시아의 CEO이자 원 논문의 공저자입니다. 따라서 이 요약은 우리 팀의 연구를 스스로 다룬 글이고, 위의 비판적 언급들도 그 맥락에서 제시한 것입니다.