AI 인프라의 설계 단위는 칩에서 랙으로 넓어지고 있습니다. 랙 안의 가속기 수백 개가 서로의 메모리에 접근하는 방식은 전체 시스템 비용과 성능을 함께 결정합니다. UALink 콘소시엄이 의뢰한 분석은 1억 달러 규모 배치에서 인터커넥트 비용을 1,500만~2,500만 달러로 추정합니다[2]. NVIDIA는 NVLink를 이미 출하하고 있으며, UALink에는 2024년 10월 이후 AMD, Intel, Synopsys, Alibaba, AWS, Google, Meta, Microsoft, Apple, Astera Labs, Cisco, HPE 등 115개 이상의 회원사가 참여했습니다. 콘소시엄은 2025년 4월 200G 1.0 규격과 백서를 공개했고[1], 2026년 1월에는 NVLink와 이더넷 계열 구조를 직접 비교한 제3자 분석 보고서를 냈습니다[2]. 이 글은 두 문서를 바탕으로 UALink를 NVLink, 이더넷 기반 표준, 화웨이 Unified Bus와 같은 기준에서 비교합니다.

홍보 표현을 제외하면 규격은 구체적이고 검증 가능한 조건을 담고 있습니다. UALink는 메모리 시맨틱 패브릭입니다. 가속기는 57비트 패브릭 주소 공간(128PB)을 상대로 64~256바이트의 읽기·쓰기·원자 연산을 발행하고, 순서 모델은 가속기 로컬 메모리와 동일하게 유지됩니다. 따라서 최대 1,024개 엔드포인트의 파드를 네트워크가 아니라 하나의 큰 장치처럼 프로그래밍할 수 있습니다[1][2]. 엔드포인트마다 10비트 라우팅 식별자가 붙고, 스위치는 목적지 기준으로 라우팅하며, 스위치 포트를 분할해 파드를 서로 격리된 가상 파드들로 나눌 수 있습니다. 스택은 네 계층입니다. 프로토콜 인터페이스(UPLI)가 64바이트 플릿을 트랜잭션 계층에 넘기면 스트리밍 캐시로 주소를 압축하고, 데이터 링크 계층은 이를 열 개씩 묶어 CRC-32와 링크 수준 재전송이 보호하는 640바이트 플릿으로 만듭니다. 물리 계층은 플릿 하나를 RS(544,514) 순방향 오류 정정 코드워드 하나에 정렬해 레인당 212.5GT/s(데이터 200GT/s)의 표준 IEEE 802.3 신호로 내보냅니다. FEC 인터리빙을 줄여 지연을 낮춘 점이 표준 이더넷과 다른 부분 중 하나입니다[1].

설계 목표는 이 선택들에서 따라 나옵니다. 레인 4개가 방향당 800 Gbps의 스테이션을 이루고, 4미터 미만 구리 배선으로 1~4개 랙을 연결하는 범위에서 요청-응답 왕복은 1 µs 아래, 프로토콜 효율은 물리 대역폭의 93%를 목표로 합니다. 백서는 256바이트 쓰기와 완료 응답에서 플릿 21개 중 20개에 유효 데이터를 싣는 예를 제시합니다[1][2]. UALinkSec은 모든 프로토콜 채널의 종단 간 암호화와 인증을 규정하며, 물리적으로 접근한 공격자와 컨피덴셜 컴퓨팅의 신뢰 실행 환경(TEE)까지 고려합니다. 관리에는 별도 전용 스택 대신 SAI 기반 스위치 관리와 Redfish 기반 노드 관리를 사용하는 파드 컨트롤러를 둡니다.

짧은 거리의 UALink 도메인을 하드웨어 관점에서 그린 개념도. 가속기 엔드포인트 여덟 개가 중앙의 스케일업 스위치 플레인을 둘러싸고, 강조한 기판 배선은 4 m 미만 구리 링크라는 목표가 한 트레이 또는 인접한 소수의 랙에 맞는 이유를 보여 줍니다. 공개된 제품 배치를 재현한 그림이 아니며, 스위치 수와 패키징을 특정하지 않습니다. 이 글을 위해 새로 만든 도판.

1.0 문서들이 약속하는 것. a, 네 층 스택. 64바이트 트랜잭션 플릿과 주소 압축, CRC와 재전송이 붙는 640바이트 링크 플릿, RS(544,514) 코드워드당 플릿 하나를 212.5 GT/s 이더넷 시그널링으로 전송. b, 파드 모델. 10비트 ID를 가진 최대 1,024개 엔드포인트가 UALink 스위치 뒤에 서고, 포트 분할로 가상 파드를 만들며, UALinkSec 종단 간 보안과 SAI·Redfish 관리가 붙습니다. 목표치는 4 m 구리에서 1 µs 미만 왕복, 93% 프로토콜 효율, 4레인 스테이션당 방향별 800 Gbps. 이 글을 위해 새로 만든 도판.

규격의 범위 밖에 남은 항목도 분명합니다. 파드 간 통신은 포함하지 않으며, 링과 토러스 토폴로지의 교착 상태 회피는 구현자가 맡습니다. 집합 통신 라이브러리처럼 패브릭 위에서 동작하는 소프트웨어 계층도 회원사가 별도로 구현해야 합니다. 현재 공개된 성능 수치는 모델링과 프로토콜 시뮬레이션으로 검증한 목표값입니다. 2026년 1월 분석 보고서는 멀티벤더 실측 검증을 2026년에 진행하고 평가용 스위치 실리콘을 연말에 제공할 계획이라고 설명합니다[2]. 따라서 현재 확인된 것은 완성된 규격이며, 실리콘과 소프트웨어의 상호운용성은 후속 시험이 필요합니다.

기존 구조와 두 가지 공개 표준

NVLink는 이 문서들이 공통으로 사용하는 비교 기준입니다. 5세대 NVLink는 GPU당 1.8 TB/s를 제공하고 72-GPU NVSwitch 도메인이 양산 중이며, 로드맵은 576개 GPU까지 확장됩니다. 10년 동안 축적된 NCCL과 CUDA 소프트웨어도 규격 수치만으로 대체하기 어려운 강점입니다[2]. NVIDIA는 2025년 5월 NVLink Fusion을 발표해 선별된 파트너가 NVLink 호환 인터페이스를 구현하도록 허용했습니다. 콘소시엄 분석서는 Fusion이 인터페이스 사용 범위를 넓혔지만 인증, 기술 발전 방향, 파트너별 조건은 NVIDIA가 관리하므로 개방 표준과는 다르다고 지적합니다. 다만 대규모 배치에서 폐쇄형 패브릭이 구매 위험이 될 수 있음을 반영한 변화라는 점은 중요합니다.

이더넷 기반 스케일업 표준도 같은 시기에 구체화됐습니다. 2025년 6월 Ultra Ethernet 콘소시엄은 크레딧 기반 흐름 제어와 링크 계층 재시도를 포함한 1.0 규격을 냈고, 9월에는 Broadcom이 Scale-Up Ethernet 프레임워크를 OCP에 기고했으며, 10월에는 OCP가 ESUN 표준화 작업을 시작했습니다[4][5][6]. UALink와의 첫 차이는 주소 지정입니다. 이더넷 계열은 패브릭을 전송 계층으로 두고 주소 변환을 가속기 공급사가 구현하지만(SUE는 이를 명문화했습니다), UALink는 호환 장치가 공유하는 패브릭 수준 주소 공간을 정의합니다[2][4]. 두 번째 차이는 흐름 제어입니다. 이더넷의 CBFC는 링크마다 크레딧 루프를 두고, UALink는 각 경계에 독립 크레딧 도메인을 둡니다(1홉 경로에 여섯 개). UALink는 혼잡을 더 세밀하게 제어하는 대신 관리할 프로토콜 상태가 늘어납니다. Meta와 Microsoft는 UALink 이사회와 ESUN 양쪽에 참여하며, Broadcom은 두 생태계에 상용 실리콘을 공급할 수 있습니다.

양쪽 모두와 떨어져, 모두가 스펙으로만 그리는 규모에서 이미 운용 중인 시스템이 하나 있습니다. 화웨이의 CloudMatrix 384는 Ascend NPU 384개와 CPU 192개를 자체 Unified Bus로 단일 수퍼노드로 묶고, UB-Mesh 작업은 그 야심을 스케일업·스케일아웃 통합 프로토콜로 데이터센터 규모까지 늘립니다. 화웨이는 이를 개방하겠다고 밝혔습니다[8]. 생태계를 어떻게 평가하든, 이 지도에서 전망이 아니라 운영 환경 수퍼노드를 가진 항목은 이것뿐입니다.

같은 랙을 위한 네 가지 연결 구조. 2026년 초의 스케일업 선택지를 거버넌스(독점~개방)와 성숙도(출하~규격) 축으로 배치했습니다. NVLink는 GPU 72개 도메인을 출하하며 Fusion 라이선스를 제공합니다. Unified Bus는 칩 384개 운영 환경 수퍼노드에서 동작합니다. UALink는 공개 규격과 2026년 말 평가용 실리콘 계획을 제시했고, 이더넷 계열에는 UEC 1.0, SUE, ESUN이 있습니다. 이 글을 위해 새로 만든 도판.

2026년 8월 갱신: 두 공개 표준이 기능을 보완한 기능

이 글이 처음 실린 1월 이후 공개된 문서 두 건은 비교 구도를 바꿨습니다. 다만 어느 쪽도 배치된 실리콘의 증거는 아닙니다. UALink Common 2.0은 망 내 연산(in-network 연산)을 추가하고, 공통 프로토콜을 속도별 데이터 링크·물리 계층 문서와 분리했습니다[3]. 망 내 연산은 여러 가속기가 보낸 부분 결과를 스위치가 지나가는 길에 합치거나 변환하는 기능입니다. 모든 데이터를 목적지 가속기까지 보냈다가 다시 처리하는 것보다 지연시간과 링크 사용량을 줄일 수 있습니다. 이는 본문에서 UALink 1.0의 가장 큰 공백으로 지목한 부분에 대한 직접적인 답입니다. 그러나 집합 통신 라이브러리와 실제 스위치가 성능을 보여 주기 전까지는 여전히 규격상의 답입니다.

ESUN도 이니셔티브에서 문서로 넘어갔습니다. OCP는 출범 넉 달 뒤인 2026년 3월 10일 네트워크 연산자 Requirements Base Specification 1.0을 공개했습니다[5]. 이 문서는 Priority Flow 제어 또는 Credit-Based Flow 제어, 링크 수준 재시도, 작은 메시지의 부담을 줄이는 4바이트 ESUN 헤더를 요구합니다. UALink의 메모리 시맨틱 프로토콜과 역할은 다릅니다. ESUN은 운영자가 이더넷 스케일업 네트워크에 요구할 조건을 정하고, 가속기들이 공유할 주소 모델은 규정하지 않습니다. 따라서 이제 경쟁을 단순히 개방 대 독점으로 나누기는 어렵습니다. 메모리 시맨틱까지 표준화한 패브릭과, 상위 계층에서 벤더 자유도를 더 많이 남기는 간결한 이더넷 전송 방식 중 무엇을 택하느냐의 문제입니다.

구매자가 요구하는 기능은 이미 구체적인 조건

이 표준 경쟁을 판단할 기준은 이미 구매자 문서에 나와 있습니다. 딥시크의 ISCA 논문은 스케일업 도메인의 가치를 초당 토큰으로 환산했습니다. 디코드 상한은 400G NIC에서 초당 67토큰, NVL72급 도메인에서는 약 1,200토큰으로 계산됩니다[7]. 이어서 하드웨어 순서 보장을 제공하는 메모리 시맨틱, 펜스를 줄이는 획득·해제 연산, NVLink와 InfiniBand로 나뉜 실행 영역을 하나로 관리할 수 있는 구조를 요구합니다. MoE 디스패치와 컴바인을 위한 망 내 브로드캐스트와 리덕션도 포함됩니다. UALink 1.0은 이를 상위 소프트웨어에 맡겼지만 Common 2.0은 표준 안으로 가져왔습니다. 아직 실측은 없지만 구매자 요구에 대한 구체적인 응답입니다[3].

반대 방향의 선택지도 있습니다. InfiniteHBD는 링 올리듀스만 중요하다면 스위치 없이 NVL-72 인터커넥트 비용의 31%로 패브릭을 구성할 수 있다고 주장합니다[9]. 모든 장치 간 직접 통신도 실제 작업이 사용할 때만 비용을 정당화할 수 있다는 뜻입니다. CXL은 그 아래의 메모리 계층과 연결됩니다. UALink 분석서는 128PB 주소 공간에 분리형 메모리와 CXL 확장 메모리를 함께 고려합니다[2]. 따라서 원칩형 CXL 데이터센터와 UALink는 같은 역할을 두고 경쟁하기보다 서로 인접한 계층을 구성합니다.

규격 다음에 필요한 실리콘과 운영 증거

이제 공개 표준이 믿을 만한 규격을 제공할 수 있는지는 핵심 질문이 아닙니다. UALink와 ESUN 모두 문서를 내놓았습니다. 다음 증거는 하드웨어와 운영에서 나와야 합니다. UALink는 모델링한 93% 효율이 멀티벤더 실측에서도 유지되는지, Common 2.0의 망 내 연산을 집합 통신 라이브러리가 벤더별 우회로 없이 쓸 수 있는지, 비(非)NVLink 도메인의 첫 운영 환경 구매가 어디에서 나오는지를 봐야 합니다. ESUN은 4바이트 헤더, 무손실 동작, 다중 홉 혼잡 제어가 서로 다른 가속기의 주소·일관성 계층과 만났을 때도 단순성을 유지하는지가 시험대입니다. 2026년 NVLink의 우위는 SerDes만이 아니라 이미 출하한 시스템과 NCCL에서 나옵니다. 공개 표준은 아키텍처 점검표의 더 많은 칸을 채웠지만 수율, 상호운용성, 소프트웨어 성숙도, 총비용은 알려 주지 않습니다. 회원사 수가 아니라 이 네 가지 측정값이 실제 랙 도입을 결정할 것입니다.

규격만으로 배포 가능한 도메인이 되지는 않는 이유

링크와 트랜잭션, 관리 동작을 공개해도 랙 제품에는 상호운용 가능한 컨트롤러, 스위치, 케이블, 리타이머, 펌웨어, 텔레메트리, 복구 절차가 필요합니다. 첫 질문은 어떤 조합을 어느 규모에서 함께 시험했는지입니다. 회원사 목록이나 표준 로고는 다중 공급사 적합성 표를 대신하지 못합니다.

근거도 세 층으로 나눠야 합니다. 전기 계층은 실제 케이블과 커넥터 예산에서 거리와 오류율을 만족해야 합니다. 프로토콜 계층은 혼잡 아래 탐색, 순서, 흐름 제어, 재시도, 장애 격리를 보여 줘야 합니다. 시스템 계층은 링크나 끝단 하나가 실패하는 동안 목표 집합 통신과 메모리 접근을 실행해야 합니다. 첫 층만 통과하면 링크를 증명했을 뿐 운영 가능한 스케일업 도메인을 증명한 것이 아닙니다.

개방성은 부품을 바꿀 수 있는 경계에서 측정해야 할 이유

운영자가 전체 도메인을 교체하지 않고 케이블, 스위치, 끝단, 관리 API, 집합 통신 라이브러리 가운데 하나를 바꿀 수 있어야 공개 규격의 가치가 생깁니다. 각 경계에는 호환 동작과 혼합 공급사 장애를 찾을 텔레메트리가 필요합니다. 완성 스택 한 종류만 자격 시험을 통과한다면 프로토콜은 공개돼도 실제 시스템은 수직 통합 상태입니다.

반대로 선택 사항이 너무 많으면 개별 규격을 만족한 조합이 함께 예측 가능한 성능을 내지 못할 수 있습니다. 구매자가 시험할 하위 집합을 프로파일과 구현 합의로 정하는 것은 개방성을 줄이는 일이 아닙니다. 이 프로파일을 한 공급사, 광범위한 컨소시엄, 고객 주도의 자격 시험 가운데 누가 통제하는지가 중요합니다.

첫 배포에 필요한 복귀 경로

첫 랙은 새 도메인의 펌웨어나 공급 문제로 전체 학습 용량을 막지 않도록 장애를 랙 안에 가두고, 위쪽에는 기존 스케일아웃 네트워크를 유지해야 합니다. 스케줄러가 새 플랫폼과 기존 플랫폼에 같은 작업을 배치할 수 있으면 실제 비교와 단계적 확대가 가능합니다.

수용 보고에는 집합 통신의 유효 대역폭, 메시지 크기별 성능, 꼬리 지연, 링크 하나가 끊긴 조건, 복구 시간, 유효 대역폭당 전력, 소프트웨어 버전을 포함해야 합니다. UALink의 경쟁은 결국 랙 안에서 어느 부품을 독립적으로 바꿀 수 있게 만드는가에 달려 있습니다. 다중 공급사 시스템이 이 경계를 실증하기 전까지 규격은 방향과 협상력을 제공하고, 실제 용량은 제품 시험이 따로 증명해야 합니다.

출처와 이해관계 고지

이 글은 Silicon & Systems의 자체 분석으로, UALink 1.0과 Common 2.0 자료, 2026년 1월 의뢰 분석 보고서, OCP의 ESUN 1.0 공개 문서를 중심으로 작성했습니다. 원문의 문장, 표, 도판은 재사용하지 않았으며 이 페이지의 도판은 모두 이 글을 위해 새로 제작했습니다. 이해관계 고지: 본지 편집인은 CXL 패브릭 실리콘을 만드는 파네시아의 CEO입니다. 이 글은 CXL을 주변 계층으로만 다루지만 이 이해관계가 분석 관점에 영향을 줄 수 있습니다.