클라우드 RDMA 가상화는 네이티브 성능과 테넌트 격리 사이의 선택으로 설명되는 경우가 많습니다. Alibaba의 Stellar 논문은 일반적인 SR-IOV 경로가 서로 다른 세 한계를 묶는다고 봅니다[1]. 가상 기능은 컨테이너가 실행되기 전에 호스트 메모리와 장치 상태를 예약합니다. GPU Direct RDMA는 호스트 네트워크와 충돌할 수 있는 PCIe 주소 변환 설정에 의존합니다. 큐 페어는 패브릭에 수십 개의 동일 비용 경로가 있어도 적은 수의 경로만 사용합니다.
Stellar는 세 계층을 함께 바꿉니다. 호스트의 반가상화 직접 메모리 접근(PVDMA)은 DMA가 처음 접근한 게스트 페이지만 고정합니다. RNIC의 확장 메모리 변환 표(eMTT)는 주소가 호스트 메모리인지 GPU 메모리인지 기록하고 맞는 PCIe 경로를 선택합니다. 패브릭에서는 연결 하나의 패킷을 128개 경로에 분산하고 짧은 재전송 타임아웃으로 장애를 복구합니다. Alibaba는 400G FPGA RNIC로 구현했으며 서버리스 AI 플랫폼에서 1년 이상 운영한 결과를 제시했습니다.
이 결과는 기존 호스트에 새로운 혼잡 제어 하나를 붙인 것이 아니라는 점에서 중요합니다. 가상화, PCIe 주소 변환, 다중 경로를 함께 설계해야 시작 시간과 GPU 접근, 네트워크 큐가 같이 개선됩니다. 다만 한 클라우드 구조에서 회사가 보고한 결과입니다. 메커니즘은 구체적이지만 다른 하이퍼바이저, RNIC, 토폴로지, 모델 병렬화에도 같은 개선율이 나온다고 볼 수는 없습니다.
AI 인스턴스 밀도를 제한하는 SR-IOV
SR-IOV 가상 기능은 게스트가 하드웨어에 직접 I/O를 제출하므로 효율적으로 보입니다. 비용은 실제 작업이 시작되기 전에 발생합니다. VFIO는 장치가 다른 테넌트 메모리에 DMA하지 못하도록 게스트 물리 주소 영역을 고정하고 IOMMU 매핑을 설치합니다. AI 컨테이너에 수백 GB 또는 수 TB를 배정하면 설정 시간과 고정된 호스트 메모리가 실제 접근한 페이지가 아니라 구성한 용량에 따라 늘어납니다.
하드웨어 가상 기능 수에는 별도의 상한이 있습니다. Alibaba가 설명한 서버에서는 RNIC 네 개와 GPU 여덟 개가 PCIe 스위치 네 개 뒤에 있습니다. 배포 구성에서 RNIC 하나가 가상 기능을 최대 여덟 개 제공해 서버당 32개가 상한이지만, 프로덕션 GPU 서버는 수백 개의 가상 인스턴스를 요구할 수 있습니다. 가상 기능이 늘면 RNIC 컨텍스트와 흐름 조정 자원도 사용합니다. 가상화 단위가 작업의 생명주기와 관계없는 고정 하드웨어 할당이 됩니다.
PVDMA는 이 선행 할당을 반가상화 방식으로 바꿉니다. 컨테이너 시작 시 Stellar를 위해 게스트 메모리를 고정하지 않습니다. 게스트 물리 영역에 첫 DMA가 발생하면 게스트와 하이퍼바이저 경로가 해당 호스트 페이지를 IOMMU에 등록하고 매핑을 캐시에 둡니다. 이후 전송은 같은 매핑을 재사용합니다. 논문은 매핑 캐시 크기와 등록 빈도의 균형을 위해 2MiB 단위를 사용합니다.
필요 시 매핑은 정확성 문제를 만듭니다. 장치 레지스터는 4KB 단위로 매핑되는데, 2MiB DMA 매핑이 이를 포함할 수 있습니다. 가상 주소가 재사용된 뒤 낡은 매핑이 남으면 GPU 명령 큐가 RNIC 도어벨 메모리를 잘못 가리킬 수 있습니다. Stellar는 주소 공간과 수명을 분리해 PVDMA 매핑이 직접 매핑된 장치 레지스터와 겹치지 않도록 합니다. 작은 페이지의 MMIO와 큰 페이지의 DMA를 함께 사용할 때 겹치지 않음을 하이퍼바이저가 보장해야 지연 매핑이 안전합니다.
메모리 유형까지 구분하는 GPU Direct 경로
GPU Direct RDMA는 RNIC가 GPU 메모리에 접근해 호스트 복사를 피합니다. 가상화 서버의 주소는 루트 컴플렉스, PCIe 스위치, IOMMU, 장치 변환 캐시를 거칠 수 있습니다. Alibaba는 GPU Direct 성능을 유지하려고 주소 변환 서비스를 켜고 IOMMU 모드를 바꿨을 때 호스트 TCP 경로가 느려지는 현상을 관찰했습니다. 하나의 PCIe 전역 설정으로 서로 다른 두 메모리 대상을 처리한 결과입니다.
Stellar는 RNIC 메모리 변환 표에 목적지 유형을 추가합니다. 호스트 메모리는 일반 IOMMU 보호 경로를 따릅니다. GPU 메모리는 eMTT 정보를 이용해 직접 피어 경로를 선택하고 루트 컴플렉스 변환과 주소 변환 캐시 미스를 피합니다. 서버 전체를 한 PCIe 모드로 고정하지 않고 등록한 메모리 영역마다 RNIC가 경로를 고릅니다.

이 메커니즘은 GPU에만 한정되지 않습니다. 서로 다른 PCIe 분기 뒤의 장치가 다른 변환과 격리 규칙을 요구할 때 공통 주소 표는 하나의 절충을 강요합니다. I/O 변환 판단에 메모리 유형을 포함하면 RNIC가 보호를 유지하면서 대상에 맞는 경로를 고를 수 있습니다. 그 대가로 클라우드 전용 NIC의 하드웨어와 제어 계층이 복잡해집니다.
복잡한 네 경로보다 단순한 128개 경로
대형 AI 집단 통신은 규칙적이면서 동시에 시작되는 트래픽을 만듭니다. 여러 흐름이 적은 링크에 해시되면 동일 비용 경로가 남아 있어도 큐가 길어집니다. Stellar는 BestRTT, 라운드 로빈, 동적 가중 라운드 로빈, 흐름 단위 선택, 무관측 패킷 분산을 연결당 네 경로와 128개 경로에서 평가했습니다. 네 경로에서는 알고리즘 차이가 컸지만, 128개에서는 대부분의 다중 경로 방식의 큐 동작이 비슷해졌습니다. 많은 경로를 쓰는 것 자체가 토폴로지를 넓게 덮기 때문입니다.
Alibaba 네트워크에는 집선 스위치가 60개 있습니다. 논문은 128개 경로에 가까워져야 포트 부하가 균형화됐다고 설명합니다. Stellar는 단순한 무관측 패킷 분산과 모든 경로가 공유하는 하나의 혼잡 제어 상태를 선택했습니다. 경로마다 혼잡 윈도를 두면 RNIC 상태가 크게 늘고 지원할 경로 수가 줄어듭니다.
평가에는 5초 동안 실행하고 5초 동안 쉬는 배경 트래픽 아래의 512-GPU AllReduce가 포함됩니다. 128개 경로는 네 경로보다 버스트 영향을 잘 흡수했고, 무관측 분산은 라운드 로빈보다 안정적이었습니다. 960-GPU AllReduce에서는 한 링크에 1%와 3%의 패킷 손실을 주입했습니다. 128개 경로가 손실을 연결 전체로 희석해 눈에 띄는 성능 저하가 거의 없었고, 링크 전체 장애는 짧은 재전송 타임아웃으로 처리했습니다.
패킷 분산에는 재정렬과 손실·지연 경로를 구분하는 전송 계층이 필요합니다. 토폴로지에 충분한 경로 다양성이 있다는 전제도 있습니다. 작은 네트워크에는 128개 경로가 필요하지 않을 수 있고, 불규칙한 작업은 혼잡을 관찰하는 알고리즘이 더 유리할 수 있습니다. 저자들도 향후 작업 형태가 바뀌면 더 정교한 알고리즘이 필요하다고 설명합니다. 운영 결과의 의미는 무관측 방식이 항상 최적이라는 것이 아니라 RNIC 상태와 토폴로지를 함께 설계하면 많은 경로가 단순한 알고리즘을 안정적으로 만들 수 있다는 점입니다.
서로 다른 분모를 가진 운영 수치
Stellar 구조는 최대 64,000개의 가상 장치를 지원하며 vStellar 장치를 약 1.5초에 만듭니다. 통제된 실험에서 컨테이너 시작은 최대 30× 빨라졌습니다. 1년 이상의 운영 모니터링에서는 전체 컨테이너 경로를 포함해 15× 단축을 보고했습니다. 구성 메모리가 160GB에서 1.6TB로 늘어도 PVDMA 적용 시작 시간은 20초 아래였으며, 남은 11초 증가는 vStellar가 아니라 일반 하이퍼바이저 작업으로 설명됩니다.
운영 배포에서는 평균 RDMA 처리량이 1.37% 높아지고 스위치 큐 길이가 90% 줄었으며 평균 학습 속도가 14% 개선됐다고 보고했습니다. 세부 학습 비교에서는 평가한 프레임워크와 모델에서 평균 6%, 최대 14%의 개선이 제시됩니다. 모집단이 다른 수치이므로, 장기 평균 바이트 처리량보다 네트워크 혼잡의 꼬리 영역이 크게 바뀌고 통신 비중이 큰 학습이 더 많은 이점을 얻었다고 읽는 편이 안전합니다.

큐가 90% 줄었다고 애플리케이션이 90% 빨라지는 것은 아닙니다. 큐 점유는 중간 네트워크 상태입니다. 평균 처리량 1.37%와 학습 최대 14%가 함께 나올 수 있는 이유는 동기식 집단 통신이 가장 늦은 참여자와 일시적인 혼잡에 민감하기 때문입니다. 큐의 꼬리를 줄이면 장기 바이트 평균은 거의 바뀌지 않아도 배리어로 묶인 학습 단계는 짧아질 수 있습니다.
Alibaba 환경에 결합된 구현 조건
Stellar는 FPGA RNIC, 반가상화 게스트 드라이버, 하이퍼바이저 변경, 수정된 변환 표, 알려진 듀얼 플레인 멀티레일 토폴로지, RDMA 전송 제어에 의존합니다. 프로그래머블 변환 기능이 없는 상용 NIC 펌웨어만 사용하는 클라우드는 eMTT를 소프트웨어로 재현하기 어렵습니다. 수정하지 않은 SR-IOV 게스트가 필요한 고객은 반가상화 인터페이스를 받아들이지 않을 수 있습니다. Alibaba가 AI 플랫폼의 집단 통신 패턴과 라우팅 구조를 알고 있다는 점도 배포에 유리했습니다.
PVDMA는 고정 비용을 시작 시점에서 첫 접근으로 옮깁니다. 배정받은 메모리 대부분을 즉시 접근하는 작업은 비용이 사라지기보다 이동할 수 있지만, 사용하지 않는 용량의 고정은 피합니다. 지연 매핑에는 캐시 크기와 안전한 회수가 필요합니다. 2MiB 단위는 RDMA의 특성이 아니라 선택한 동작점입니다. eMTT의 메모리 유형은 GPU 할당과 해제에 맞춰 일관되게 관리해야 합니다. 패킷 분산은 재정렬 버퍼, 순서 번호, 복구 작업을 더합니다.
호스트, NIC, 패브릭을 한 운영자가 소유하고 큰 서비스 전체에 비용을 나눌 수 있다면 이러한 복잡성을 감당할 수 있습니다. RNIC, 하이퍼바이저, 스위치가 서로 다른 공급자에서 오는 환경에서는 적용이 더 어렵습니다. 따라서 이 논문은 그대로 설치할 수 있는 방법보다 수직 통합 설계의 운영 사례로서 가치가 큽니다.
전체 경로를 기준으로 한 RDMA 입장 제어
Stellar는 용량 계획의 단위를 바꿉니다. 가상 RDMA 장치는 가상 기능 수 하나가 아닙니다. 고정된 메모리, IOMMU 매핑, RNIC 변환 및 재정렬 상태, PCIe 피어 경로, 패브릭 경로의 일부를 함께 사용합니다. 하나라도 과도하게 공유하면 명목상 사용 가능한 가상 NIC가 AI 집단 통신에서는 제대로 동작하지 않을 수 있습니다.
RDMA 가상화를 평가하는 운영자는 적어도 네 단계를 측정해야 합니다. 컨테이너 실행 전 시간과 고정된 바이트, 첫 접근의 등록 비용, 필요한 격리 모드에서 GPU와 NIC 사이 처리량, 버스트 배경 트래픽 아래의 집단 통신 단계 시간입니다. 링크 처리량만 보면 Stellar가 가장 큰 이점을 찾은 시작 시간과 큐 꼬리를 놓칩니다.
AI 네트워크 성능은 패킷이 네트워크에 들어가기 전부터 결정됩니다. 호스트 메모리 등록이 시작 가능 범위를 정하고, PCIe 변환이 GPU Direct의 직접 경로를 결정하며, 경로 수가 설치된 패브릭 링크를 하나의 동기식 작업이 실제로 쓸 수 있는지 정합니다. Alibaba의 기여는 이를 서로 다른 팀의 설정 세 개가 아니라 하나의 RDMA 제품으로 다룬 데 있습니다.
출처와 저작권 안내
이 글은 Silicon & Systems가 작성한 편집 분석입니다. 원문의 메커니즘, 운영 측정, 적용 한계를 우리 표현으로 다시 썼습니다. 원문의 문장, 표, 도판은 재수록하지 않았고 이 페이지의 도판은 모두 새로 만들었습니다. 원문은 ACM DOI에서 확인할 수 있습니다. 저자가 저작권을 보유하며 ACM에 출판권이 허락되었습니다. 2025.