클라우드 운영자는 이미지 배포, 접근 통제, 사용량 정산과 복구를 위해 가상머신을 사용합니다. 대규모 모델 학습은 GPU 메모리에서 네트워크까지의 경로를 짧게 유지해야 합니다. 일반 가상 NIC는 두 목표 사이에 호스트 복사와 소프트웨어 스위치를 넣습니다. Vela는 사용자에게 보이는 실행 경계를 가상머신으로 유지하면서 주요 데이터가 호스트를 거의 거치지 않게 설계했습니다.
ASPLOS 2025 논문은 IBM이 약 2년 6개월 동안 운영한 A100 기반 시스템을 설명합니다. KVM이 게스트 경계를 제공하고, GPU와 SR-IOV 가상 기능이 장치에 직접 연결됩니다. GPU Direct RDMA는 NIC가 GPU 메모리와 바로 데이터를 주고받게 하며 RoCE는 Ethernet 위에서 이를 운반합니다. 독점 스케일업 장비가 아니라 상용 서버와 네트워크를 통합해 운영한 경험이 기여입니다.
가상화가 보존해야 하는 데이터 경로
장치를 직접 할당하지 않으면 GPU 집단 통신은 장치 메모리, 호스트 메모리, 가상 스위치, 호스트 네트워크 스택과 물리 NIC를 차례로 지날 수 있습니다. 복사와 인터럽트, CPU 스케줄링과 주소 변환이 지연시간을 늘리고 대역폭을 사용합니다. 다른 호스트 작업의 영향을 받기도 합니다. 분산 학습은 매 단계에서 이 경로를 반복하므로 작은 전송 비용도 모든 GPU의 동기화 대기로 확대됩니다.
SR-IOV는 물리 NIC를 여러 가상 기능으로 나눠 게스트에 할당합니다. IOMMU와 장치 할당은 DMA 주소를 격리하면서 주요 경로의 소프트웨어 스위치를 피합니다. GPU Direct RDMA는 이 직접 경로를 GPU 메모리까지 연장합니다. 제어 환경은 가상화돼 있지만 실제 데이터는 호스트 버퍼에 머물지 않고 GPU와 NIC 사이를 이동합니다.
RoCE는 네트워크 조건을 추가합니다. RDMA는 낮은 손실과 예측 가능한 혼잡 제어가 필요하지만 일반 Ethernet은 동시에 패킷이 몰리면 버릴 수 있습니다. 우선순위 흐름 제어, ECN, 라우팅, 버퍼와 대기열 정책을 하나의 패브릭으로 설계해야 합니다. NIC를 직접 연결해도 네트워크가 집단 통신의 순간 트래픽을 멈추게 하면 성능은 나오지 않습니다.

클라우드 API에 포함되는 물리 배치
장치 직접 할당은 물리 토폴로지를 스케줄러에 드러냅니다. GPU와 NIC, PCIe 스위치, CPU 소켓과 NUMA 메모리는 서로 바꿔 쓸 수 있는 동일한 자원이 아닙니다. GPU 8개를 받았더라도 NIC가 다른 루트 컴플렉스 뒤에 있으면 네트워크에 가기 전에 CPU 인터커넥트를 건널 수 있습니다. 클라우드 제어기는 장치 수를 따로 세지 말고 토폴로지가 맞는 묶음을 배정해야 합니다.
Vela에서는 배포와 성능이 연결됩니다. 이미지와 수명주기는 클라우드 방식으로 관리하면서 GPU와 NIC의 인접성, 네트워크 레일을 지킵니다. 펌웨어, 드라이버, CUDA, OFED와 게스트 커널 조합도 함께 검증해야 합니다. 일반 서버용 가상머신 스냅샷이나 실시간 이동 기능은 할당된 GPU와 RDMA 대기열을 투명하게 옮길 수 있다고 가정할 수 없습니다.
사용자는 가상머신을 보지만 실제 정비 단위는 서버 트레이와 랙입니다. 케이블과 NIC, 스위치 장애와 열 제한은 게스트 아래에서 발생합니다. 다른 사용자의 자원을 노출하지 않으면서도 학습 작업자를 물리 부품에 연결하는 자산 정보가 필요합니다.

1,500 GPU 확장 결과의 의미
Vela는 약 1,500개 GPU에서 모델 병렬화를 사용해 500억 매개변수 디코더 모델을 학습할 때 이상적인 선형 확장 대비 약 80%의 처리량을 냈습니다. High-Performance Linpack은 단일 가상머신의 GPU당 FLOPS와 비교해 약 70%를 유지했습니다. 두 비율은 다른 질문에 답합니다. 모델 학습은 실제 통신과 소프트웨어 스택을 포함하고, HPL은 규칙적인 수치 연산에서 확장 기준을 제공합니다.
논문과 IBM 기술 자료는 TCP, RoCE와 GPU Direct RoCE 경로도 비교합니다. IBM은 Ethernet에서 GPU Direct RDMA를 적용한 자사 업그레이드에서 네트워크 처리량이 2~4배, 지연시간이 6~10배 개선됐다고 설명합니다. 특정 구현의 변경 전후 결과이며 모든 TCP와 RoCE 클러스터 사이의 일반적인 비율은 아닙니다.
약 80% 확장은 해당 모델과 GPU 수, 병렬 구성에서 이상적 증가분의 약 5분의 1을 잃었다는 뜻입니다. 장비군 평균 GPU 사용률이나 서비스 가용성이 80%라는 의미는 아닙니다. 가상머신 경계가 실제 측정 경로에 포함됐는데도 일반 가상 네트워크 스택을 강제하지 않았다는 점이 중요합니다.
2년 6개월 운영에서 드러난 문제
장기 운영은 짧은 벤치마크가 놓치는 문제를 포함합니다. 드라이버와 펌웨어 변경은 장치 간 직접 접근을 바꿀 수 있고, 호스트 업데이트는 장치 할당을 재설정할 수 있습니다. 다른 트래픽을 위해 바꾼 스위치 설정이 RoCE 동작을 흔들기도 합니다. 부품 하나가 완전히 죽지 않고 느려지면 가상머신과 호스트 계측이 서로 다른 시스템에 나타납니다.
클라우드 운영에는 연결된 상태 정보가 필요합니다. GPU, NIC, PCIe나 패브릭 계측이 성능 저하를 보이면 가상머신 에이전트가 살아 있어도 스케줄러가 해당 호스트를 피해야 합니다. 학습 프레임워크에는 작업자 단위 장애가 필요하고 인프라 팀에는 물리 위치가 필요합니다. 복구는 고정된 가상머신 이미지와 체크포인트를 유지하되 교체 하드웨어가 달라질 수 있게 해야 합니다.
정비 방식도 다릅니다. 베어메탈은 펌웨어와 진단 기능을 직접 노출하기 쉽고, 가상화 클러스터는 검증된 이미지를 배포하며 호스트 변경에서 사용자를 분리할 수 있습니다. 장치 직접 할당은 일반 가상머신처럼 자유로운 실시간 이동을 어렵게 하므로 Vela 계열 시스템은 이동성보다 재현 가능한 배포와 빠른 프로비저닝을 얻습니다.
하이퍼바이저 밖의 격리
KVM은 CPU와 메모리 주소를 격리하고 IOMMU는 DMA 범위를 제한하지만, 스위치와 NIC 대기열, PCIe 링크, 전력과 냉각은 여전히 공유됩니다. 이웃 작업은 메모리를 침범하지 않고도 집단 통신 지연시간을 바꿀 수 있습니다. AI 클라우드 SLO에는 물리 경로의 성능 격리와 계측이 포함돼야 합니다.
RoCE 설정은 장애를 넓힐 수도 있습니다. 혼잡을 제한하지 못하면 우선순위 흐름 제어의 일시 정지가 여러 링크로 번질 수 있습니다. ECN 임곗값과 혼잡 제어는 스위치 버퍼와 트래픽에 맞아야 합니다. 여러 레일의 라우팅은 RDMA 플로의 순서를 깨뜨리지 않으면서 부하를 나눠야 합니다. 게스트 밖의 제어가 실제 통신 성능을 결정합니다.
보안 검토에는 NIC 펌웨어, 가상 기능 재설정, IOMMU 그룹과 피어 메모리 등록이 들어갑니다. 게스트에 직접 접근을 허용하면 호스트 개입을 줄여 성능을 얻는 대신 하드웨어 격리와 검증된 드라이버에 더 의존합니다. 성능 측정만으로 이 검토를 대신할 수 없습니다.
베어메탈과의 공정한 비교
하드웨어와 모델, 병렬화, 소프트웨어 버전과 네트워크 설정을 맞춘 뒤 가상머신과 검증된 베어메탈 경로를 비교해야 합니다. 커널 미세 벤치마크만으로는 부족합니다. 메시지 크기별 집단 통신, 경쟁 트래픽에서의 꼬리 지연시간, 전체 학습 처리량, 장애 복구, 이미지 배포와 정비 시간을 포함해야 합니다.
비용에는 한 작업 밖의 활용률도 들어갑니다. 가상화는 일정한 이미지와 멀티테넌트 배정으로 작업 준비 시간을 줄일 수 있습니다. 반대로 GPU와 NIC 묶음이 대기 작업에 맞지 않으면 장치 조각화가 생깁니다. 베어메탈이 한 작업은 조금 빠르지만 장비군 활용률이 낮을 수 있고 그 반대도 가능합니다. 가용성 목표를 지키면서 랙과 운영자 시간당 완료한 학습 작업이 실제 분모입니다.
새 가속기에서는 검증을 다시 수행해야 합니다. A100 결과가 NVLink, PCIe, NIC와 보안 기능이 다른 H100, H200이나 이후 GPU를 보장하지 않습니다. 유지되는 원칙은 특정 설정이 아니라 직접 데이터 경로를 보존하고 실제 토폴로지를 확인하는 방법입니다.
가상화 AI 클러스터의 선택 기준
Vela는 가상화 오버헤드가 가상머신에 붙는 하나의 비율이 아님을 보여 줍니다. 집단 통신이 호스트 버퍼와 소프트웨어 스위치를 지나면 비용이 지배적일 수 있습니다. GPU와 SR-IOV NIC를 맞는 토폴로지로 할당하고 GPU Direct를 조정된 RoCE 패브릭에 연결하면 클라우드 경계와 대규모 학습이 함께 동작할 수 있습니다.
운영자가 소유해야 할 범위는 넓습니다. 토폴로지 배치, 장치와 펌웨어 검증, 혼잡 제어, 작업자와 물리 부품을 잇는 계측, 체크포인트 복구와 보안이 하나의 묶음입니다. 이 시스템이 없으면 장치 직접 할당은 관리되지 않는 베어메탈을 가상머신 뒤에 숨길 뿐입니다. 모두 갖추면 가상화는 GPU 네트워크의 짧은 경로를 둘러싼 운영 인터페이스가 됩니다. 이것이 Vela의 1,500 GPU 결과가 남기는 설계 기준입니다.
출처와 저작권 안내
이 글은 ASPLOS 2025 논문[1]과 IBM 기술 자료[2][3]를 우리 표현으로 다시 분석한 편집 다이제스트입니다. 논문의 문장·도판·표를 옮기지 않았으며, 본문 도판은 Silicon & Systems가 새로 제작했습니다. 랙 재질 도판은 개념적 구성으로 실제 제품을 나타내지 않습니다. 원 논문의 저작권은 저자에게 있고 출판권은 ACM(2025)에 허여됐습니다.