GPU 클라우드는 이미 두 통신 계층에 비용을 지불합니다. 스케일업 패브릭은 서버나 밀접한 가속기 영역 안을 연결하고, Ethernet 또는 InfiniBand는 호스트와 랙 사이를 잇습니다. 집단 통신 라이브러리는 같은 스케일업 영역의 GPU 사이에서는 주로 첫 번째 경로를 선택합니다. 그동안 스케일아웃 NIC와 스위치에 여유가 있어도 같은 전송에는 참여하지 않습니다.
MPCCS는 하나의 집단 통신이 두 경로를 동시에 쓸 수 있는지 시험합니다. 패킷을 단순히 두 링크에 해시하는 문제는 아닙니다. 두 경로는 대역폭, 지연시간, 순서 보장, 토폴로지와 소프트웨어에 드러나는 상태가 다릅니다. 하드웨어 오프로딩 인터페이스는 전송 상태를 내부에 숨기고, 집단 통신에서는 종속된 플로 하나가 늦어도 모든 작업자가 기다립니다. MPCCS는 하드웨어 위에서 윈도와 코플로를 조정합니다.
완료 시간을 함께 줄이는 두 경로
올리듀스, 올게더, 리듀스스캐터와 올투올은 서로 의존하는 전송 묶음을 만듭니다. 링 올리듀스는 여러 단계의 리듀스스캐터와 올게더를 순서대로 진행합니다. 일부 바이트를 두 번째 네트워크로 보냈더라도 두 조각의 완료 시간이 크게 다르면 다음 단계는 여전히 늦은 쪽을 기다립니다. 잘못된 분할은 병목을 없애지 않고 위치만 바꿉니다.
스케일업 경로가 일반적으로 빠르지만 무한한 자원은 아니며 다른 GPU와 집단 통신이 공유합니다. 스케일아웃 경로는 왕복 지연시간이 길어도 독립적인 일부 데이터를 운반할 수 있습니다. 기여도는 대역폭·지연시간 곱(BDP), 혼잡, 메시지 크기와 집단 통신의 의존관계에 따라 달라집니다. 고정된 80:20 분할은 어느 한쪽의 부하가 바뀌면 최적값에서 벗어납니다.
MPCCS는 집단 통신 런타임에 두 개의 논리적 전송 윈도를 둡니다. 하나는 스케일업 인터페이스, 다른 하나는 스케일아웃 인터페이스로 데이터를 보냅니다. NIC와 가속기 패브릭 내부 상태를 모두 읽지 않아도 하드웨어가 받을 수 있는 경계에서 바이트 범위를 나누고 완료 의미를 유지합니다.

하드웨어가 숨긴 가용 용량 추정
소프트웨어 다중 경로 전송은 왕복 시간과 실제 처리량을 보고 분할 비율을 바꿀 수 있습니다. 하드웨어 오프로딩은 이 상태의 상당 부분을 숨깁니다. MPCCS는 윈도에서 관찰할 수 있는 진행량으로 유효 BDP를 추정합니다. 각 경로에 유지할 데이터 양을 정하고 혼잡이나 메시지 특성이 바뀌면 다시 조절합니다.
대역폭만 봐서는 부족합니다. 대역폭이 높아도 피드백이 늦은 경로는 충분히 큰 윈도가 있어야 채워지고, 작은 메시지는 두 번째 경로가 기여하기 전에 빠른 경로에서 끝날 수 있습니다. 제어기는 전송률과 지연시간을 함께 보고 두 네트워크의 부하가 변할 때 분할 비율이 계속 흔들리지 않게 해야 합니다.
두 번째 네트워크가 항상 유리하지 않은 이유도 여기 있습니다. 짧은 집단 통신은 설정과 동기화 비용을 회수하지 못하고, 스케일아웃 네트워크가 혼잡하면 사용하지 않는 편이 낫습니다. NIC 경로가 PCIe 복사를 추가하면 병렬 전송의 이점이 사라질 수 있습니다. 측정 결과에 따라 거의 모든 데이터를 다시 한쪽 경로에 보낼 수 있어야 합니다.
집단 통신 진행을 지키는 코플로
집단 통신에는 같은 단계가 끝나야 가치가 생기는 여러 플로가 있습니다. 각 플로의 처리량만 독립적으로 높이면 두 번째 네트워크의 느린 하나가 남아 다음 단계를 막을 수 있습니다. MPCCS는 관련 전송을 코플로로 묶고 다중 경로 결정을 함께 조정합니다. 목표는 플로 처리량의 합이 아니라 집단 통신 단계의 완료 시간입니다.
저자들은 이 메커니즘이 여러 집단 통신 형태에 적용된다고 설명합니다. 정확성을 지키려면 각 바이트 범위가 한 번 도착하고 리덕션과 순서 규칙이 유지돼야 합니다. 성능을 얻으려면 두 경로의 조각이 비슷한 시점에 끝나야 합니다. 코플로는 공통 제어 단위가 되고 실제 바이트는 각 윈도가 운반합니다.
집단 통신 라이브러리와 프레임워크는 여전히 알고리즘과 작업자 토폴로지를 선택합니다. MPCCS는 여기에 경로 분할을 추가합니다. 한 스케일업 계층에 최적화된 알고리즘은 스케일아웃 용량을 같은 단계에서 쓸 때 최적이 아닐 수 있습니다. 실제 통합에서는 알고리즘과 채널 수, 경로 비율을 함께 찾아야 합니다.
미세 벤치마크와 학습 결과의 차이
통신 미세 벤치마크는 기본 NCCL보다 23~54% 빨랐고, 종단 LLM 학습은 시험한 구성에서 10% 넘게 가속됐으므로 응용 수준의 개선폭이 더 작은 것은 예상할 수 있습니다. 연산과 입력 처리, 옵티마이저, 두 경로에 나눌 수 없는 통신은 그대로 남습니다. 실제 분모는 줄어든 집단 통신 시간이 아니라 완료된 학습 단계입니다.
논문은 실제 시험 장치와 시뮬레이션을 함께 사용해 하드웨어와 규모 조건을 넓혔습니다. 따라서 실측과 시뮬레이션 결과를 구분해야 합니다. 최대 미세 벤치마크 배율을 랙 전체 학습 개선으로 사용해서는 안 됩니다. 모델 병렬화, 텐서 크기, 집단 통신 종류, 연산 대비 통신 비중, 네트워크 경쟁과 작업 배치가 종단 결과를 바꿉니다.
비교 대상의 NCCL 버전과 토폴로지 설정도 중요합니다. 최신 라이브러리는 같은 네트워크 종류 안에서 여러 레일을 사용할 수 있습니다. MPCCS의 독자적인 기여는 스케일업과 스케일아웃 계층을 동시에 쓴다는 점이지, 모든 기본 NCCL 설정이 계속 54% 느리다는 주장은 아닙니다. 재현할 때는 라이브러리, 드라이버, 펌웨어, 알고리즘과 채널 설정을 고정해야 합니다.
장애와 혼잡, 운영 주체
두 경로를 사용하면 장애 범위도 넓어집니다. 한 통신 계층이 재설정될 때 어느 윈도의 바이트가 도착했는지, 남은 경로에서 계속할 수 있는지 판단해야 합니다. 하드웨어 오프로딩 전송은 투명한 이동에 필요한 상태를 충분히 제공하지 않을 수 있습니다. 알려진 경계에서 작업을 실패시키고 다시 실행하는 편이 완료를 추정하는 것보다 안전할 수 있습니다.
혼잡 격리도 달라집니다. 스케일아웃 Ethernet은 스토리지와 사용자 트래픽, 다른 분산 작업을 함께 처리할 수 있습니다. 같은 서버 안의 집단 통신을 위해 대역폭을 빌리면 별도로 계획한 작업을 방해할 수 있습니다. 서비스 등급과 입장 제어가 추가 트래픽의 비용을 반영해야 하며, 한 학습 작업의 최단 시간이 클러스터 전체 처리량의 최적값은 아닙니다.
가속기 런타임 팀은 집단 통신 의미를 관리하고, 네트워크 팀은 라우팅과 혼잡을 관리하며, 클라우드 스케줄러는 작업을 배치합니다. MPCCS는 세 팀이 공유하는 계측과 롤백 절차가 필요합니다. 공통 사건 기록이 없으면 네트워크 부하에 따라 달라진 경로 비율이 응용의 설명되지 않은 변화로 보일 수 있습니다.
이중 패브릭의 인수 시험
하드웨어 사양에는 두 경로를 동시에 쓸 때의 제약이 필요합니다. 스케일업과 스케일아웃 대역폭이 각각 높아도 PCIe 스위치, DMA 엔진, 메모리 컨트롤러나 전력 한도를 공유할 수 있습니다. 링크 속도를 더한 값은 실제 동시 처리량을 부풀릴 수 있습니다. 같은 집단 통신을 두 경로에 보내며 전달 바이트, GPU 복사 엔진, 호스트 메모리와 학습 진행을 함께 측정해야 합니다.
작은 메시지와 큰 메시지, 집단 통신 종류, 변화하는 배경 트래픽과 일부 링크 장애를 시험에 넣어야 합니다. 최고 안정 상태 처리량뿐 아니라 제어기가 새 비율에 도달하는 시간과 실제 경로 분포를 기록합니다. 큰 올리듀스에는 도움이 되지만 지연시간에 민감한 올투올을 늦춘다면 작업별 입장 정책이 필요합니다.
소프트웨어와 운영 복잡도도 비용입니다. 10%의 학습 개선은 큰 장비군에서 가치가 있지만 디버깅과 혼잡 정책, 장애 복구를 감당할 수 있어야 합니다. 반대로 이미 설치된 스케일아웃 네트워크를 활용하면 모든 스케일업 영역을 교체하는 것보다 낮은 비용으로 용량을 늘릴 수 있습니다.
두 링크 사양을 하나의 자원으로 만드는 조건
MPCCS는 네트워크 계층이 배타적인 사용을 강제하지 않는다는 점을 보여 줍니다. 독립된 윈도를 제어하고 실제 가용 용량을 추정하며 단계 완료를 결정하는 플로들을 동기화하면 스케일아웃 경로도 스케일업 집단 통신을 도울 수 있습니다.
GPU 클라우드가 제시해야 할 숫자도 달라집니다. 두 링크의 최고 사양은 실제 혼잡과 장애에서 함께 스케줄링할 수 있어야 하나의 자원이 됩니다. 비교할 지표는 두 계층이 함께 만든 학습 단계당 유효 집단 통신 용량입니다. 이 제어가 있으면 쉬고 있던 NIC가 가속기 대역폭으로 바뀌지만, 없으면 두 번째 네트워크의 최고 속도는 집단 통신을 줄이지 못하는 별도 자산으로 남습니다.
출처와 저작권 안내
이 글은 EuroSys 2026 논문[1]을 우리 표현으로 다시 분석한 편집 다이제스트입니다. 논문의 문장·도판·표를 옮기지 않았으며, 본문 도판은 Silicon & Systems가 새로 제작했습니다. 시험 장치의 측정값과 시뮬레이션 결과를 구분해 해석했습니다. 원 논문의 저작권은 저자에게 있고 출판권은 ACM(2026)에 허여됐으며, 논문은 CC BY-NC-ND 4.0으로 배포됩니다.