이더넷 스위치는 출력 큐 두 개 가운데 덜 찬 쪽을 골라도 잘못된 결정을 내릴 수 있습니다. 바로 다음 큐는 비었지만 그 뒤 링크가 이미 백그라운드 트래픽을 운반할 수 있기 때문입니다. 가속기 수천 장이 동시에 올투올 단계에 들어가면 로컬에서는 합리적인 여러 선택이 같은 먼 병목으로 모일 수 있습니다.

ByteDance, Broadcom, 대학 연구진이 SIGCOMM 2025에서 발표한 SGLB는 일반 스위치에 로컬 포트보다 넓지만 제한된 시야를 제공합니다[1]. SyncMesh라는 제어 프로토콜이 압축한 혼잡 정보를 나눕니다. 전역 부하 분산(GLB) 엔진은 경로를 고를 때 이 상태와 용량 및 장애 여부를 함께 계산합니다. 중앙 제어기가 패킷마다 길을 고르는 구조가 아니라 나쁜 전역 선택을 피할 만큼의 공통 문맥을 가진 분산 전달입니다.

프로토타입은 평가한 링크 장애에서 약 45마이크로초 만에 복구했고 올투올 통신을 최대 60% 높였습니다. 링크 하나가 혼잡한 32-GPU Llama 3 학습 시험에서 반복당 통신 시간은 1.177초에서 0.704초로 줄고 전체 반복 시간은 12.3% 감소했습니다. 이 결과는 메커니즘과 동작 조건을 입증하지만 장기 운영 텔레메트리는 아닙니다.

AI 집합 통신은 로컬 라우팅의 약점을 드러냅니다

ECMP는 혼잡을 보지 않고 흐름을 해시합니다. 단순하고 안정적이지만 여러 큰 흐름이 한 경로에서 충돌하는 동안 다른 경로가 빌 수 있습니다. 동적 부하 분산은 로컬 큐나 이용률을 보고 더 나은 결정을 내립니다. 그래도 가장 좋아 보이는 로컬 포트가 먼 혼잡 링크로 이어질 수 있습니다.

AI 학습 통신은 동기화된 버스트로 이 한계를 드러냅니다. 전문가 병렬화의 올투올은 다수 출발지와 목적지를 동시에 만듭니다. 올리듀스는 다른 계층 구조를 만듭니다. 한 집합 통신에 좋던 경로가 다음 단계에서 나빠질 수 있으며 정보가 도착하기 전에 버스트가 끝나지 않을 만큼 빠르게 적응해야 합니다.

장애는 두 번째 시간축입니다. 일반 라우팅이 죽은 링크를 제거하는 데 수초가 걸리면 큰 집합 통신은 그동안 패킷을 잃고 멈추거나 시간 초과될 수 있습니다. 인접 스위치의 빠른 장애 탐지는 도움이 되지만 먼 스위치도 일관된 대체 경로를 알아야 합니다. SGLB는 혼잡 배포와 장애 수렴을 하나의 전달 문제로 봅니다.

경로 용량이 다른 조건도 있습니다. 한 경로의 대역폭이 절반이라면 트래픽을 반씩 나누는 것이 오히려 처리량을 낮춥니다. 전역 혼잡 정보만으로 부족하고 각 경로가 운반할 수 있는 양을 가중해야 합니다.

SyncMesh는 전체 지도가 아니라 압축한 상태를 보냅니다

전역 가시성은 스위치 메모리와 충돌합니다. 가속기와 목적지가 수천 개인 패브릭에서 모든 흐름과 경로 상태를 모든 장비에 저장할 수 없습니다. 제어 메시지도 보호하는 링크의 의미 있는 대역폭을 차지하면 안 됩니다.

SyncMesh는 관심 목적지 스위치로 향하는 경로 구간만 상태로 유지합니다. 이웃 GLB 엔진이 로컬 변화를 교환하고 각 스위치는 선택할 대안의 압축된 혼잡 프로필을 계산합니다. 상태는 현재 학습 흐름 수가 아니라 토폴로지에 연결되므로 실행 작업이 늘어도 함께 커지지 않습니다.

평가 토폴로지에서 엔진 하나는 경로 구간 항목 1,024개를 유지합니다. 저자들의 축소 방식은 현재 하드웨어 제약에서 약 1만 GPU 규모를 목표로 합니다. 상태 표현의 확장성 분석이지 프로토타입이 그 수의 GPU로 운영됐다는 근거는 아닙니다.

갱신 간격은 설정할 수 있습니다. 1~20마이크로초 시험에서 완료 시간은 최적 조건의 98.5~100% 범위에 남았습니다. 제어 트래픽은 간격에 따라 링크 용량의 0.01~0.26%였습니다. 10마이크로초 간격의 버스트 시험에서는 고정 오버헤드 0.03%를 보고합니다.

그래도 상태에는 지연이 있습니다. 패킷이 프로필을 사용할 때에는 이미 과거 정보입니다. SGLB는 학습 버스트가 갱신 간격보다 길고 작은 상태 차이에 결정이 견딘다고 봅니다. 더 짧은 마이크로버스트나 많은 스위치의 동시 반응은 별도로 안정성을 시험해야 합니다.

AI 패브릭의 세 운영 계층. SGLB는 아래 패널입니다. SyncMesh가 압축한 경로 상태를 공유하고 스위치 GLB 엔진이 덜 혼잡한 경로를 고릅니다. SkeletonHunter와 ByteTracker는 진단 계층이며 문맥을 위해 함께 표시했습니다. 이 글을 위해 새로 만든 도판.

용량을 함께 봐야 느린 경로를 고르지 않습니다

GLB 엔진은 큐 점유율만 비교할 수 없습니다. 부하가 낮은 400 Gb/s 경로와 부하가 조금 높은 800 Gb/s 경로의 남은 용량은 다릅니다. SGLB는 경로 대역폭에 대한 혼잡을 표현하고 서로 다른 경로에 같은 비율로 보내지 않습니다.

장애 뒤에는 이 구분이 더 중요합니다. 링크 하나를 제거하면 일부 경로 그룹의 용량이 바뀝니다. 이전의 균등 가중치를 유지하면 남은 작은 그룹이 과부하됩니다. SyncMesh는 가용성과 바뀐 경로 상태를 함께 전파해 용량에 맞는 상태로 수렴시킵니다.

부하 분산 단위에도 교환 조건이 있습니다. 패킷별 선택은 가장 빠르게 반응하지만 순서를 바꿀 수 있습니다. 플로릿 라우팅은 가까이 이어진 패킷을 한 경로에 두고 간격이 생긴 뒤에만 바꿉니다. SGLB는 플로릿 모드에서도 기준보다 좋았지만 새 정보를 다음 플로릿까지 쓰지 못해 차이는 줄었습니다.

따라서 단위는 전송 계약의 일부입니다. 순서 뒤바뀜에 민감한 RDMA는 느린 적응을 받아들일 수 있습니다. 순서와 무관하게 배치할 수 있는 NIC는 더 세밀한 결정을 쓸 수 있습니다. 알고리즘 이름만 제시하고 패킷·플로릿·흐름 가운데 어느 단위인지 빼면 결과가 완전하지 않습니다.

집합 통신 종류가 보이는 이득을 결정합니다

시험 장비에서 세 방식 모두 혼잡을 넣기 전 800 Gb/s 링크의 약 636 Gb/s에 도달했습니다. 배경 부하가 커질수록 SGLB는 더 천천히 악화됐습니다. 부하 82%에서 정규화한 올투올 대역폭은 SGLB 48%, 로컬 동적 방식 55%, ECMP 65% 감소했습니다. 먼 병목이 강할수록 두 기준 대비 이점이 커졌습니다.

올리듀스는 다르게 동작했습니다. 평가 구현은 먼저 랙 안에서 리덕션하므로 주입한 leaf-ToR 병목을 지나는 트래픽 비율이 작습니다. 배경 부하 85%에서 정규화 대역폭은 SGLB 99.5%, 로컬 방식 67.6%, ECMP 57%였습니다. 모든 올리듀스가 혼잡과 무관하다는 뜻이 아니라 전역 경로 제어가 특정 원격 링크를 피하고 계층형 집합 통신이 노출을 제한한 결과입니다.

32-GPU Llama 3 시험은 통신을 애플리케이션 시간과 연결합니다. 양방향 500 Gb/s RDMA 배경 흐름을 한 링크에 넣었을 때 연산은 두 정책 모두 반복당 2.66초였습니다. 통신은 SGLB 0.704초, ECMP 1.177초였습니다. 연산 시간은 같으므로 전체 학습 반복 개선은 12.3%로 통신 차이보다 작았습니다.

따라서 최대 60%를 연산 중심 애플리케이션에 그대로 적용할 수 없습니다. 집합 통신 구성, 반복 중 통신 비율, 토폴로지, 배경 부하 위치, 라우팅 단위를 함께 제시해야 합니다.

근거 원장은 범위를 분리합니다. SGLB 열은 최소 45마이크로초의 경로 복구와 최대 60%의 올투올 개선이라는 프로토타입 결과입니다. 다른 열의 운영 배포 수치와 합칠 수 없습니다. 이 글을 위해 새로 만든 도판.

장애 수렴을 라우팅 프로토콜 아래로 내립니다

논문은 링크를 끈 시점부터 패킷 손실이 더 이상 관측되지 않을 때까지를 수렴 시간으로 측정합니다. 작은 시험 장비에서 BGP 기반 ECMP와 로컬 동적 방식은 1초 넘게 걸렸습니다. SGLB는 일반 라우팅 제어면을 기다리지 않고 실패 구간을 GLB 상태에서 제거해 1밀리초보다 빠르게 반응합니다.

정확한 값은 토폴로지에 따라 다릅니다. 2계층 spine-leaf 장애는 약 45마이크로초였습니다. 3계층의 같은 종류 장애는 관련 결정에 상태가 가까우면 약 1마이크로초였고, leaf-ToR 장애는 다시 약 45마이크로초였습니다. 최솟값을 모든 장애의 복구 시간처럼 제시하면 안 됩니다.

빠른 수렴은 운영자가 하드웨어 원인을 진단하기 전 구간을 보호합니다. 링크를 수리하거나 원인을 설명하지는 않습니다. 반복되는 우회 사건을 구성요소와 연결하고 불안정한 링크 주변의 진동을 막으며 언제 격리할지 정하는 모니터링이 필요합니다. SGLB는 느린 절차가 진행되는 동안 트래픽을 위한 시간을 삽니다.

스위치 수렴과 애플리케이션 복구도 구분해야 합니다. 손실이 사라진 시점 뒤에 전송 재시도와 집합 통신 완료가 이어질 수 있습니다. 운영 승인 시험은 스위치 수렴과 장애 뒤 첫 정상 집합 통신을 모두 측정해야 합니다.

전역 정보가 전역 진동을 만들 수 있습니다

공유 상태는 로컬 신호의 부족을 보완하지만 많은 스위치가 같은 지연된 프로필에 반응할 수 있습니다. 모두 비어 보이는 경로로 이동하면 새 혼잡을 만들고 다시 움직입니다. 논문의 버스트 시험은 평가 범위의 안정성을 보여 줄 뿐 모든 작업 구성과 상태 지연을 증명하지 않습니다.

여러 테넌트의 단계가 맞춰진 집합 통신, 유실·지연된 SyncMesh 메시지, 서로 다른 버전의 프로필, 반복되는 링크 플래핑을 시험해야 합니다. 경로 변경, 진동 폭, 작업 간 공정성, 패킷 순서, 제어 트래픽, 집합 통신 완료 시간을 함께 봐야 합니다. 평균 링크 이용률은 한 작업이 계속 밀려나는 현상을 숨길 수 있습니다.

장애 상태에는 히스테리시스도 필요합니다. 제어 전파보다 빠르게 up/down을 반복하는 링크는 경로를 흔듭니다. 복구 링크가 일정 시간 건강할 때까지 조금 더 바쁜 안정 경로를 유지할 수 있습니다. 일부 용량과 제어 안정성을 교환하는 정책입니다.

혼잡 요약은 클러스터 전체의 전달에 영향을 주므로 잘못된 스위치나 메시지도 격리해야 합니다. 상태 범위를 제한하고 메시지를 인증하며 버전을 기록하고 전역 정보가 사라질 때의 기본 경로를 마련해야 합니다.

구매 지표는 지킨 집합 통신 작업량입니다

최대 양분 대역폭만 비교하기보다 먼 병목, 다른 경로 용량, 링크 장애를 주입하며 대상 집합 통신 구성을 재생해야 합니다. 완료 시간, 학습 반복 시간, 패킷 손실, 순서 뒤바뀜, 수렴 시간을 측정하고 오래되거나 빠진 제어 상태에서도 반복합니다.

기준은 ECMP와 로컬 적응형 라우팅을 나눠야 합니다. 정적 해시보다 좋은 결과는 혼잡 인식의 가치를, 로컬 방식보다 좋은 결과는 먼 상태의 추가 가치를 보여 줍니다. 두 차이를 보면 전역 메커니즘이 필요한지 로컬 큐 개선이면 충분한지 판단할 수 있습니다.

하드웨어 가능성도 항목 수, 갱신 대역폭, 파이프라인 단계, 선택 단위, 실패 시 기본 동작으로 보고해야 합니다. 일반 장비에서 구현 가능하다는 말은 기존 프로그래머블 자원에 추상화가 들어간다는 뜻이지 설치된 모든 스위치가 GLB 엔진을 제공한다는 뜻은 아닙니다.

SGLB가 남기는 것은 정보 경계입니다. 로컬 큐는 빠르지만 불완전하고 중앙 전체 지도는 패킷 결정에 크고 느립니다. 자주 갱신하는 압축 경로 프로필이 그 사이에 있습니다. 프로필이 충분히 정확하고 제어 루프가 안정적이면 새 종단 간 라우팅 계산을 기다리지 않고도 일반 이더넷이 혼잡과 장애 동안 더 많은 집합 통신 작업을 지킬 수 있습니다.

마지막 승인 표로 주장을 감사할 수 있습니다. 정상 부하에서는 SyncMesh 비용과 비혼잡 집합 통신의 변화를 기록합니다. 먼 혼잡에서는 남은 경로 용량과 집합 통신별 완료 시간을, 비대칭 경로에서는 트래픽 비율과 작은 경로의 포화 여부를 봅니다. 하드 장애에서는 인접 탐지, GLB 수렴, 전송 복구, 첫 정상 애플리케이션 장벽을 분리합니다. 오래된 상태에서는 진동과 공정성을 측정합니다. 각 행이 전역 정보를 도입하는 서로 다른 이유를 시험합니다.

규모 표기도 함께 둬야 합니다. 1만 GPU 토폴로지의 스위치 상태 용량을 분석하면서 전달 실험은 작은 프로토타입에서 수행할 수 있습니다. 둘 모두 유용하지만 질문이 다릅니다. 구현 규모, 에뮬레이션 규모, 해석 규모를 분리해야 상태 압축 결과를 같은 크기 장비군의 애플리케이션 처리량처럼 제시하지 않습니다.

배포도 이 구분을 따릅니다. 먼저 그림자 상태를 배포해 SGLB의 선택과 현재 경로를 비교합니다. 한 트래픽 클래스에만 적용하고 ECMP로 빠르게 돌아갈 경로를 유지합니다. 제어 정보 유실과 링크 플래핑을 시험한 뒤 범위를 넓힙니다. 전역 제어 루프는 모든 메시지가 도착할 때의 높은 처리량뿐 아니라 정보가 틀릴 때 제한된 동작을 보여 줘야 운영 권한을 얻습니다.

출처와 저작권 안내

이 글은 Silicon & Systems가 작성한 편집 요약입니다. 논문의 구조, 프로토타입 측정값, 한계를 우리 표현으로 다시 썼습니다. 원문 문장, 표, 출판사 도판은 재사용하지 않았으며, 본문의 두 도판은 다중 논문 네트워크 운영 리뷰를 위해 Silicon & Systems가 직접 만든 자산입니다. 정식 논문은 ACM이 출판했습니다. 저작권 (c) 2025 원저자, publication rights licensed to ACM. ACM eReader의 무료 전문은 DOI 페이지에서 열람할 수 있습니다.