AI 학습 작업과 네트워크 운영자는 같은 사건을 다르게 표현합니다. 작업은 집합 통신이 느리거나 멈췄다고 말합니다. 운영자는 링크, 스위치 포트, 오버레이 터널, 적응형 경로, 큐를 봅니다. 구성 요소 하나의 고장이 특정 컨테이너 배치에만 영향을 줄 수 있고, 고장 나지 않은 혼잡 경로 하나가 집합 통신 유효 처리량을 무너뜨릴 수도 있습니다. 운영 스택은 세 질문에 답해야 합니다. 예상한 학습 그래프의 어느 부분이 달라졌는가, 영향을 받은 패킷은 실제로 어떤 물리 경로를 지났는가, 다음 패킷은 어디로 보내야 합니까?
산업계가 주도한 SIGCOMM 2025 논문 세 편은 이 제어 지점을 하나씩 다룹니다. Alibaba 클라우드의 SkeletonHunter는 대형 모델 학습이 만드는 규칙적이고 성긴 트래픽에서 장애를 추론합니다[1]. ByteDance의 ByteTracker는 모든 서버에 에이전트를 설치하지 않고 중앙 프로브와 스위치 미러링으로 경로를 복원합니다[2]. ByteDance와 Broadcom의 SGLB는 범용 스위치에 전역 혼잡을 고려하는 부하분산 기능을 넣습니다[3]. 하나의 점수로 순위를 매기면 안 됩니다. 앞의 두 시스템은 운영 환경 네트워크를 진단했고, SGLB는 혼잡을 피하는 포워딩 시제품을 평가했습니다.
작업부하가 이미 드러내는 중요 경로
컨테이너는 배치를 자주 바꾸고 물리 패브릭 위에 오버레이 네트워크를 더합니다. 가능한 모든 경로를 빠짐없이 관측하면 비용이 크고, 임의 표본은 현재 작업에 중요한 경로를 놓칠 수 있습니다. SkeletonHunter는 분산 학습의 특성을 사용합니다. 통신량은 많지만 구조는 성기고 반복적입니다. 텐서·파이프라인·데이터·전문가 병렬 그룹은 제한된 경로를 계속 지납니다. 논문은 이 핵심 경로 집합을 트래픽 골격(traffic skeleton)이라고 부릅니다.
시스템은 예상한 핵심 경로 집합을 찾고 관측 신호가 달라지는 지점을 분석합니다. 선택한 경로가 실제 학습 통신에 연결돼 있으므로, 관측값이 사라지거나 나빠지면 일반 백그라운드 프로브보다 작업부하 문맥이 강합니다. 오버레이와 언더레이 관계를 함께 보면 컨테이너에서 보이는 증상을 물리 구성 요소 후보로 바꿀 수 있습니다.
Alibaba는 6개월의 운영 결과를 제시합니다. SkeletonHunter는 네트워크 장애 4,816건을 찾아 정밀도 98.2%, 재현율 99.3%를 기록했고 95.7% 정확도로 위치를 특정했습니다. 운영자가 확인된 문제 구성 요소의 98%를 수리한 뒤 월간 네트워크 장애율은 99.1% 줄었습니다. 마지막 값은 위치 특정 알고리즘의 정확도가 아니라 조치 전후의 운영 결과입니다. 검출과 장애 감소 사이에 실제 유지보수가 들어 있습니다.
호스트 에이전트 없이 실제 경로를 복원하는 방식
ByteTracker는 다른 빈틈에서 출발합니다. 종단 호스트 프로브는 많은 서버에 프로세스와 설정을 추가하고 호스트 부하의 영향도 받습니다. 타임아웃이 네트워크가 아니라 호스트에서 생길 수 있으며, 적응형 포워딩 때문에 엔드포인트만 보고 실제 경로를 추정하기도 어렵습니다.
이 시스템은 소수의 전용 프로브 송신기를 중앙에 둡니다. 대상 서버에 프로브 프로세스가 없어도 운영체제가 응답하도록 패킷을 구성합니다. 남북·동서 방향의 프로브를 함께 사용해 링크와 내부 포워딩 경로를 확인합니다. 스위치 패킷 미러링은 패킷이 실제로 지난 길을 기록하고 홉별 비교를 가능하게 해, 조용한 패킷 유실이나 내용 변화도 조사할 수 있습니다.
ByteTracker는 ByteDance의 모든 데이터센터에 반년 넘게 배포됐습니다. 공식 초록은 해당 기간에 거의 모든 네트워크 이상을 발견하고 5초 안에 100% 정확도로 위치를 찾았다고 보고합니다. 평가 문맥을 붙여 읽어야 합니다. 그 배포에서 관측한 사건에 대한 저자들의 운영 결과이지 모든 장애 유형에 대한 수학적 보장은 아닙니다. SkeletonHunter보다 숫자가 높아서 우월한 것도 아닙니다. ByteTracker는 활성 학습 패턴이 없어도 일반 경로를 확인하고, SkeletonHunter는 학습 토폴로지의 의미를 더합니다.

장애가 되기 전에 혼잡을 피해 보내는 방식
SGLB는 장애 대응 처리 단계가 아니라 포워딩 평면에서 동작합니다. 로컬 적응형 라우팅은 인접 큐를 볼 수 있지만 더 먼 구간의 혼잡 쪽으로 패킷을 밀어 넣을 수 있습니다. 전역 상태는 유용하지만 범용 스위치의 작은 메모리에 보관하고 빠르게 배포하기 어렵습니다. 링크가 끊어지면 신속히 경로를 바꿔야 하고, 경로 대역폭이 다를 때 단순 분산은 오히려 처리량을 낮출 수 있습니다.
SyncMesh 제어 프로토콜은 압축한 혼잡 정보를 스위치의 전역 부하 분산 엔진에 전달합니다. 엔진은 전역 경로 상태와 사용 가능한 용량을 함께 보고, 링크 장애 뒤 포워딩을 갱신합니다. 시제품 실험에서 최저 45 마이크로초 안에 경로를 복구했고, 전역 혼잡 경로를 피하면서 올투올 통신이 최대 60% 빨라졌습니다.
이 결과는 SkeletonHunter나 ByteTracker처럼 6개월 동안 운영 환경에서 측정한 값이 아닙니다. 논문은 SGLB 시제품을 만들고 실험 환경에서 평가했습니다. 해당 추상화가 범용 스위치 자원에 들어가고 시험한 집합 통신을 개선한다는 근거입니다. 작업 구성이 계속 변하고 제어 패킷이 손실되며 여러 트래픽이 섞이는 장기 운영은 배포에서 따로 확인해야 합니다.

하나의 운영 순환 구조로 연결하기
세 시스템은 하나의 순환 구조로 이어질 수 있습니다. 학습 트래픽은 가치가 높은 수동 관측 신호를 제공합니다. 전용 프로브는 작업부하와 독립적으로 경로를 확인해 작업이 바뀌거나 멈춘 동안에도 관측 범위를 유지합니다. 부하 분산기는 현재 혼잡을 보고 피해를 줄이고, 관측 시스템은 경로 변경 뒤 예상 성능이 돌아왔는지 확인합니다. 구성 요소가 실제로 고장 났다면 계속 우회하는 대신 위치 특정 정확도 결과를 유지보수와 격리에 넘깁니다.
연결부에는 별도 설계가 필요합니다. 미러링된 프로브는 GPU 트래픽을 대표하는 경로를 지나야 합니다. 적응형 라우팅 때문에 프로브 하나의 관측은 빠르게 오래된 정보가 됩니다. 스케줄러가 컨테이너나 병렬 그룹을 옮기면 핵심 경로 집합도 바뀝니다. 전역 혼잡 요약에는 전달 지연과 정밀도 한계가 있습니다. 따라서 작업, 컨테이너, 엔드포인트, 스위치, 경로를 잇는 공통 식별자와 관측값을 맞출 수 있는 정확한 시간이 필요합니다.
더 큰 결론은 네트워크 신뢰성을 하나의 백분율로 나타낼 수 없다는 점입니다. 검출 정밀도, 재현율, 위치 특정 정확도, 위치를 찾는 시간, 경로 수렴 시간, 집합 통신 처리량은 서로 다른 단계의 값입니다. AI 클라우드가 그중 하나를 공개했다고 나머지까지 입증한 것은 아닙니다. 이 산업계 논문들은 패브릭 뒤의 운영 체계를 여러 단계로 나눠 보여 준다는 점에서 가치가 있습니다.
개별 결과보다 큰 통합 문제
세 논문을 서로 경쟁하는 모니터링 제품으로 읽으면 안 됩니다. 관찰하는 시간축이 서로 다릅니다. SkeletonHunter는 오래 실행되는 작업의 안정적인 경로 구조가 바뀌는지를 봅니다. ByteTracker는 능동 탐침(프로브)이 지난 실제 경로를 수초 안에 복원합니다. SGLB는 관제 계층의 진단이 도착하기 전 마이크로초 단위로 네트워크 안에서 우회합니다. 검출, 설명, 우회는 허용 시간이 다른 작업이므로 완전한 패브릭에는 세 시간축이 모두 필요합니다.
평가 수치의 분모도 다릅니다. 정밀도와 재현율은 관측한 장애 집합에서 분류기를 평가합니다. 5초는 실제 데이터센터에서 장애 위치를 좁히는 데 걸린 시간입니다. 45마이크로초와 60%는 시제품에서 측정한 복구 시간과 집합 통신 성능입니다. 이 결과를 하나의 순위로 합치기보다 계층 사이의 연결 규약으로 읽어야 합니다. 작업부하 계층이 영향을 받은 핵심 경로 집합을 찾고, 경로 계층이 이를 물리 구성 요소에 연결하며, 제어 계층이 수리가 끝날 때까지 트래픽을 우회해야 합니다. 이 인계가 없으면 각 도구가 맡은 범위에서 정확해도 작업은 멈춥니다.
AI 패브릭의 인수 시험도 더 강해져야 합니다. 링크, 스위치, 혼잡 사건을 주입한 상태에서 완료한 학습 스텝을 측정하고, 손실을 검출 지연, 위치 추적 지연, 경로 수렴, 성능이 낮아진 경로의 대역폭, 수리 시간으로 나눕니다. 잘못된 신호에 빠르게 반응하는 제어 루프가 스스로 장애를 만들 수 있으므로 불필요한 우회를 일으킨 오경보도 포함해야 합니다. 경보 시각보다 사건 동안 목표 집합 통신 유효 처리량을 얼마나 지켰는지가 최종 지표여야 합니다. 더 큰 통찰은 네트워크 운영이 분산 실행계의 일부가 되고 있다는 점입니다. 작업 토폴로지가 텔레메트리에 문맥을 주고, 텔레메트리가 라우팅의 근거가 되며, 라우팅은 물리 장비를 수리하는 동안 작업을 계속할 경로를 제공합니다.
작업부하의 핵심 경로 집합은 무엇을 관측할지도 바꿉니다. 일반 네트워크 도구는 모든 경로를 비슷하게 덮으려 합니다. 대규모 분산 작업은 희소하고 구조적인 일부 경로를 반복해서 사용하므로 그 경로의 관측 우선순위가 더 높습니다. 다만 작업이 다시 배치되거나 집합 통신 알고리즘이 바뀌거나 탄력적 구성 변경으로 랭크가 이동하면 관측 대상도 달라집니다. 모니터링 시스템은 핵심 경로 집합을 작업 계획과 함께 버전 관리해야 합니다. 그렇지 않으면 어제의 핵심 경로를 정확하게 지켜보는 동안 오늘의 트래픽이 다른 곳에서 실패할 수 있습니다.
SGLB에는 제어 루프 안정성이라는 짝이 있습니다. 전역 혼잡 정보는 로컬 큐 표본보다 풍부하지만 스위치에 도달할 때는 더 오래된 정보입니다. 여러 스위치가 같은 지연된 요약에 동시에 반응하면 트래픽을 한꺼번에 옮겨 새로운 병목 경로를 만들 수 있습니다. 시제품의 복구 시간만으로는 많은 작업과 장애가 겹쳤을 때의 안정성을 입증하지 못합니다. 실제 운용 평가는 오래되거나 일부만 도착한 정보에서도 진동, 공정성, 수렴을 확인해야 합니다. 목표는 완벽한 전역 정보가 아닙니다. 분산된 판단이 지난 구간을 뒤늦게 고치는 데 그치지 않고 다음 구간을 개선할 만큼 최신이고, 오차 범위가 알려진 정보입니다.
세 관점에 필요한 공통 근거 모델
작업 구조, 실제 경로, 혼잡 상태는 서로 다른 시스템과 시계에서 나옵니다. 작업 스케줄러는 랭크와 집합 통신을 알고, 네트워크는 포트와 큐를 알며, 추적 시스템은 요청이나 단계가 느려진 시간을 압니다. 공통 식별자와 시간 모델이 없으면 세 화면이 모두 맞아도 같은 사건을 설명하지 못합니다.
작업, 통신 그룹, 집합 통신이나 요청 단계를 시작점으로 삼고 예상 끝단을 기록해야 합니다. 여기에 해당 구간의 실제 장치와 링크, 큐 점유와 드롭, 경로 변경을 붙입니다. 샘플 텔레메트리, 추정 경로, 스케줄러 의도는 확실성이 다르므로 신뢰도와 유효 시각도 남겨야 합니다. 집합 통신이 끝난 뒤의 혼잡을 원인으로 잘못 연결하지 않도록 시계 정렬이나 인과 순서 표식도 필요합니다.
제어 계층마다 책임과 대기 시간을 정해야 할 이유
전송 계층, 네트워크 제어기, 작업 스케줄러가 같은 신호에 동시에 반응하면 진동할 수 있습니다. 네트워크가 경로를 복구하는 순간 작업이 이동해 다른 혼잡을 만들 수 있습니다. 짧은 장애는 로컬 전송이, 지속 경로 문제는 네트워크가, 나쁜 배치의 남은 비용이 이동·재시작보다 클 때만 스케줄러가 처리하는 식으로 권한을 나눠야 합니다.
각 계층은 수행한 조치와 상위 계층이 관찰만 해야 하는 시간을 알려야 합니다. 텔레메트리가 끊겼을 때는 정상으로 간주하지 않고 오래된 경로 정보를 만료시켜야 합니다. 자동 조치에는 영향 범위, 되돌릴 조건, 한 계층만 끌 수 있는 운영 절차가 필요합니다.
완료한 동기식 작업이 최종 지표
낮은 이용률의 링크도 핵심 경로일 수 있고 높은 이용률의 링크도 연산 뒤에 가려질 수 있습니다. 학습에서는 단계 시간 분포, 드러난 집합 통신 시간, 느린 랭크, 잃은 가속기 시간을 봐야 합니다. 추론에서는 경로와 큐 상태별 TTFT와 토큰 지연을 연결해야 합니다.
처음에는 세 데이터를 연결만 하고, 다음에는 권고안을 내며, 이후 좁고 되돌릴 수 있는 조치부터 자동화하는 순서가 안전합니다. 링크 차단, 큐 혼잡, 잘못된 랭크 경로, 텔레메트리 공백, 제어기 재시작을 주입해 모순된 근거가 더 큰 장애를 만들지 않는지도 확인해야 합니다. 세 연구를 함께 읽는 이유는 화면을 늘리기 위해서가 아니라 같은 사건을 근거로 한 제어 계층이 책임 있게 복구하도록 만들기 위해서입니다.
출처와 저작권 안내
이 글은 Silicon & Systems가 산업계 주도의 SIGCOMM 2025 논문 세 편을 종합해 독자적으로 작성했습니다. 논문의 주장과 결과는 우리 표현으로 다시 썼고 원문 문장, 표, 도판은 옮기지 않았습니다. 두 도판은 이 글을 위해 새로 만들었습니다. 논문 서지와 초록은 SIGCOMM 2025 공식 프로그램에서 확인할 수 있습니다. 저작권 (c) 2025 각 논문의 원저자 및 출판자.