RoCE가 확산된 이유는 현실적인 전환 경로를 제공했기 때문입니다. 운영자는 이더넷 케이블과 스위치를 유지하면서 RDMA 동작 요청, 커널 우회, 직접 메모리 접근을 사용할 수 있었습니다. 우선순위 흐름 제어(PFC)로 무손실 동작을 만들고, 엔드포인트에는 InfiniBand에서 이어받은 전송 방식에 맞는 혼잡 제어를 추가했습니다. 네트워크 전체를 교체하는 것보다 기존 이더넷을 확장하는 편이 쉬운 환경에서 적합한 선택이었습니다.

Hoefler와 공동 저자들이 2023년 IEEE Computer에 발표한 글은 이 절충이 하이퍼스케일에서도 유지되는지 검토합니다[1]. 저자들은 고성능 컴퓨팅 연구자와 HPE, Broadcom, Google, Microsoft의 산업계 엔지니어로 구성됩니다. 특정 RoCE 제품의 벤치마크가 아니라 이더넷 흐름 제어, RDMA 복구, 패킷 형식, NIC 상태, 보안, 물리 링크 오류 정정 사이의 전제를 분석합니다. 결론은 이들을 서로 독립된 튜닝 문제로 다룰 수 없다는 것입니다.

AI 인프라에서는 이 구분이 중요합니다. 더 빠른 이더넷은 직렬화 대역폭을 두 배로 높이지만, 일시 정지 신호가 효과를 낼 때까지 전송되는 바이트, NIC가 처리할 패킷 수, 손실된 패킷 뒤의 데이터까지 다시 보내는 복구 비용도 늘립니다. 제어 메커니즘이 대역폭, 거리, 연결 수에 따라 커진다면 회선 속도만으로 패브릭을 평가할 수 없습니다.

스위치 메모리로 바뀌는 PFC 경로 거리

PFC는 입력 버퍼가 넘치기 전에 트래픽 우선순위를 멈춰 패킷 손실을 방지합니다. 수신 측이 임계값을 넘으면 상류로 일시 정지 프레임을 보내고, 프레임이 송신 측에 도달해 실제 전송이 멈출 때까지 계속 들어오는 데이터를 받습니다. 헤드룸은 이 왕복 시간 동안 전송되는 바이트와 최대 패킷 하나를 담아야 합니다. 단순화하면 대역폭과 왕복 시간의 곱이며, 포트와 우선순위마다 용량을 계산해야 합니다.

헤드룸은 일반 공유 패킷 버퍼와 다릅니다. 다른 용도로 사용하다 일시 정지 신호가 늦게 도착하면 패킷이 유실되고 무손실 규칙이 깨집니다. 링크 속도, 케이블 거리, 스위치 파이프라인, 중재, 순방향 오류 정정(FEC)이 모두 필요한 용량을 늘립니다. 논문은 평균 홉 지연 600ns, 9KB 패킷, 트래픽 클래스 여덟 개, 3계층 팻트리를 가정해 스위치 세대별 헤드룸 증가를 계산합니다. 800Gbit/s에서 캠퍼스나 지역 간 복제처럼 경로가 길어지면 포트당 요구량이 MB 단위를 넘어 빠르게 커질 수 있습니다.

InfiniBand 같은 크레딧 기반 패브릭도 전송 중인 데이터를 위한 용량을 예약하므로 버퍼 비용이 RoCE에만 있는 것은 아닙니다. 차이는 동작 시점입니다. 크레딧은 송신 전에 가용량을 알려 주지만 PFC는 버퍼가 임계점에 가까워진 뒤 반응합니다. PFC는 여러 송신자가 공유 버퍼를 유연하게 사용할 수 있는 대신 설정 오류와 전파 지연이 정확성의 일부가 됩니다. 공유 버퍼를 늘려도 허용한 최장 경로를 위한 헤드룸은 별도로 남겨 두어야 합니다.

하나의 일시 정지에서 시작되는 혼잡 트리

PFC는 개별 흐름이 아니라 우선순위 클래스 전체를 멈춥니다. 혼잡한 목적지와 관계없는 흐름도 같은 클래스를 쓰면 함께 중단됩니다. 피해 흐름이 상류 스위치에서 멈추고 다른 버퍼를 채우면 다시 일시 정지가 발생합니다. 막힌 영역은 혼잡 트리 또는 PFC 스톰으로 불리는 형태로 토폴로지의 역방향으로 확대됩니다. 하나의 느린 수신기가 자기 경로보다 넓은 스위칭 자원을 점유할 수 있습니다.

라우팅 경로에 순환이 있고 버퍼가 서로를 기다리면 무손실 네트워크는 교착 상태에도 빠질 수 있습니다. 순환 없는 라우팅이나 전용 가상 채널로 정상 상태의 순환을 막을 수 있지만, 링크 장애와 일시적인 경로 변경은 기존 토폴로지에 없던 상태를 만듭니다. 스위치 타임아웃은 패킷을 버려 교착을 풀 수 있습니다. 무손실을 잠시 포기해 진행을 회복하는 방식입니다. 따라서 운영자는 단순한 큐 임계값이 아니라 분산 안전 메커니즘을 관리하고 있습니다.

로컬 RoCE 일시 정지가 패브릭 문제로 커지는 과정입니다. 800Gbit/s에서 PFC 헤드룸은 대역폭과 일시 정지 왕복 시간의 곱에 따라 늘어납니다. 하나의 우선순위가 멈추면 관계없는 피해 흐름도 차단되고 상류 버퍼를 채워 혼잡 트리로 확대됩니다. 순환하는 버퍼 의존성은 교착을 만들 수 있으며 라우팅, 가상 채널, 타임아웃 복구가 이를 끊어야 합니다. 이 글을 위해 새로 만든 도판.

종단 간 혼잡 제어는 PFC가 작동하기 전에 속도를 낮추는 역할을 맡습니다. 실제 DCQCN 계열 알고리즘은 마킹 임계값, 속도 갱신, 스위치 버퍼, 트래픽 분포에 의존합니다. 한 토폴로지에서 잘 동작한 매개변수가 다른 작업에서는 불안정할 수 있습니다. 제조사가 여러 곳이면 엔드포인트와 스위치가 텔레메트리와 속도 변화를 다르게 해석할 가능성도 있습니다. PFC가 마지막 방어선으로 남아 있기 때문에 종단 간 제어의 오류는 다시 링크 수준 일시 정지로 나타납니다.

InfiniBand 전제를 이어받은 복구와 경로 선택

RoCE 신뢰 연결은 go-back-N 방식으로 복구합니다. 패킷 하나가 유실되면 같은 큐 페어에서 뒤에 도착한 패킷도 버려질 수 있고, 빠진 순서 번호부터 다시 전송합니다. 순서가 보장되는 무손실 패브릭에서는 단순하지만, 대역폭과 지연의 곱이 큰 네트워크에서는 유실 패킷 뒤에 많은 데이터가 놓입니다. 하나의 손상된 패킷이 재전송 버스트로 바뀌어 인캐스트를 키울 수 있습니다.

엄격한 순서 보장은 다중 경로 활용도 어렵게 합니다. 일반 이더넷 ECMP는 여러 경로에 패킷을 분산하면 순서가 바뀔 수 있으므로 흐름 하나를 한 경로에 해시합니다. 큐 페어 단위의 큰 흐름들이 같은 링크에 모이면 다른 동일 비용 경로가 비어 있어도 혼잡이 생깁니다. 최신 설계는 패킷 단위 분산과 수신 측 재정렬을 추가하지만, 이는 스위치 해시를 조정하는 것이 아니라 전송 방식과 NIC의 전제를 바꾸는 일입니다.

연결 상태도 확장 한계입니다. 신뢰 큐 페어는 순서 번호, 확인 응답, 재전송, 메모리 보호, 스케줄링 상태를 유지합니다. 논문은 RDMA 연결 하나가 약 1KB까지 NIC 상태를 사용할 수 있다고 설명합니다. 클라우드의 수백만 연결은 온디바이스 캐시를 넘고, 메타데이터를 PCIe로 가져오게 만듭니다. 캐시 미스는 지연을 더하고 데이터 DMA가 사용하는 호스트 링크도 소비합니다. 네트워크 확장 문제처럼 보였던 현상이 서버 I/O 계층으로 이어집니다.

작은 메시지에서 드러나는 패킷 비용

큰 전송은 대부분의 고속 링크를 효율적으로 보이게 합니다. AI 제어 트래픽, 그래프 갱신, 원자 연산, 스토리지 메타데이터는 훨씬 작을 수 있습니다. RoCEv2는 2계층 정보 22바이트, IP 20바이트, UDP 8바이트, 기본 전송 헤더 12바이트, 불변 CRC 4바이트를 사용합니다. 선택 헤더를 제외해도 합계가 66바이트입니다. 비교 대상인 로컬 라우팅 InfiniBand 헤더는 전체 20바이트입니다.

800Gbit/s 링크에서 헤더가 전혀 없고 페이로드가 8바이트라면 이론상 초당 125억 패킷(12.5Gpps)을 보낼 수 있습니다. InfiniBand 20바이트 헤더를 포함하면 약 3.5Gpps, RoCEv2 66바이트 헤더를 포함하면 약 1.4Gpps로 낮아집니다. 전송 바이트의 약 90%가 오버헤드가 됩니다. 실제 시스템에는 프레이밍과 구현 한계가 더해지므로 애플리케이션 실측값이 아니라 프로토콜 상한입니다.

8바이트 페이로드에서 드러나는 프로토콜 비용입니다. 800Gbit/s 링크의 순수 페이로드 상한은 12.5Gpps입니다. InfiniBand 20바이트 헤더를 적용하면 약 3.5Gpps, RoCEv2 66바이트 헤더를 적용하면 약 1.4Gpps로 낮아지고 전송 바이트의 약 90%가 오버헤드가 됩니다. 배포 시스템의 처리량이 아니라 프로토콜 계산값입니다. 이 글을 위해 새로 만든 도판.

이 결과가 모든 조건에서 RoCE가 InfiniBand보다 느리다는 뜻은 아닙니다. 큰 메시지는 헤더를 충분히 상쇄하고, 이더넷 운영 경험과 구축 비용이 더 중요할 수 있습니다. 계산이 보여 주는 것은 회선 속도보다 패킷 처리와 프로토콜 바이트가 유효 작업을 결정하는 작업 영역입니다. 구매 검증에는 큰 버퍼로 수행한 대역폭 측정뿐 아니라 실제 메시지 크기 분포와 초당 메시지 수도 포함해야 합니다.

뒤늦게 추가할 수 없는 보안과 FEC

RDMA는 네트워크에 메모리 접근 의미를 노출합니다. 인증, 암호화, 키 폐기, 테넌트 격리, 잘못된 요청 방어를 함께 설계해야 합니다. 논문은 초기 RoCE와 InfiniBand 환경에서 오늘날의 멀티테넌트 클라우드보다 보안의 우선순위가 낮았다고 지적합니다. 암호화를 나중에 추가하면 NIC 실리콘, 상태, 지연을 사용하고 연결별 보호가 상태 확장 문제를 키울 수 있습니다.

물리 링크에는 또 다른 고정 비용이 있습니다. 전송 속도가 높아질수록 채널 한계에 가까워져 FEC가 필요합니다. Reed-Solomon FEC는 코드워드를 모으고, 패리티를 계산하거나 오류를 해독한 뒤 데이터를 내보냅니다. 논문은 직렬화 이외에 실제 구현의 계산 지연이 약 20~100ns라고 설명합니다. 빠른 링크는 코드워드를 모으는 시간을 줄이지만 하드웨어 계산 시간 아래로는 내려갈 수 없습니다. 더 강한 오류 정정은 비트 오류 허용 범위를 높이는 대신 지연과 에너지를 사용합니다.

결국 계층 간 복구를 함께 봐야 합니다. 링크 FEC가 패킷이 보이기 전에 비트 오류를 수정하고, Ethernet CRC가 남은 손상을 찾으며, PFC가 유실을 피하고, RoCE 전송 계층이 go-back-N으로 복구합니다. 각 계층은 아래 계층의 동작을 전제로 하고 버퍼나 상태를 추가합니다. 한 계층만 최적화하면 비용이 사라지지 않고 다른 위치로 이동할 수 있습니다.

전송 규칙까지 바꾸는 차세대 이더넷 RDMA

논문은 데이터센터 이더넷과 고성능 인터커넥트가 수렴할 것으로 전망하지만, RoCE를 그대로 유지하는 방식은 아니라고 봅니다. 후속 전송 방식에는 긴 뒷부분을 모두 다시 보내지 않는 선택적 복구, 재정렬을 허용하는 다중 경로, 효율적인 작은 메시지 헤더, 확장 가능한 연결 상태, 명시적 보안, 대형 토폴로지를 위한 혼잡 제어가 필요합니다. 물리 FEC와 스위치 버퍼링도 함께 조정해야 합니다.

운영자에게는 패브릭 평가 방법의 변화가 필요합니다. PFC 헤드룸은 참고 토폴로지의 설정을 복사하지 말고 지원할 최장 경로와 실제 스위치 지연으로 계산해야 합니다. 장애 훈련에는 혼잡 트리와 일시적 라우팅 상태를 포함해야 합니다. NIC 평가는 운영 환경의 연결 수에서 컨텍스트 캐시 동작을 확인해야 합니다. 작은 메시지 작업은 유효 페이로드 처리량을 보고해야 합니다. 보안과 FEC는 지연 및 전력 예산에 포함해야 합니다.

RoCE는 이미 배포되어 있고 상호운용성과 소프트웨어 통합 경험이 있으므로 여전히 유용합니다. 이 논문은 모든 RoCE 패브릭을 교체해야 한다는 근거가 아닙니다. 제어 상태와 작은 메시지가 중요한 작업에서는 같은 전송 규칙에 더 빠른 링크만 추가할 때 이점이 줄어든다는 근거입니다. 현재 운영 성숙도가 프로토콜 비용보다 큰지, 어느 시점부터 혼잡 제어 매개변수보다 큰 변화가 필요한지를 판단해야 합니다.

출처와 저작권 안내

이 글은 Silicon & Systems가 작성한 편집 분석입니다. 저자들의 기술적 논지와 수치 예를 우리 표현으로 다시 썼습니다. 원문의 문장, 표, 도판은 재수록하지 않았고 이 페이지의 도판은 모두 새로 만들었습니다. 검토한 저자본은 arXiv, 저널 기록은 IEEE DOI에서 확인할 수 있습니다. (c) IEEE 2023.