AI 랙의 연결을 유연하게 만드는 일반적인 방법은 가운데에 더 큰 스위치를 넣는 것입니다. Cornell University와 Lightmatter는 반대로 가속기 아래의 연결 자체를 바꿀 수 있는지 묻습니다[1]. OFC 2025에 발표한 LUMORPH는 가속기 부착 위치, 파장 다중화 송수신기, 광 도파로, 마하젠더 간섭계(MZI) 스위치를 한 실리콘 포토닉스 기판에 배치합니다. 소프트웨어는 선택한 타일 사이에 직접 광 회로를 만들고 다음 통신 단계에서 다른 회로로 바꿉니다.

직접 연결 패브릭은 패킷 큐를 줄이는 대신 배치 제약을 만듭니다. 링, 토러스, 큐브가 집합 통신에 예측 가능한 대역폭을 주더라도 고정된 모양에 들어맞지 않는 빈 가속기는 사용할 수 없습니다. 랙 전체에는 요청 수보다 많은 GPU가 남아 있는데도 연속된 링이나 필요한 차수의 그래프를 만들지 못해 작업이 대기할 수 있습니다. LUMORPH는 회로 스위칭을 타일 가까이 가져와, 스케줄러가 고정 그래프에 맞는 GPU를 찾는 대신 선택한 GPU에 맞는 그래프를 구성하도록 바꿉니다.

이 논문의 근거는 작은 광 소자 시험과 큰 규모의 시뮬레이션으로 나뉩니다. 저자들은 타일 네 개를 지나는 광 경로의 비트 오류와 MZI 전환 시간을 측정했습니다. GPU 64~256장으로 제안한 랙은 제작하지 않았습니다. 해당 규모의 집합 통신과 BERT 처리량은 모델과 시뮬레이터에서 얻은 결과입니다.

빈 GPU 수보다 연결 가능한 모양이 중요한 이유

다중 임차 가속기 배치는 보통 같은 GPU 종류, 메모리 용량, 네트워크 위치를 만족하는 빈 장치를 찾는 문제로 설명합니다. 직접 연결 광학은 여기에 그래프 조건을 더합니다. 미리 정한 링이나 큐브만 제공하면 이미 배치된 작업이 남긴 빈 위치로 새 작업의 토폴로지를 만들지 못할 수 있습니다. 매 요청마다 기존 작업을 옮기면 용량을 회수할 수 있지만 모델, 옵티마이저, 체크포인트 상태를 이동하며 실행을 중단해야 합니다.

LUMORPH는 연결도 할당 가능한 자원으로 취급합니다. 서버 규모 기판의 각 연산 타일에는 공용 광 버스에 연결된 송수신기 뱅크가 있습니다. MZI 기반 1x3 요소가 신호를 여러 도파로 중 하나로 보냅니다. 타일에 붙인 광섬유는 서버 사이까지 경로를 연장합니다. 제어기는 한 고객에게 GPU를 고른 뒤 그 GPU만 잇는 직접 회로를 설정할 수 있습니다. 같은 랙의 다른 고객은 물리 장비를 공유하면서도 다른 링을 받습니다.

작업마다 집합 통신 조건이 다를 때 이 구조의 가치가 커집니다. GPU 여섯 장은 8의 거듭제곱 크기를 맞추려고 두 장을 낭비하지 않고 링을 사용할 수 있습니다. GPU 여덟 장은 재귀적 반감과 배증 알고리즘이 요구하는 계층을 구성합니다. 광 그래프가 제조 시점에 고정되지 않으므로 두 작업을 동시에 배치할 수 있습니다. 핵심은 모든 ML 트래픽을 회로로 바꾸자는 주장이 아니라 GPU 할당과 통신 토폴로지를 함께 결정한다는 점입니다.

LIGHTPATH는 스위칭을 가속기 아래에 놓는 방식

제안한 기판에는 최대 32개 타일이 있습니다. 타일은 앞으로 GPU나 CPU를 적층할 위치이며 여러 송수신기 뱅크를 넣을 수 있습니다. 송신기는 마이크로링 공진기로 파장을 변조하고, 수신기는 파장을 분리해 전기 신호로 되돌립니다. 논문에 기술한 설계에서 타일 하나는 최대 16개 파장 채널을 지원합니다. 도파로가 기판을 가로질러 빛을 나르고 MZI가 타일의 송수신기 사이에 회로를 만듭니다.

실제 제작물의 범위는 더 좁습니다. 연구팀은 GlobalFoundries의 CMOS 포토닉스 공정으로 LIGHTPATH 시험 칩을 만들고 Xilinx VCU128 FPGA로 구동했습니다. PRBS-7 패턴은 FPGA의 SerDes에서 광 변조기로 들어가 타일 네 개와 별도의 스위칭 네트워크 네 개를 통과한 뒤 게르마늄 광검출기에 도착했습니다. 검출한 신호는 비트 오류를 세기 위해 같은 FPGA로 돌아왔습니다. GPU 간 통신이 아니라 광 소자를 지나는 루프백입니다.

10, 15, 20Gb/s에서 측정한 비트 오류율은 각각 6.96×10^-13, 6.62×10^-13, 5.60×10^-14입니다. 해당 조건에서 열린 아이 다이어그램도 확인했습니다. MZI 경로를 다시 설정하는 데에는 3.7마이크로초가 걸렸습니다. LUMORPH는 집합 통신 중에도 회로를 바꾸므로 이 숫자가 중요합니다. 전환이 느리면 토폴로지를 바꿀 수는 있어도 짧은 통신 단계 사이에서는 사용할 수 없습니다.

LUMORPH의 근거를 광 소자 실측과 랙 시뮬레이션으로 구분했습니다. 가속기 타일 네 개는 프로그래밍 가능한 직접 회로로 연결됩니다. 시험 칩은 3.7마이크로초 MZI 전환과 10, 15, 20Gb/s 루프백에서 7×10^-13 미만의 비트 오류율을 보였습니다. BERT 결과는 GPU 64~256장을 모델링한 값이며 실제 랙 실측이 아닙니다. 이 글을 위해 새로 만든 도판.

집합 통신은 회로 전환 비용까지 계산해야 할 이유

프로그래밍 기능만으로 집합 통신이 빨라지지는 않습니다. 회로를 바꿀 때마다 고정 시간이 들고, 한 GPU의 송신 대역폭을 여러 목적지로 나누면 연결 하나가 받는 대역폭은 줄어듭니다. 논문은 이를 알파-베타 비용 모델로 표현합니다. 알파는 전송 준비 비용이며 LUMORPH에서는 3.7마이크로초 MZI 전환도 포함합니다. 베타는 바이트당 전송 시간입니다. 여러 상대와 동시에 통신하면 라운드 수는 줄지만 각 상대가 받는 대역폭이 감소합니다.

GPU당 연결 수를 바꾸며 전역 최적값을 찾는 문제는 비볼록이므로 저자들은 이미 알려진 알고리즘을 광 회로에 맞췄습니다. LUMORPH-2는 필요한 순간에 회로를 만들며 재귀적 배증과 반감을 수행합니다. LUMORPH-4는 파장을 나눠 한 GPU가 한 라운드에 여러 GPU와 통신하는 4배증과 4분할로 확장합니다. 2의 거듭제곱이 아닌 할당은 링을 유지할 수 있습니다. 하나의 새로운 집합 통신 알고리즘을 강제하는 것이 아니라 검증된 알고리즘에 맞는 임시 토폴로지를 제공하는 방식입니다.

비교 기준은 큐 지연이 전혀 없는 이상적인 전기 스위치에서 NCCL 링과 트리를 실행하는 조건입니다. 실제 패킷 경합을 없앤 강한 기준입니다. GPU 64, 128, 256장 시뮬레이션에서 LUMORPH 스케줄은 선택한 올리듀스 조건을 이상적 스위치의 링과 트리보다 거의 80% 짧게 끝냈습니다. 초록은 랙 규모 집합 통신을 74% 빠르게 했다고 요약합니다. 작은 버퍼에서는 대역폭보다 직렬로 반복하는 시작 단계 수가 지연을 지배하므로 차이가 커집니다.

BERT 1.7배는 시뮬레이션 결과

응용 수준 평가는 FlexFlow로 BERT 연산 그래프를 구성했습니다. 전기 기준은 이상적인 스위치에서 링 올리듀스를 실행합니다. 양쪽 모두 GPU 방향당 300GB/s NVLink 대역폭을 사용합니다. 전기 경로의 알파는 0.7마이크로초이고 LUMORPH는 실측 전환 시간 3.7마이크로초를 더한 4.4마이크로초입니다. 이 불리한 고정비에도 제안 구조는 BERT 학습 처리량을 최대 1.7배 높였습니다.

빛이 데이터를 1.7배 빠르게 이동해서 나온 결과가 아닙니다. 모델링한 병렬화 계획은 작은 버퍼의 올리듀스를 자주 호출합니다. 링은 큰 전송에서 대역폭을 효율적으로 쓰지만 GPU 수가 늘면 직렬 시작 비용이 커집니다. LUMORPH는 한 라운드의 통신 상대 수를 늘려 라운드 수를 줄입니다. 따라서 고정 준비 시간이 지배하는 집합 통신에 결과를 적용해야 합니다. 큰 연속 버퍼가 대역폭을 오래 채우는 작업에서는 차이가 줄고 단순한 링이 유리할 수 있습니다.

시뮬레이션은 광 기판이 랙 규모에서 GPU당 300GB/s에 해당하는 대역폭을 제공한다고 가정합니다. 논문은 송신기, 수신기, 레이저, 열 제어, 패키징, 광섬유를 모두 포함한 링크를 이 속도로 측정하지 않았습니다. 20Gb/s 루프백은 작은 경로의 스위칭과 신호 전달을 검증합니다. FlexFlow가 사용한 랙 대역폭을 검증하는 시험은 아닙니다.

배치 전에 네 가지를 더 입증해야 할 이유

첫째, 시스템의 광 손실과 전력 예산이 없습니다. 다수의 교차점, MZI, 공진기, 서버 간 결합기를 지나는 경로는 온도와 제조 편차가 있어도 수신기에 충분한 광 전력을 전달해야 합니다. 한 루프백의 비트 오류는 제시했지만 장비군 전체의 레이저 전력, 히터 전력, 결합 손실 분포, 실제 전달 비트당 에너지는 측정하지 않았습니다.

둘째, 제어 지연은 3.7마이크로초보다 깁니다. 운영 경로에는 통신 단계 준비 감지, 토폴로지 선택, 모든 스위치 설정, 광 상태 확인, 링크 검증, 통신 라이브러리 반영이 포함됩니다. 한 타일이 오래된 설정을 보고하면 집합 통신이 멈출 수 있습니다. 광 소자 외에도 버전이 있는 토폴로지 트랜잭션과 롤백이 필요합니다.

셋째, 광섬유와 패키지 조립이 정비성을 결정합니다. 서버 사이의 직접 광섬유는 복잡한 물리 그래프를 만듭니다. 논문이 언급한 면 결합은 밀도를 높일 수 있지만 제조 수율, 커넥터 교체, 랙 안의 배선 경로는 아직 측정하지 않았습니다. 물리 광섬유 그래프가 정확히 설치된 뒤에야 토폴로지를 소프트웨어로 바꿀 수 있습니다.

넷째, 고객 격리를 데이터 경로에서 검증해야 합니다. 설정된 회로는 패킷 경합을 없애지만 공용 파장, 공진기, 열 상태, 제어 오류가 다른 고객에게 영향을 줄 수 있습니다. 클라우드에서는 광 경로 저하를 해당 작업에 귀속하고 이웃 작업을 건드리지 않는 승인 제어와 텔레메트리가 필요합니다.

남는 기여는 토폴로지의 탄력성

LUMORPH를 패킷 스위치 기반 GPU 랙의 완성된 대체재로 읽으면 안 됩니다. 가장 강한 실측 근거는 타일 네 개에서 빠르고 오류가 적은 광 스위칭 경로입니다. 가장 강한 시스템 근거는 임시로 연결 차수를 높여 집합 통신을 줄일 수 있다는 시뮬레이션입니다. 두 근거 사이에는 큰 통합 단계가 남아 있습니다.

그래도 토폴로지 탄력성은 중요한 방향입니다. 고정 광 패브릭은 그래프를 특화해 전력과 큐잉 비용을 줄입니다. LUMORPH는 특화가 영구적일 필요가 없다고 주장합니다. 한 고객의 통신에 맞춘 회로를 만들고 다음 고객에게는 다른 회로를 만들 수 있습니다. 스케줄러는 작업을 실행할 위치뿐 아니라 그 위치를 유용하게 만드는 임시 통신 그래프까지 결정하게 됩니다.

이 연구는 Lightmatter의 이후 Passage M1000 발표와도 역할이 다릅니다. Passage는 상용 광 인터포저와 패키지 규모 대역폭에 집중하며, 저희는 별도 글에서 분석했습니다. LUMORPH는 Lightmatter 소속 저자 한 명이 참여한 Cornell 주도 랙 구조 연구이며 작은 LIGHTPATH 시험 칩과 집합 통신 시뮬레이션을 다룹니다. 두 자료를 하나의 제품 주장으로 합치면 이 논문의 중요한 실측 경계를 놓치게 됩니다.

출처와 저작권 안내

이 글은 OFC 논문과 공개된 저자 원고를 바탕으로 Silicon & Systems가 독립적으로 작성한 편집 요약입니다. 사실과 결과를 우리 문장으로 다시 설명했으며 원문의 문장, 표, 도판을 옮기지 않았습니다. 본문 도판과 카드 이미지는 이 글을 위해 새로 만들었습니다. OFC 게재본의 권리는 저자와 Optica Publishing Group에 있습니다.