AI 네트워크는 광섬유 하나를 이미 여러 파장으로 나누어 씁니다. 일반적인 광 회로 스위치는 이 파장 묶음을 어느 광섬유 포트로 보낼지 정합니다. University of Cambridge, NVIDIA, Ghent University-imec 연구팀은 ECOC 2025에서 공간과 파장을 따로 제어하는 스위치를 제시했습니다[1]. 이 공간·파장 선택 스위치(SWSS)는 공간 입력 네 개와 출력 네 개를 연결하며 파장 여덟 개를 독립적으로 선택합니다. 같은 광섬유를 공유하는 다른 채널은 그대로 둔 채 파장 하나만 다른 목적지로 보낼 수 있습니다.
가속기 클러스터에서는 이 세밀도가 유용할 수 있습니다. 바쁜 두 종단 사이에 광섬유 묶음 전체를 할당하지 않고 파장 하나를 더 붙일 수 있고, 메모리 풀로 한 채널을 보내면서 나머지 채널은 기존 목적지를 유지할 수 있습니다. 그러나 라우팅 차원을 하나 늘리면 공진기, 간섭계, 결합기, 도파로가 광 경로에 추가됩니다. 이 논문의 중요한 결과는 가능한 경로 수가 아닙니다. 제작한 스위치를 상용 NVIDIA InfiniBand 인터페이스가 실제로 통과했다는 점과, 이 구조가 아직 제품 패브릭이 되지 못한 이유를 보여 주는 손실 수치입니다.
공간과 파장은 서로 다른 할당 문제를 푸는 방식
공간 스위치는 입력 광섬유를 출력 광섬유에 연결합니다. 파장 네 개가 함께 들어오면 보통 함께 나갑니다. 파장 선택 소자는 채널을 분리할 수 있지만 필터 하나만으로 확장 가능한 비차단 공간 패브릭을 만들 수는 없습니다. 제안한 SWSS는 두 기능을 결합합니다. 마이크로링 공진기(MRR)가 좁은 파장 대역을 효율적으로 고르고, 마하젠더 간섭계(MZI)가 더 넓고 안정적인 공간 경로를 제공합니다. 입력 1의 λ1을 출력 2로 보내고 같은 입력의 λ2는 출력 4로 보낼 수 있습니다.
구조는 수정한 확장형 Banyan 토폴로지를 사용합니다. 2×2×8파장 스위치 요소 열두 개와 수동 결합기가 4×4 패브릭을 구성합니다. 내부 경로를 늘려 강한 신호가 같은 파장의 다른 경로로 새는 1차 동일 파장 누화를 상쇄합니다. 스위치 요소 열두 개의 면적은 0.6mm²이고 전체 포토닉 다이는 20mm²입니다. 열 간섭을 줄이기 위해 인접한 마이크로링 사이에 200마이크로미터 간격을 두었습니다.
이 간격은 시스템의 상충 관계를 보여 줍니다. 파장과 포트를 늘리면 다이 가장자리보다 빠르게 경로 수가 늘지만, 열로 조정하는 공진기마다 격리와 제어가 필요합니다. 밀도를 지나치게 높이면 열 누화가 커지고, 간격을 넓히면 도파로 길이와 손실이 늘어납니다. 현재 4×4 소자는 모든 입력·출력·파장 조합을 측정할 수 있는 크기입니다. 포트 수십 개로 확장할 때에는 이 블록을 단순히 복제할 수 없습니다.
스펙트럼 측정은 필터 동작을 입증하는 근거
첫 측정은 상용 QSFP28 송수신기의 O-band 파장 네 개를 한 입력에서 한 출력으로 보냅니다. 네 채널 모두 27dB보다 높은 소광비와 약 65GHz의 광 대역폭을 보였습니다. 소광비는 선택한 통과 상태와 억제 상태를 얼마나 분리하는지 나타냅니다. 65GHz는 광 필터의 통과 대역이며 65GHz 전기 링크를 끝까지 실측했다는 뜻이 아닙니다.
논문이 미래에 파장당 200Gb/s를 언급하므로 이 구분이 중요합니다. 65GHz 광 통과 대역은 적절한 송신기, 수신기, 등화, 신호 대 잡음비, 링크 예산이 함께 있으면 시험에 사용한 25.78Gb/s보다 빠른 변조를 수용할 수 있습니다. 이 소자로 200Gb/s 레인을 시연하지 않았습니다. 향후 송수신기 조건을 둔 대역폭 기반 전망입니다.
마이크로링의 중심 파장은 온도와 공정 편차에 따라 이동합니다. 제작한 다이는 실험실 조건에서 채널을 맞출 수 있음을 보여 줍니다. 운영 스위치에는 보정, 히터 또는 전기광학 제어, 드리프트 감시, 손실이나 격리 목표를 벗어난 채널 처리 정책이 필요합니다. 이러한 제어 전력과 상태 관리 비용은 데이터 전송률 결과에 포함되지 않았습니다.
상용 InfiniBand를 통과한 시험이 핵심
주요 데이터센터 시험에서는 NVIDIA Mellanox NIC를 PCIe로 호스트에 연결하고 100G QSFP28 모듈 한 쌍을 설치했습니다. 모듈은 4.5nm 간격의 O-band 파장 네 개를 사용하고 최대 40km 도달 거리 등급을 가집니다. 시험 경로는 단일 모드 광섬유 500m, 포토닉 스위치, 두 번째 송수신기로 돌아오는 루프백을 포함합니다. NVIDIA 펌웨어 도구로 PRBS31 시험 모드를 설정하고 NIC에서 원시 오류 수를 읽었습니다.
각 파장은 25.78Gb/s로 동작합니다. 연구팀은 입력 네 개, 출력 네 개, 파장 네 개의 모든 조합을 시험했습니다. 비트 오류율은 10^-9~10^-6입니다. 공진기 하나만 측정한 결과보다 강한 근거입니다. 상용 광 모듈, 광섬유, 제작한 스위치, 실제 NIC 진단 경로가 모두 포함되며, 시험한 모든 상태에서 합계 100G 인터페이스를 라우팅할 수 있음을 보여 줍니다.
그러나 지정한 FEC 목표에서 오류가 없는 Ethernet 또는 InfiniBand 서비스를 입증한 것은 아닙니다. 원시 비트 오류율 10^-6은 10^-9보다 세 자릿수 나쁘며 안정적인 서비스에는 순방향 오류 정정과 수신 여유가 필요합니다. 논문은 경로별 차이의 주원인을 삽입 손실로 봅니다. 광섬유 결합, 스위치, 도파로를 합친 전체 손실은 경로마다 약 20dB입니다. 최상의 오류율보다 이 숫자가 다음 설계 과제를 더 정확히 보여 줍니다.

영상 시연은 AI 대역폭이 아니라 마진을 보는 기준
두 번째 시험은 상용 Ethernet 스위치와 10G SFP+ 모듈을 사용합니다. PC는 4K 영상 여러 개를 합쳐 약 1Gb/s로 전송하며 호스트 NIC가 속도를 제한합니다. 광 신호는 프로그래밍한 스위치를 통과하고 감쇠기가 수신 전력을 단계적으로 낮춥니다. 추가 감쇠 13dB에서도 영상이 안정적으로 유지되어 이 구성의 동적 범위가 최소 13dB임을 보였습니다.
유용한 견고성 시험이지만 고속 AI 작업으로 해석하면 안 됩니다. 호스트 전송률은 InfiniBand 시험의 약 1%이고 전망한 파장당 200Gb/s보다 훨씬 낮습니다. 영상은 광 전력이 줄 때 응용이 어떻게 망가지는지 눈으로 확인하게 합니다. GPU 집합 통신 지연, 스위치 전환 중단, 네트워크 경합, 가속기 처리량은 측정하지 않습니다.
시험에는 장거리 등급 송수신기를 사용했습니다. 장거리 모듈은 짧은 데이터센터 링크보다 큰 광 예산을 가질 수 있습니다. 실제 AI 패브릭은 송신 전력, 수신 감도, FEC, 레이저 위치, 열 한도를 다른 비용과 에너지 목표에 맞춥니다. 추가 13dB는 이 Ethernet 시험 구성의 결과이며 공동 패키징 광 스위치에 그대로 적용할 수 없습니다.
두 차원 스위칭의 확장 여부을 좌우하는 손실
약 20dB의 경로 손실에는 개선할 수 있는 항목이 있습니다. 에지 결합기를 재설계하거나 정렬 손실이 작은 패키지를 사용할 수 있습니다. 도파로 교차점과 굴곡을 최적화하고 공정 보정으로 스위치 요소의 초과 손실을 줄일 수 있습니다. 그러나 큰 패브릭은 단계를 더 사용합니다. 단계 수가 빠르게 늘면 개별 소자의 개선분을 전체 구조가 다시 소비할 수 있습니다.
손실은 시스템 비용 세 가지를 만듭니다. 레이저 출력을 높이면 벽면 전력과 열이 늘어납니다. 수신 광 전력이 낮으면 신호 대 잡음비와 비트 오류 여유가 줄어듭니다. 광 증폭기는 전력을 회복하지만 잡음, 에너지, 면적, 제어를 추가합니다. AI 클러스터에서 비교할 값은 다이 대역폭만이 아니라 레이저, 튜닝, FEC, 드라이버, 수신기, 냉각을 포함한 와트당 전달 대역폭입니다.
경로 구조는 장애 처리에도 영향을 줍니다. 파장 선택 스위치는 광섬유 단위 회로 스위치보다 세밀하게 불량 링크를 우회할 수 있습니다. 대신 제어기는 송수신기의 특정 파장, MRR, 공간 경로, 결합기, 원격 종단 중 어디에서 장애가 났는지 알아야 합니다. 포트 상태뿐 아니라 파장별 광 전력과 오류 카운터를 제공해야 합니다. 그렇지 않으면 추가 라우팅 차원이 추가 진단 모호성으로 바뀝니다.
아직 빠져 있는 시스템 전환 시간
논문은 동적 패브릭이라고 설명하고 FPGA 제어 보드를 연결했지만 시스템 시험의 종단 간 경로 전환 시간을 보고하지 않았습니다. 여기에는 제어 결정, 레지스터 설정, 공진기 안정화, 링크 검증, 패킷 또는 집합 통신 일시 중지가 포함되어야 합니다. MRR 자체가 빠르게 조정되어도 전체 경로가 안전하게 트래픽을 받기까지 더 오래 걸릴 수 있습니다.
이 수치가 없으므로 적용 범위를 구분해야 합니다. 밀리초 단위 스위치는 긴 작업의 대역폭을 재배치하거나 장애를 복구할 수 있습니다. 마이크로초 단위라면 집합 통신 단계 사이에 토폴로지를 바꿀 수 있습니다. 같은 4×4×8 하드웨어도 두 용도를 지원할 가능성은 있지만 제어와 안정화 측정이 신뢰할 수 있는 용도를 결정합니다. NVIDIA 소속 저자가 참여했다는 사실은 산업계 AI 시스템과 연구의 연결을 보여 주지만 실험실 FPGA 제어 루프가 DGX 제품 기능이라는 뜻은 아닙니다.
논문이 확정한 범위
이 연구는 세 가지를 입증했습니다. 실리콘 소자 하나가 MRR과 MZI로 공간 포트 네 개와 파장 선택 여덟 개를 결합할 수 있습니다. 보고한 경로에서 통과 대역은 65GHz를 넘고 소광비는 27dB보다 높습니다. 가장 중요하게는 상용 100G InfiniBand 모듈과 Mellanox NIC가 오류율 편차와 큰 광 손실이 있어도 시험한 모든 공간·파장 경로를 통과했습니다.
제품 규모의 포트 수, 파장당 200Gb/s, GPU 집합 통신 향상, 스위치 전체 에너지는 입증하지 않았습니다. 네 쪽짜리 ECOC 하드웨어 논문에 이 결과가 없다는 것이 결함은 아닙니다. 산업계 관점의 결론은 2차원 포토닉 라우팅이 필터 단품 측정에서 상호운용 네트워크 시험으로 넘어갔다는 점입니다. 다음 단계는 손실을 줄이면서 상호운용성을 유지하고 완전한 경로 전환 시간을 측정하는 것입니다.
이 논문은 가속기 종단에 스위칭을 둔 LUMORPH 분석과도 이어집니다. LUMORPH는 가속기 타일 아래의 회로를 바꾸고 집합 통신 효과를 시뮬레이션합니다. ECOC 스위치는 중앙의 4×4 소자를 통해 상용 네트워크 트래픽을 보냅니다. 하나는 랙 규모 토폴로지 탄력성을 탐색하고, 다른 하나는 모든 광 토폴로지가 통과해야 하는 손실과 오류 경계를 실측했습니다.
출처와 저작권 안내
이 글은 동료 심사를 거친 ECOC 논문과 University of Cambridge가 공개한 CC BY 4.0 저자 승인 원고를 바탕으로 Silicon & Systems가 독립적으로 작성했습니다. 사실과 측정 결과를 우리 표현으로 다시 설명했으며 원문의 문장, 표, 사진, 도판을 옮기지 않았습니다. 본문 도판과 카드 이미지는 이 글을 위해 새로 만들었습니다. IEEE 게재본은 (c) IEEE 2025이며 Cambridge 승인 원고는 CC BY 4.0으로 제공됩니다.