AI 데이터센터는 GPU를 한 장씩 사지 않는다. 가속기가 도착하기 수년 전에 전력 총량을 먼저 확보하고, 그 한도 안에서 유효한 모델 토큰을 얼마나 생산할지 결정한다. Meta가 2026년에 공개한 논문은 이 과정을 보기 드문 해상도로 기록한다. 약 30 MW짜리 건물 다섯 동, GB200 GPU 약 8만3천 장, 총 150 MW 규모다[1]. 더 큰 1 GW 캠퍼스의 일부지만, 핵심 결론은 간단하다. GPU 한 장의 벤치마크를 가장 빠르게 만드는 전력 설정이 클러스터 전체 처리량을 가장 높이지는 않는다.

저자들은 용량 계획, 구축 검증, 실제 운영을 차례로 따라간다. 새로운 냉각 장치나 가속기가 주인공은 아니다. 같은 시설 한도에서 처리량을 약 14% 높이는 의사결정의 조합이 주제다. 낮은 초기 전력으로 GPU를 더 많이 설치해 약 10%를 얻고, 계측으로 여유분을 확인한 뒤 약 2%를 되찾으며, 런타임 제어로 다시 약 2%를 추가한다. 이 장부는 전력을 구매 단계의 제약에서 스케줄링할 수 있는 클러스터 자원으로 바꾼다.

1,200 W보다 빠른 960 W 클러스터

GB200의 GPU 전력 상한은 1,200 W지만 Meta는 960 W를 기준으로 구축했다. 한 장만 보면 손해가 작고, 건물 전체에서는 이득이 크기 때문이다. 설정을 1,200 W에서 1,000 W로 낮추면 GPU당 성능은 약 5% 줄지만 전력 예산은 16.7% 감소한다. 900 W에서는 성능이 약 12%, 전력 한도가 25% 줄어든다. GPU 한 장이 요구하는 몫이 작을수록 같은 시설에 더 많은 장치를 넣을 수 있으므로, 클러스터 처리량의 최댓값은 장치 성능의 최댓값보다 낮은 전력에서 나온다.

논문은 150 MW 안에 700 W H100을 넣는 경우를 기준값으로 삼는다. GB200을 1,200 W로 계획하면 약 7만4천 장이 들어가며 H100 대비 총 처리량은 1.7배다. 960 W에서는 약 8만6천 장을 계획할 수 있고 총 처리량이 1.9배로 오른다. GPU마다 조금 느려져도 1,200 W 설계보다 클러스터 전체 작업량은 약 11% 많다. 네트워크 스위치의 radix와 실제 배치 조건 때문에 최종 수량은 약 8만3천 장이 됐지만, 이 결론은 바뀌지 않는다.

여기에는 GPU가 아닌 모든 부하도 들어가야 한다. 백엔드와 프런트엔드 네트워크가 150 MW의 8~9%를 쓴다. Catalina 컴퓨트 pod는 두 랙에 GB200 72장을 넣어 하나의 NVLink 도메인을 만들고, 별도의 공조 보조식 액체 냉각(AALC) 랙 두 개와 짝을 이룬다. 건물에 시설 냉수가 없기 때문이다. Grace CPU마다 백엔드용 400 Gb/s ConnectX-7 인터페이스 두 개와 프런트엔드용 200 Gb/s 연결도 붙는다[2]. 이 경로에 예약한 전력은 GPU에 다시 배정할 수 없다.

고정된 150 MW가 8만3천 GPU 클러스터로 바뀌는 과정. a, 약 30 MW짜리 건물 다섯 동이 전체 전력을 구성하고 프런트엔드와 백엔드 네트워크가 8~9%를 쓴다. b, Catalina pod 하나는 두 컴퓨트 랙의 GB200 72장과 공조 보조식 액체 냉각 랙 두 개를 묶는다. c, 같은 시설 한도에서는 960 W 설계가 GPU를 더 많이 수용해 1,200 W 설계보다 총 처리량을 약 11% 높인다. 이 글을 위해 새로 만든 도판.

용량 계획은 예측이고, 구축 검증은 감사다

Meta는 전력 운영을 세 시간대로 나눈다. 계획은 차세대 가속기가 나오기 6~12개월 전에 시작하며, 이때는 실측값 대신 모델을 쓴다. 장비를 설치한 뒤에는 랙과 시설 계측을 맞춰 가정을 검증한다. 실제 운영에서는 짧게 나타나는 여유 전력을 차단기와 작업에 위험을 주지 않는 범위에서 활용한다.

구축 단계에서는 명판 전력의 단순 합계가 충분하지 않은 이유가 드러났다. 랙 전원공급장치의 텔레메트리는 상위 원격 전력 패널(RPP)의 계측값보다 계속 높았다. Meta는 두 값을 보정하고, 최댓값보다 70백분위 집계가 공유 부하를 더 잘 나타낸다고 판단했다. 8만3천 장에 보수적인 오차가 반복되면 실제 작업에 쓸 수 있는 수 MW가 그대로 묶인다.

전력 배전 구조는 건물 총량이 남아 있어도 국소 한도를 만든다. 전력은 주배전반(MSB), RPP, 랙 순서로 흐르며 가장 여유가 적은 요소가 다음 1 W의 사용 가능 여부를 정한다. 실제로 MSB의 13%는 남은 용량이 50 kW 미만이었다. MSB의 평균 여유는 약 160 kW, 해당 배전반 아래 GPU당 약 100 W였지만 RPP에는 GPU당 두 배가 넘는 여유가 있었다. 따라서 캠퍼스 총량이 충분해 보여도 불균형 때문에 계획 용량의 5~10%가 쓰이지 못할 수 있다.

그래도 실측 결과는 GPU 설정을 960 W에서 1,020 W로 올릴 근거가 됐다. 설치 수량을 바꾸지 않고 예상 성능을 2~3% 되찾는 조치다. 순서가 중요하다. 처음에는 낮은 전력 한도로 물리적 수량을 확보하고, 구축 후 감사에서 안전하다고 확인한 여유만 연산으로 돌려준다.

전력 파형을 먼저 펴고, 남은 봉우리를 낮춘다

대규모 동기식 작업의 소비전력은 일정하지 않다. 연산 구간에는 수많은 GPU의 부하가 함께 오르고, 통신 구간에는 함께 내린다. 평균이 한도 아래여도 클러스터 전체의 전환이 날카로운 전력 펄스를 만든다. 차단기는 짧은 과부하를 견디지만, 논문이 제시한 동작 범위는 약 1.2배에서 45초 또는 2배에서 30초 수준이다. 긴 평균값을 본 뒤 반응하는 제어기로는 이 시간대를 지킬 수 없다.

Meta는 두 메커니즘을 함께 쓴다. Power Smoother는 통신 구간의 골에 레지스터만 쓰는 tensor-core 명령을 채운다. HBM이나 L2를 건드리지 않으며 실제 모델 계산에도 기여하지 않지만, 전력이 급격히 떨어졌다가 다시 솟는 현상을 줄인다. 적응형 후퇴 제어가 사용 가능한 한도를 지키며, 애플리케이션 성능 손실은 3% 미만이다. 소량의 무효 연산을 허용해 더 큰 시설 안전 여유를 줄이는 선택이다.

Dimmer는 남은 봉우리를 처리한다. 장치 계측이 적용 한도의 97%를 넘으면 7초 평균을 사용해 GPU 상한을 점진적으로 조절한다. 이때 작업 단위 조정이 필수다. GPU 한 장만 늦추면 분산 학습의 지연 작업자가 되고, 나머지 GPU는 전력을 쓰면서 기다린다. Dimmer는 스케줄러와 작업 정보를 이용해 같은 작업의 rank를 함께 조절한다. 상시 비워 두던 단기 여유를 안전하게 쓰면서 클러스터 처리량을 약 2% 더 높인다.

세 단계로 쌓은 처리량 장부. 계획 단계에서는 960 W를 선택해 설치 밀도를 높이고 1,200 W 계획보다 클러스터 처리량을 약 10% 늘린다. 구축 검증에서는 랙 계측을 시설 계측기와 보정하고 국소 병목을 찾아 1,020 W로 올려 약 2%를 더한다. 런타임에서는 Power Smoother가 통신 구간의 골을 채우고 Dimmer가 7초 단위로 작업의 전력 상한을 함께 조절해 약 2%를 추가한다. 이 글을 위해 새로 만든 도판.

운영자가 가져갈 것

다른 시설이 복제해야 할 것은 960 W라는 숫자가 아니다. 이 값은 특정 가속기, 작업 구성, 네트워크, 건물에 속한다. 복제할 대상은 최적화의 경계다. 목표가 장치 성능이면 가장 높은 안정 전력 설정이 답이다. 시설 한도 안에서 완료한 클러스터 작업량이 목표라면 GPU 수량, 비연산 부하, 배전 계층, 작업의 동기성, 국소 불균형까지 함께 계산해야 한다.

이 경계는 텔레메트리의 역할도 바꾼다. 랙 센서, RPP 계측기, MSB 한도는 같은 자원 그래프의 서로 다른 구간을 나타낸다. 어느 한 값만 절대값으로 쓰면 과부하 위험을 만들거나 용량을 묶는다. 약 14%의 개선은 시간대를 연결해 얻은 결과다. 먼저 보수적으로 예측하고, 구축 후 측정하며, 확인한 여유만 작업 단위 제어로 사용한다.

물론 1.9배라는 비교는 Meta의 작업 특성과 특정 세대 전환을 전제로 한다. 지연시간에 민감한 추론 서비스는 마지막 수십 W의 가치를 다르게 평가할 수 있다. Power Smoother도 평탄한 전력 파형을 얻기 위해 에너지를 더 쓰므로 전력 요금, 냉각, 차단기 구조에 따라 득실이 달라진다. 그래도 핵심 장부는 남는다. 100 MW 규모에서 전력은 클러스터의 속성이 아니다. 전력이 곧 클러스터다.

출처와 저작권 안내

이 글은 Silicon & Systems가 작성한 편집 요약이다. 아래 논문의 주장과 결과를 우리 표현으로 다시 썼다. 논문의 문장, 표, 도판은 옮기지 않았으며, 본문의 두 도판은 보고된 수치를 바탕으로 이 글을 위해 새로 만들었다. 원문은 Creative Commons Attribution 4.0 International 라이선스로 공개돼 있다. 저작권 (c) 2026 원저자. 원문과 라이선스는 arXiv 서지 페이지에서 확인할 수 있다.