클라우드의 GPU SKU는 소프트웨어 호환성을 약속하지만 실제 처리량까지 보장하지는 않습니다. 모델명과 메모리 용량이 같은 두 인스턴스도 행렬 연산 성능, 장치 메모리 대역폭, 비용당 유효 토큰 수가 다를 수 있습니다. AI 운영자가 구매하는 것은 카탈로그의 이름이 아니라 완료된 작업이므로 이 차이는 실제 비용으로 이어집니다.
Silicon Data와 William & Mary 연구자 두 명은 이 문제를 11개 클라우드 공급자에서 측정했습니다[1]. 데이터에는 물리 NVIDIA GPU 3,534개, 6,800건이 넘는 벤치마크 표본, 4개월의 관측 결과가 포함됩니다. 하이퍼스케일러와 네오클라우드를 함께 다뤘지만 서비스 약관과 법률 문제를 고려해 공급자 이름은 공개하지 않았습니다. 따라서 이 논문은 공급자 순위표가 아닙니다. 같은 이름으로 판매되는 클라우드 상품이 실제로는 성능 분포로 공급된다는 근거입니다.
측정 범위를 작게 정한 이유
저자들은 PyTorch로 QuickMark를 만들고 두 가지 짧은 시험을 사용했습니다. 첫 시험은 16,384×16,384 FP16 행렬을 곱해 TFLOPS를 측정합니다. 두 번째 시험은 장치 메모리 안에서 1GB를 복사해 GB/s를 구합니다. 운영체제, CUDA, 드라이버는 각 공급자의 기본 구성을 유지했습니다. GPU UUID를 기록했기 때문에 같은 물리 장치의 반복 실행과 새로운 할당을 구분할 수 있습니다.
이 구분이 논문의 핵심입니다. 실행 단계 변동은 한 GPU에서 시험을 반복했을 때의 차이입니다. 공급자 내부 변동은 한 공급자가 보유한 같은 모델의 여러 물리 GPU를 비교합니다. 공급자 사이 변동은 같은 모델을 여러 공급자에서 비교합니다. 전체 장치 가운데 746개는 표본이 세 개 이상이어서, 반복 실행의 흔들림과 장치 집단의 차이를 한 숫자로 섞지 않고 나눌 수 있었습니다.
측정 범위가 작다는 점은 한계이기도 합니다. 행렬 곱셈과 메모리 복사는 진단용 시험이지 AI 클러스터 전체가 아닙니다. 호스트 CPU, PCIe, 네트워크 패브릭, 스토리지, 집단 통신, 가상화 간섭, 장애 복구는 대부분 범위 밖입니다. 다만 짧은 시험은 수천 번의 대여에서 반복할 수 있고, 응용보다 아래 계층에서 차이가 시작되는지 확인하기에 적합합니다.

한 장치를 반복 실행한 결과만으로는 전체 차이를 설명할 수 없는 이유
논문이 평가한 모델에서 같은 장치를 반복 실행했을 때의 최대 정규화 범위는 모두 9%보다 작았습니다. 대부분은 더 안정적이었습니다. FP16 행렬 곱셈에서는 장치의 83%가 2% 이내에 머물렀고, 장치 메모리 복사에서는 92%가 2% 이내였습니다. 예열, 동기화, 반복 표본은 여전히 필요하지만 실행 잡음만으로는 클라우드 재고에서 나타난 큰 차이를 설명할 수 없습니다.
장치 집단의 범위는 훨씬 넓었습니다. H100 PCIe의 공급자 사이 FP16 범위는 34.49%였고, H200 SXM의 메모리 복사 범위는 37.82%였습니다. A100 SXM4도 FP16에서 19.12%, 메모리 복사에서 17.19%를 기록했습니다. 여러 항목에서는 한 공급자 안의 범위가 공급자 사이 결과와 거의 같았습니다. 한 공급자를 선택했다고 해서 성능 분포가 하나의 값으로 줄어들지는 않았습니다.

H200 결과는 절대값이 함께 제시되어 차이를 해석하기 쉽습니다. 익명 공급자 한 곳의 평균 메모리 복사 대역폭은 4,145GB/s였고 다른 곳은 3,170GB/s였습니다. 차이는 31%입니다. 일부 분포는 3TB/s와 4TB/s 부근의 두 무리로 나뉘었습니다. 저자들이 원인을 규명하지 않았으므로 추가 근거 없이 펌웨어, 전력 제한, 냉각 정책, 실리콘 선별 가운데 하나를 원인으로 지목해서는 안 됩니다.
공급자와 물리 장치가 함께 상품을 구성하는 방식
저자들은 공급자, GPU 식별자, 측정 월을 변수로 성능을 회귀 분석했습니다. 측정 월이 설명한 변동은 1% 미만입니다. GPU 식별자가 설명한 비중은 32~73%였고, 보고한 일곱 모델 가운데 여섯 모델의 결정계수(R²)는 0.97~0.99였습니다. 저자들은 시간에 따른 변화보다 물리 장치의 차이가 지배적이라고 해석합니다.
지속되는 차이가 있다는 근거는 강하지만 제조 편차의 원인을 직접 증명한 것은 아닙니다. GPU UUID는 각 공급자의 환경 안에 포함되어 있습니다. 분석은 펌웨어, 냉각, 호스트 구성, 보드 전력 제한, 실리콘 선별, 데이터센터 운영 정책을 독립적으로 무작위화하지 않았습니다. 따라서 결론은 더 좁게 잡아야 합니다. 할당받은 장치의 식별자는 성능을 예측하는 정보이며, 구매자는 이를 기록하고 교체된 장치를 다시 시험해야 합니다.
공급자의 기본 구성도 측정 대상인 상품에 포함됩니다. 사용자는 보드, 호스트, 펌웨어, 드라이버, 전력 정책, 운영 제어가 결합된 서비스를 받습니다. 논문에 나온 두 익명 공급자의 H100 PCIe 평균 FP16 차이는 약 9%입니다. 고객이 구성을 바꿀 수 없다면 이 차이는 같은 실리콘을 사용해도 실제 구매 성능의 차이입니다.
마이크로벤치마크가 실제 작업 예측에 유효한 조건
논문은 두 시험을 vLLM에서 실행한 Llama-3.1-Nemotron-Nano-4B-v1.1 서비스와 연결합니다. BF16 모델의 가중치는 8.4GiB이고 KV 캐시에 58GiB를 배정했습니다. 채팅 시험은 입력 128토큰과 출력 128토큰, 요약 시험은 입력 4,096토큰과 출력 512토큰을 사용했습니다. 동시 요청 수는 1, 25, 50, 100입니다. 텐서 병렬화와 응용별 튜닝은 적용하지 않았습니다.
두 작업은 서로 다른 하드웨어 자원을 사용합니다. 동시 요청 100의 채팅에서는 H100 처리량이 H200보다 약 3% 높았습니다. 요약에서는 H200이 동시 요청 25에서 10%, 100에서 16% 앞섰습니다. 입력이 길고 동시에 많은 KV 캐시 트래픽이 발생하면 H200의 큰 메모리 시스템이 더 유용해집니다. 따라서 어떤 GPU가 더 좋은지는 모델명만으로 정해지지 않습니다. 입력과 출력 길이, 동시 요청 수가 어느 자원을 실제 성능으로 바꿀지 결정합니다.
응용 시험의 표본은 마이크로벤치마크보다 훨씬 작습니다. H100 SXM은 두 공급자의 장치 18개에서 표본 61개, H200 SXM은 한 공급자의 장치 9개에서 표본 23개를 얻었습니다. 한 공급자의 최대 처리량 범위는 6.3%였습니다. 다른 공급자의 동시 요청 100 채팅 시험은 H200에서 29%, H100에서 53%까지 벌어졌습니다. 응용 변동이 짧은 시험보다 커질 수 있음을 보여 주지만 표본 수와 구성이 고르지 않으므로 메모리 대역폭 범위를 토큰 처리량으로 바꾸는 보편적인 식을 만들 수는 없습니다.
QuickMark는 진단 도구로 써야 합니다. 메모리 복사 대역폭과 긴 문맥 작업이 함께 낮다면 병목 위치를 좁힐 수 있습니다. 연산 시험만 달라지고 응용 성능이 같다면 다른 자원이 제한 요인일 수 있습니다. 실행이 쉽다는 이유로 실제 구매 작업을 마이크로벤치마크 하나로 대체해서는 안 됩니다.
토큰당 비용은 특정 날짜의 관측값
연구진은 측정 처리량과 하루 동안 수집한 공개 대여 가격을 결합했습니다. 같은 GPU 모델 안에서 가장 좋은 값과 나쁜 값의 토큰당 비용 차이는 최대 1.61배였습니다. 이 최대 차이가 나온 H100 비교에서는 성능 분포보다 공급자 간 가격 차이가 주된 원인이었습니다. H100과 H200의 비용 대비 처리량 분포는 겹쳤으므로, H200이 요약 작업을 더 빨리 처리해도 가격이 높으면 적절한 가격의 H100보다 비용당 유효 토큰 수가 낮을 수 있습니다.
TFLOPS보다 구매 질문에 가까운 결과이지만 날짜 조건을 떼어 내면 안 됩니다. 클라우드 가격, 장기 약정 할인, 데이터 전송료, 최소 계약, 재고, 선점 회수 정책은 바뀝니다. 하루의 공개 가격은 필요한 수량을 한 장애 구역에 동시에 확보할 확률과 운영 비용도 포함하지 않습니다. 1.61배는 논문의 가격 관측일에 나타난 범위이며 시장의 고정 상수가 아닙니다.
비용 계산에는 서비스 수준 목표(SLO)를 충족한 요청만 넣어야 합니다. 꼬리 지연, 정확도, 가용성 조건을 위반한 응답의 토큰은 경제적 가치가 작을 수 있습니다. 대여 가격에 포함된 전력도 코로케이션이나 장기 계약에서는 별도 비용으로 다시 나타납니다. 올바른 분모는 전체 계약 기간에 성공적으로 완료된 유효 작업입니다.
클라우드 GPU 검수에 필요한 네 단계
첫째, GPU 폼팩터, 리전, 호스트 등급, 드라이버, GPU UUID를 기록합니다. 같은 물리 장치에서 시험을 반복해 실행 잡음을 구합니다. 그다음 새로운 인스턴스를 여러 번 할당받아 장치와 공급자 차이가 평균 안에 숨지 않도록 측정합니다.
둘째, 실제 응용을 다시 실행합니다. 모델 버전, 정밀도, 입력·출력 길이 분포, 동시 요청, 배치 정책, 런타임, 지연 목표를 고정합니다. 여러 할당에서 처리량의 P5, P50, P95와 꼬리 지연, 실패율을 함께 보고해야 합니다. 평균값만으로는 재고 하단이 서비스 계약을 위반하는지 알 수 없습니다.
셋째, 같은 날짜와 같은 약정 조건으로 비용을 계산합니다. 실제 사용 가능 시간, 예약 조건, 데이터 전송, 오케스트레이션 비용, 하나의 장애 구역에서 확보 가능한 용량을 포함합니다. 마지막으로 호스트 교체, 드라이버 갱신, 성능 변화가 어느 수준에 이르면 다시 시험할지 정합니다. 검수 규칙은 첫 인스턴스가 종료된 뒤에도 유지되어야 합니다.

이 절차를 적용하면 계약 문구가 달라집니다. H100이라는 이름만 성능 조건으로 받지 않고, 작업과 구성, 표본 수, 하위 백분위 기준, SLO, 재시험 조건을 명시할 수 있습니다. 공급자는 가장 좋은 장비 한 대가 아니라 반복해서 공급 가능한 재고 분포로 답하게 됩니다. SKU는 호환성을 확인하는 데 필요하지만 실제 공급 성능을 입증하기에는 충분하지 않습니다.
표준 벤치마크가 이 시장에 주는 교훈
저희 SPEC CPU 2026 리뷰에서 다룬 문제도 같은 흐름에 있습니다. 실행 규칙이 다른 시스템을 비교할 수 있고 그 결과가 실제 구매 결정을 바꿀 때 벤치마크의 가치가 생깁니다. SPEC CPU 2026은 서로 다른 CPU 작업을 재현 가능한 방식으로 구성합니다. DCPerf는 실행 가능한 시험 모음이 운영 서비스를 충분히 잘 예측해 서버 구매에 쓸 수 있는지 묻습니다. MLPerf Power는 에너지 측정 경계를 정하고, MLPerf Storage는 가속기에 데이터를 공급하는 스토리지 계층을 드러냅니다.
이 GPU 클라우드 논문은 다른 계층을 채웁니다. 중립적인 산업 표준을 제안한 논문은 아니며 Silicon Data는 벤치마크 제품을 판매하는 회사입니다. 대신 표준화된 시험이 표현해야 할 재고의 분포를 측정했습니다. 어느 익명 공급자가 이겼는지보다 중요한 질문은 비교 단위를 구성한 가속기 한 대로 볼지, 공급자가 반복해서 제공할 수 있는 범위로 볼지입니다.
각 벤치마크 유형은 서로 보완합니다. 규격은 실행 규칙을 고정합니다. 대표성 검증은 시험이 운영 작업을 제대로 반영하는지 확인합니다. 집단 연구는 구매한 상품이 균일한지 확인합니다. 비용 연구는 결과를 구매자가 지불하는 분모 위에 놓습니다. 네 가지를 점수 하나로 합치면 공유하기는 쉬워도 엔지니어링 판단에는 약해집니다.
이 논문으로 판단할 수 없는 것
공급자 이름이 공개되지 않았으므로 특정 클라우드의 현재 구매 순위나 우열을 주장할 수 없습니다. 재고 표본은 균형 잡힌 무작위 실험이 아니라 이용 가능한 인스턴스를 확보해 측정한 결과입니다. GPU 모델과 공급자별 표본 수가 다르고 LLM 서비스 표본은 특히 작습니다.
연구 범위는 NVIDIA 가속기와 두 마이크로벤치마크입니다. CPU, PCIe, 네트워크, 스토리지, 집단 통신, 텐서 병렬화, 전문가 병렬화, 다중 노드 스케줄링, 장애 복구를 분리해 평가하지 않았습니다. 4B 모델과 인위적으로 정한 시퀀스 길이도 모든 운영 모델을 대표하지 않습니다. 공급자 기본 소프트웨어를 사용한 방식은 실제 대여 환경에 가깝지만 하드웨어, 펌웨어, 소프트웨어의 원인을 분리하기 어렵게 만듭니다.
Silicon Data는 SiliconMark 벤치마크와 시장 지표를 개발하고 판매합니다. 이러한 사업 관계가 측정값을 무효로 만들지는 않지만 방법 공개, 공급자별 균형 표본, 재현 가능한 코드, 독립 검증에 더 엄격한 기준을 요구합니다. 공개 논문은 측정 방법과 라이선스를 설명하지만 공급자 이름과 전체 원시 재고 자료를 공개 비교 데이터로 제시하지는 않았습니다.
구매 단위는 GPU 모델이 아닌 성능 분포
이 논문은 클라우드 GPU 성능이 들쭉날쭉하다는 경험담을 측정 계층으로 바꿉니다. 같은 장치의 반복 잡음은 대체로 가장 작은 층입니다. 물리 장치와 공급자 사이에는 지속되는 차이가 있으며 일부는 LLM 처리량과 토큰당 비용까지 이어집니다. 모든 차이의 숨은 원인을 밝힌 것은 아니지만 GPU 이름 하나가 실제 성능을 하나의 값으로 정한다는 가정을 버리기에는 충분합니다.
운영자가 바꿀 일은 분명합니다. GPU 식별자를 보존하고, 여러 할당을 표본으로 뽑고, 실제 요청 분포를 재생한 뒤, 백분위 성능 범위를 구매해야 합니다. 공급자가 이 분포를 공개하면 상품의 신뢰성을 차별화할 수도 있습니다. 다음에 필요한 벤치마크는 최고 성능 숫자 하나가 아니라 고객이 실제로 받을 작업량을 재현 가능한 계약으로 만드는 시험입니다.
출처와 저작권 안내
이 글은 독립적인 표현, 자체 제작한 개념 하드웨어 도판 한 점, 코드로 새로 그린 도판 두 점으로 작성한 편집 요약입니다. 원문의 문장·도판·표 배치를 복제하지 않았으며 저자가 보고한 수치만 다시 그렸습니다. 공개 논문은 CC BY-NC-ND 4.0이며 저작권은 저자에게 있습니다. (c) 2026. Silicon Data는 논문에서 다루는 상용 벤치마크와 시장 지표 제품을 개발합니다.