LLM 배치는 한 번의 용량 산정으로 끝나지 않습니다. 작업마다 모델, 가속기, 정밀도, 배치 정책, 런타임과 텐서·파이프라인·전문가·문맥·데이터 병렬화의 조합을 선택해야 합니다. 메모리에 들어가고 물리 연결 구조에 맞으면서 첫 토큰 시간(TTFT), 후속 토큰 지연과 비용 목표를 함께 지켜야 합니다. 대화형 서비스에서 좋은 선택은 오프라인 처리에는 낭비일 수 있습니다. 프리필에 맞는 구성이 디코드에는 맞지 않고, 밀집 모델을 전문가 혼합(MoE) 모델로 바꾸면 노드 사이의 병렬화 방식도 달라집니다.

Meta의 MLSys 2026 산업계 논문은 월간 사용자 약 10억 명에게 도달하는 Llama 서비스에서 이 조합 문제를 다루는 방법을 설명합니다[1]. 팀은 실측한 연산자 성능으로 가벼운 시뮬레이터를 만들고, 단계별 전체 성능을 조립하며, 메모리나 지연 기준을 어기는 구성을 제외한 뒤 나머지를 클러스터 처리량 또는 비용으로 정렬합니다. 일반적인 탐색은 런타임·하드웨어 선택 수천 개와 병렬화 조합 약 1,000개가 만나 수백만 개에 이릅니다.

하나의 런타임이나 가속기가 이긴다고 읽어서는 안 됩니다. 논문의 다섯 결론은 모두 조건이 붙습니다. 단계 분리는 지연에 민감한 온라인 서비스의 용량을 절약하지만 오프라인 처리량에는 이득이 거의 없습니다. 프리필과 디코드가 요구하는 자원이 다르면 서로 다른 가속기를 써서 예상 총비용을 낮출 수 있습니다. MoE가 일반적인 노드 간 네트워크에서 확장되려면 비싼 텐서 collective 대신 전문가 병렬화를 사용해야 합니다. 큰 밀집 모델이 넓고 지연에 민감한 병렬화를 요구할 때 스케일업 패브릭의 필요성이 커집니다. 어떤 조건인지 판정하는 과정이 오래 남는 기여입니다.

제약이 있는 배치 구성 최적화

시뮬레이터는 TTFT와 토큰 증가 지연을 서비스 한도 아래로 유지하면서 클러스터 초당 요청 수를 최대화합니다. 입력은 모델 구조, 요청 길이와 도착률, 하드웨어, 병렬화, 런타임과 SLO입니다. 모델 압축이나 추측 디코딩을 넣기 전에도 선택지가 많습니다. 2K 입력, 150 토큰 출력과 8K 문맥을 가진 70B 온라인 서비스는 출력 1K 토큰을 처리하며 대화형 마감 시간이 없는 오프라인 작업과 다른 시스템입니다.

Meta는 하드웨어마다 10만 개 이상의 마이크로벤치마크 결과를 모읍니다. GEMM, 어텐션, all-reduce와 all-to-all 등 주요 연산자를 여러 모양으로 측정합니다. 정확한 지점이 없으면 구간별 보간으로 연산자 시간을 추정합니다. 모델 조립기는 모델과 병렬화 선택을 연산자 모양으로 바꾸고, 임계 경로를 따라 통신과 런타임 비용을 포함합니다. 프리필과 디코드의 별도 추정값은 연속 배치 또는 분리형 런타임 모델로 들어갑니다.

보고된 검증에서 실측과 예측 지연은 대체로 5% 안에서 일치했고, 탐색은 몇 분 안에 끝나므로 작업과 하드웨어가 바뀔 때 다시 실행할 수 있습니다. 다만 이 정확도는 주로 측정 지점 근처의 중앙값과 평균에 해당하며, 저자들도 네트워크 변동이 p99를 바꿀 수 있다고 밝힙니다. 따라서 시뮬레이터는 배치 후보를 고르는 도구이며 운영 전 소규모 검증을 대신하지 않습니다.

탐색 가지치기도 시스템의 일부입니다. 메모리를 넘거나 SLO를 어기는 계획을 일찍 버리고, 일반적인 GPU 8장 연결에는 2의 거듭제곱 병렬화 수를 우선합니다. 비표준 포드 크기, 추측 디코딩의 수용률, 운영 환경의 MoE 라우팅, 전력 제한 장비와 총비용도 모델링할 수 있습니다. 전문가 경험에 머물던 배치 판단을 제약이 명시된 반복 가능한 실험으로 바꿉니다.

Meta의 배치 탐색 순환입니다. 실측 연산자와 운영 표본으로 성능 데이터베이스를 만들고, 모델·하드웨어·작업·런타임·병렬화·SLO에서 단계별 성능을 추정합니다. 실행할 수 없는 계획을 제거하고 남은 경계를 처리량 또는 비용으로 정렬한 뒤 실제 장비에서 검증합니다. 이 글을 위해 새로 만든 도판.

SLO가 비용을 보상하는 프리필·디코드 분리

프리필은 많은 입력 토큰을 병렬로 처리하므로 계산 성능의 영향을 크게 받습니다. 디코드는 상대적으로 적은 연산으로 가중치와 KV 상태를 반복해 읽어 메모리 대역폭이 중요합니다. 연속 배치는 두 단계를 같은 풀에서 실행해 운영이 단순합니다. 분리형 런타임은 단계마다 장비 수, 배치 크기와 병렬화를 따로 고를 수 있지만 비율 조정, KV 전송, 요청 연결과 별도 용량 경계를 추가합니다.

논문의 엄격한 온라인 조건에서 분리형 방식은 같은 지연 기준을 지키면서 Llama 3 70B에서 1.5~1.8×, 405B에서 1.8~2.2× 높은 처리량을 냈습니다. Meta는 온라인 서비스 대부분을 분리형으로 옮겨 약 30%의 용량을 절감했다고 보고합니다. 디코드 배치를 크게 만들어도 프리필을 늦추지 않는 것이 중요한 원인입니다.

오프라인 생성에서는 결론이 달라집니다. 토큰 지연을 엄격하게 제한하지 않으면 두 런타임 모두 깊은 파이프라인 병렬화와 큰 배치에 가까워집니다. 한 장비의 70B 조건에서는 연속 배치가 분리형보다 조금 높은 처리량을 냈습니다. 단계 분리로 늘어나는 운영 항목을 정당화하기 어렵습니다. 런타임 구조는 먼저 지연 조건을 정한 뒤 선택해야 합니다.

병렬화는 지연 여유도 사용합니다. 한 온라인 프리필 조건에서 TP4-PP2는 지연을 줄였지만 TP2-PP4보다 all-reduce가 늘어 처리량이 20% 낮았습니다. 최선의 계획은 최소 지연이 아니라 TTFT 여유를 통신 감소와 처리량에 쓰는 계획입니다. 같은 서비스의 디코드는 HBM 대역폭을 모으기 위해 TP8을 고를 수 있습니다. 단계 분리는 이 두 구성을 함께 사용할 수 있게 합니다.

제품 목록이 아닌 이종 하드웨어 비율

단계 분리는 서로 다른 가속기를 배치할 기회를 만듭니다. 계산 성능이 높은 장치는 프리필을, HBM 대역폭이 큰 장치는 디코드를 맡을 수 있습니다. 논문의 405B 온라인 예에서 프리필에 유리한 장비는 단계 처리량 88 QPS를 내지만 디코드는 77 QPS입니다. 대역폭이 큰 두 장비는 디코드에서 276 또는 277 QPS를 냅니다. 첫 장비의 프리필과 다른 장비의 디코드를 합치면 가장 좋은 동종 구성과 같은 전체 처리량을 얻습니다.

Meta의 비용 모델은 실제 가격 구조에서 이러한 혼합이 총소유비용을 15~25% 낮출 가능성을 계산했습니다. 실측된 보편적 할인율은 아닙니다. 필요한 프리필 대 디코드 장비 비율은 동종 한 구성의 0.88에서 이종 구성의 3.1 이상으로 바뀝니다. 트래픽, 토큰 길이, 가격, 공급, 전력, 소프트웨어 성숙도와 전송 비용이 모두 결과를 바꿀 수 있습니다.

장비군 운영은 단계 이름을 제품에 붙이는 것보다 어렵습니다. 여러 데이터센터에서 두 풀의 비율을 수요에 맞춰 유지해야 합니다. 어느 한 단계의 장비가 부족하면 전체 처리량이 제한되고 다른 풀의 여유 장비는 해결책이 되지 않습니다. 이종 장비는 스케줄러, 런타임과 공급 계획이 서비스의 요청 형태에 맞는 비율을 지킬 때만 비용을 줄입니다.

논문의 네 가지 조건부 선택입니다. 엄격한 온라인 SLO는 프리필·디코드 분리를, 오프라인 작업은 연속 배치를 선택할 수 있습니다. 계산형·대역폭형 장비 조합은 15~25%의 예상 TCO 개선 여지가 있습니다. 노드를 넘는 MoE는 전문가 병렬화가 유리하고, 매우 큰 밀집 모델은 스케일업 패브릭이 필요할 수 있습니다. 이 글을 위해 새로 만든 도판.

MoE가 허용하는 통신 방식

희소 MoE 모델은 토큰마다 일부 피드포워드 전문가만 사용합니다. 특히 프리필 계산량을 줄일 수 있지만 전체 파라미터 용량과 라우팅 통신은 남습니다. 논문은 시스템 효과를 분리하기 위해 가상의 405B급 MoE와 밀집 모델을 비교하고, 실제 Llama 4 Maverick으로 통신 동작을 확인했습니다. 가상 모델은 품질이 같은 대체재가 아니므로 처리량만으로 모델 선택을 결론 내리면 안 됩니다.

한 서버의 빠른 연결 안에서는 텐서 병렬화가 밀집·MoE 모델 모두에 동작합니다. 노드를 넘으면 반복되는 all-reduce가 비싸집니다. 전문가 병렬화는 전문가를 다른 장치에 두고 all-to-all로 토큰을 보냅니다. Llama 4 Maverick 디코드 실험에서 TP8을 두 서버의 TP16으로 넓히자 클러스터 QPS가 618에서 329로 줄었습니다. 서버 안의 TP8을 유지하고 서버 사이는 전문가·데이터 병렬화를 2개로 나눈 혼합 계획은 608 QPS를 유지해 차이가 2%에 그쳤습니다. 4개로 나눈 다른 혼합 계획은 더 많은 토큰을 덜 비싼 통신으로 처리해 899 QPS, TP8보다 45% 높은 결과를 냈습니다.

라우팅 균형도 입력값이며, 한 운영 작업에서는 128개 전문가 중 가장 바쁜 하나가 라우팅 토큰의 약 7%를 받았습니다. 프리필 지연은 가장 많이 배정된 전문가 영역을 따르므로 인기·비인기 전문가를 섞어 배치해야 하고, 디코드 비용은 활성 전문가가 가중치를 추가로 읽기 때문에 실제로 선택된 전문가 수의 영향을 크게 받습니다. 중간 배치 크기에서 세 가지 라우팅 가정은 예측 비용이 최대 3.5× 달랐습니다. 완전한 균형만 가정하는 시뮬레이터는 잘못된 배치를 고를 수 있습니다.

모델과 SLO가 요구하는 스케일업

논문은 가상의 1.8조 파라미터 밀집·MoE 모델에서 일반적인 8장 스케일아웃 서버와 64장 스케일업 포드를 비교했습니다. 밀집 모델이 넓은 텐서 병렬화를 요구하면 일반 노드 간 패브릭에서 all-reduce 비용이 유효 계산보다 빠르게 커집니다. 고대역폭 스케일업 패브릭은 넓은 TP를 유지하지만 32장과 64장에서도 수익 감소는 남습니다.

MoE에는 다른 경로가 있습니다. 전문가 병렬화는 평가 조건에서 넓은 all-reduce보다 통신 부담이 낮아 일반 서버 여러 대에서도 디코드를 확장했습니다. 스케일업은 더 낮은 지연과 높은 처리량을 제공하지만 스케일아웃도 실행 가능한 선택이며 장애 영역이 작습니다. 모든 대형 모델에 스케일업이 필요하다는 결론이 아닙니다. 모델 용량이나 지연 목표가 스케일아웃 패브릭이 감당하지 못하는 통신을 요구할 때 필요합니다.

차세대 장비와 가상의 1.8T 모델을 포함한 이 절의 많은 수치는 실측 연산자로 만든 시뮬레이션 결과입니다. 운영 실측과 구분해야 합니다. 장비 구매 전에는 공급자별 연결 구조, 전력, 가격, 공급 가능성, 장애 조건과 실제 작업을 넣어 다시 계산하고 대표 장비에서 선택한 경계를 검증해야 합니다.

선택 구성의 유효 기간

탐색기가 내놓은 답은 특정 작업 분포, 가격표, 장비 재고와 소프트웨어 버전에서만 최적입니다. 이 조건은 계속 바뀝니다. 제품 기능을 바꾸면 입력과 출력 토큰 길이가 달라지고, 양자화 커널은 계산과 메모리 사이의 균형을 옮기며, 특정 가속기가 부족한 기간에는 비용 순위가 뒤집힐 수 있습니다. 선택한 구성에는 어떤 가정에서 이겼는지와 그 가정을 다시 측정할 시점을 함께 기록해야 합니다.

예측 오차도 결정에 직접 넣어야 합니다. 모델의 중앙 예측에서 SLO를 간신히 지키는 구성과 오차 상한에서도 지키는 구성은 같지 않습니다. Meta의 모델은 일반적으로 중앙값과 평균 지연을 약 5% 이내로 예측했지만, 꼬리 지연이나 새 모델에서는 불확실성이 더 클 수 있습니다. 검증 오차에 비례한 안전 여유를 두고, 실제 서빙 소프트웨어에서 카나리 트래픽으로 확인한 뒤에만 여유를 줄여야 합니다.

구성을 바꾸는 비용도 정적인 TCO에는 보이지 않습니다. 가중치 이동, 캐시 준비, 병렬 그룹 재구성, 요청 비우기는 용량을 사용하고 전환 중의 지연 꼬리를 만들 수 있습니다. 정해진 운영 기간에 예상한 절감액이 전환 비용보다 클 때만 이동해야 합니다. 이종 장비에서는 장애와 정비도 고려해야 합니다. 수가 적은 종류의 가속기가 빠지면 전체 장비 수는 충분해 보여도 짝을 이루는 다른 계층을 쓰지 못할 수 있습니다.

이 조건을 지켜야 한 번의 탐색 결과가 반복 가능한 운영 절차가 됩니다. 추천마다 작업 추적값과 벤치마크 버전을 보존하고, 새 후보뿐 아니라 현재 구성을 다시 측정하며, 예측한 SLO를 그림자 요청이나 카나리 트래픽으로 검증해야 합니다. 문제가 생겼을 때 돌아갈 안전한 구성도 남겨야 합니다. 중요한 산출물은 비용이 가장 낮은 점 하나가 아니라, 근거와 불확실성, 전환 비용과 유효 기간을 운영팀이 확인할 수 있는 결정입니다.

탐색 과정이라는 운영 산출물

이 논문은 그대로 복사할 구성표가 아니라 판단 방향을 제공하며, 작은 모델은 필요한 장치가 적어 병렬화와 스케일업의 영향도 작습니다. 요청 길이 분포는 프리필·디코드 비율을, SLO는 허용 배치 크기를 바꾸며, 하드웨어 가격은 처리량이 같아도 이종 배치의 결론을 뒤집을 수 있습니다. 운영 p99까지 넣으면 중앙값 예측이 좋은 계획도 탈락할 수 있습니다.

이 방식을 도입하려면 작업 추적값, SLO, 모델 그래프, 커널과 collective 측정, 하드웨어 연결 구조, 장애 가정, 전력과 비용을 버전으로 관리해야 합니다. 런타임, 컴파일러, 펌웨어와 모델이 바뀔 때 어떤 프로파일이 오래됐는지 표시해야 합니다. 선택한 계획은 소규모 운영에서 단계별 p50·p99 지연, 대기, KV 전송, 처리량, 품질과 장애 복구를 확인해야 합니다.

우리는 이 논문을 유행어로 아키텍처를 선택하지 말라는 근거로 읽습니다. 단계 분리, 이종 가속기, MoE, 전문가 병렬화와 스케일업 패브릭은 독립적인 업그레이드가 아닙니다. 하나를 바꾸면 다른 선택의 실행 가능 범위가 달라집니다. 실측에 묶인 탐색 과정은 그 상호작용과 용량 수치의 기준을 드러냅니다. 최선의 배치는 가장 빠른 부품을 모은 구성이 아니라, 실제로 도착하는 작업에서 서비스 계약을 지키는 가장 낮은 비용의 구성입니다.

출처와 저작권 안내

이 글은 Silicon & Systems가 작성한 편집 요약으로, 논문의 방법, 사례와 한계를 우리 표현으로 재서술했습니다. 원문의 문장, 표와 도판은 재사용하지 않았으며, 본문 도판 두 장과 카드 이미지는 이 글을 위해 새로 만들었습니다. 논문은 MLSys 2026 proceedings에서 공개되어 있습니다. Copyright (c) 2026 the authors.