파이프라인 병렬화는 모델의 층이 비슷할수록 다루기 쉽습니다. 층을 고르게 나눠 단계에 배치하고, 여러 마이크로배치를 흘려보내면서 한 단계의 통신을 다른 계산과 겹치면 됩니다. Qwen3-Next는 이 전제를 깨뜨립니다. 선형 어텐션 층 세 개 뒤에 전역 어텐션 층 하나가 오고, 모든 층 뒤에는 희소 전문가 혼합(MoE)이 붙습니다. 층 조합마다 연산과 통신의 비율이 달라서 단독 실행 시간의 합이 같은 단계도 중첩 후에는 속도가 달라집니다.
Alibaba 클라우드가 OSDI 2026에 공개한 Tessera는 Qwen3와 Qwen3-Next 사전학습에 사용한 파이프라인 프레임워크입니다[1]. 소규모 시제품의 최고값이 아닙니다. Hopper GPU 4,096장부터 12,288장까지 다섯 운영 환경 작업에서 기존 내부 시스템보다 처리량이 20~33% 늘었습니다. 1조 매개변수 Qwen3 작업에서는 모델 FLOP 이용률(MFU)이 39%에 도달했습니다. 수치도 크지만, 이 논문의 핵심은 파이프라인의 일정과 구간 나누기를 따로 최적화할 수 없다는 설명에 있습니다.
층 수는 같은데 단계가 달라지는 이유
희소 MoE 학습은 토큰을 전문가로 보내고 되받는 올투올 통신을 수행합니다. 다른 마이크로배치의 행렬곱을 옆에 배치하면 전송 시간 일부를 가릴 수 있습니다. 문제는 어떤 연산끼리 같은 실행 구간에서 만나는지에 따라 감춰지는 비율이 달라진다는 점입니다. Tessera의 실측에서는 층 조합에 따른 중첩 이득이 3배까지 벌어졌습니다. 층 개수를 세거나 각 연산의 단독 시간을 더하는 방식은 단계의 실제 비용을 잘못 계산합니다.
의존 관계는 양방향입니다. 층을 어떻게 나누느냐에 따라 가능한 중첩 조합이 정해지고, 좋은 구간 나누기를 고르려면 그 조합을 실제로 실행한 시간이 필요합니다. 기존에는 새 모델 구조가 나올 때마다 전문가가 이 관계를 몇 주 동안 손으로 맞췄다고 저자들은 설명합니다. GPU가 1만 장을 넘으면 실행 중의 변화도 커집니다. 매 반복 단계에서 전문가로 가는 토큰 수가 달라지면서 정적 계획이 정확히 예측할 수 없는 짧은 유휴 구간이 생깁니다.

일정을 실측하고, 나눈 뒤, 남은 빈틈을 채우는 방식
Tessera는 층을 전문가 전송, 행렬곱, 결과 결합 같은 작은 작업으로 분해합니다. 중첩 스케줄러는 두 작업 묶음 사이에서 의존성을 지키는 실행 순서를 찾고, 목표 GPU에서 전체 소요 시간을 측정합니다. 단순한 분석 모델에만 의존하지 않는 이유가 있습니다. GPU 자원 경합과 커널 동작 때문에 개별 작업 시간을 합한 값보다 중첩한 상태의 실측값이 더 정확했기 때문입니다.
구간 분할기는 이 중첩 후 비용을 사용해 단계를 맞춥니다. 가능한 조합의 일정을 먼저 만들고 측정한 다음, 실제 병렬 실행 시간을 기준으로 층 경계를 고릅니다. 동적 빈 구간 최적화기(Dynamic Bubble Optimizer)는 학습 중 라우팅 메타데이터를 보고 곧 생길 빈 구간을 예측해 미룰 수 있는 작업을 옮겨 넣습니다. 각 전문가 병렬 그룹 안에서 독립적으로 동작하므로 GPU 수가 늘어도 하나의 중앙 제어기가 병목이 되지 않습니다.
세 기능은 맡은 범위가 다릅니다. 스케줄러는 무엇을 겹칠지 정하고, 구간 분할기는 모델의 작업 묶음을 어디에 놓을지 정합니다. 동적 최적화기는 확률적인 라우팅 변화가 남긴 여유를 회수합니다. 이를 모두 뭉뚱그려 파이프라인 최적화라고 부르면 어느 조건에서 어떤 이득이 사라지는지 알기 어렵습니다.
최고값 하나보다 중요한 다섯 작업
운영 환경 평가는 중형부터 1조 매개변수까지 Qwen3와 Qwen3-Next를 포함합니다. GPU 8,192장의 Qwen3-L은 MFU가 29.7%에서 36.3%로 올라 처리량이 22.0% 늘었습니다. 같은 규모의 Qwen3-XL은 32.0%에서 39.0%로, GPU 4,096장의 Qwen3-Next-M은 16.7%에서 20.0%로 개선됐습니다. 가장 큰 GPU 12,288장 Qwen3-Next-XL은 15.9%에서 21.1%로 올라 처리량 이득이 32.8%였습니다. 별도의 GPU 256장 통제 실험에서는 공개 설정을 사용한 Megatron-Core MoE보다 MFU가 최대 1.24배 높았습니다[3]. 서로 다른 평가 조건의 수치를 하나로 섞어 읽으면 안 됩니다.
한 운영 환경 기록에서는 기능별 기여도도 보입니다. Tessera의 정적 계획을 적용하자 처리량이 약 13% 늘었고, 이 중 약 9%가 단계 균형 개선에서 나왔습니다. 이후 동적 빈 구간 채우기를 켜자 Qwen3-XL의 MFU가 39.0%에 도달했습니다. 또 다른 GPU 6,144장 작업에서는 동적 기능만으로 파이프라인 유휴 시간이 641 ms 줄고 처리량이 3.4% 증가했습니다.

겹쳐 놓을 연산이 부족하면 통신은 남는 부분
중첩은 통신 옆에 충분한 유효 연산이 있어야 작동합니다. GPU 8,192장의 1조 매개변수 Qwen3-Next 작업에서는 전문가 병렬 통신의 73%를 감춰 전체 반복 단계 시간 중 노출된 비중을 8.3%로 줄였습니다. 반면 GPU 5,120장의 중형 작업은 전문가 하나가 수행하는 행렬곱이 짧아서 26%만 감췄고, 노출된 전문가 통신이 반복 단계의 38.9%를 차지했습니다. 소프트웨어가 틀린 것이 아니라 전송 시간을 덮을 만큼 긴 계산 구간이 없었습니다.
유리한 작업에도 개선 여지는 남습니다. 노출된 전문가 통신과 파이프라인 유휴 시간을 더하면 반복 단계의 17%입니다. 시작과 끝의 준비·마무리 구간에는 동시에 실행할 마이크로배치가 적어 구조적인 빈틈이 생깁니다. Tessera는 통신을 없애는 시스템이 아니라, 달라진 모델 구조를 따라갈 수 있는 계획기를 보여 줍니다.
여기서 얻을 수 있는 더 큰 결론은 모델 구조가 클러스터 스케줄링의 일부가 됐다는 점입니다. 선형 어텐션, 전역 어텐션, 희소 전문가는 알고리즘 선택이지만 GPU 1만 장에서는 어느 통신을 숨길지, 어느 단계가 병목이 될지, 설치한 연산 자원을 얼마나 쓸지가 이 선택에 의해 정해집니다. 동일한 Transformer 블록만 가정한 학습 프레임워크는 이미 지나가고 있는 모델 세대를 최적화합니다.
GPU 수 다음에 적어야 할 숫자
대규모 학습을 소개할 때는 모델 크기와 GPU 수를 먼저 적습니다. Tessera는 이 두 값만으로는 설치한 연산 자원이 왜 유효 토큰으로 바뀌지 못했는지 설명할 수 없음을 보여 줍니다. 같은 GPU와 같은 병렬화 규모를 사용해도 모델 구조가 통신을 덮을 연산 구간을 얼마나 제공하느냐에 따라 처리량이 크게 달라집니다. 앞으로의 용량 보고에는 최소한 연산 중첩 뒤의 스테이지 불균형, 집합 통신별로 드러난 통신 비율, 동적 보정 뒤에도 남은 파이프라인 유휴 시간을 함께 기록할 필요가 있습니다. MFU가 전체 손실의 크기를 말한다면 이 세 값은 다음 최적화 비용을 어디에 써야 하는지 알려 줍니다.
Qwen3-Next-XL의 32.8% 개선을 큰 작업일수록 Tessera가 더 유리하다는 법칙으로 읽어서도 안 됩니다. 가장 큰 작업은 기존 MFU가 가장 낮았고, 어텐션과 MoE가 섞이는 방식도 특정합니다. 다른 모델에 결과를 옮기려면 층 조합을 실측한 뒤 스테이지 비용과 통신을 덮을 연산 구간이 논문의 사례와 비슷한지 확인해야 합니다. GPU 수는 평가 규모이지 개선 원인을 설명하는 변수가 아닙니다.
하드웨어와 소프트웨어의 경계도 여기서 드러납니다. 노출된 전문가 통신이 38.9%인 GPU 5,120장 사례에는 더 빠른 패브릭이 도움이 되지만, 대역폭만으로 잘못 나눈 스테이지를 고칠 수는 없습니다. 반대로 계획기가 좋아도 전문가 행렬곱이 짧으면 긴 전송을 덮지 못합니다. 모델 설계자는 전문가 크기, 라우팅 균형, 어텐션 순서가 품질뿐 아니라 집합 통신 비용도 바꾼다는 정보를 받아야 합니다. Tessera의 오래 남을 가치는 이 비용을 수 주짜리 학습을 시작하기 전에 측정 가능한 값으로 만든 데 있습니다.
기능별 결과를 보면 최적화 순서도 정할 수 있습니다. 먼저 모든 마이크로배치에 반복해서 부담을 주는 지속적인 스테이지 불균형을 없애야 합니다. 그다음 순간적인 라우팅 변화가 만든 빈 구간을 회수하고, 두 작업 뒤에도 남은 노출 시간을 패브릭 문제로 분류합니다. 이 순서를 지키면 스케줄링 문제를 네트워크 증설의 성과로 잘못 설명하거나, 옆에 덮을 연산이 없는 통신까지 스케줄러의 실패로 판단하는 일을 줄일 수 있습니다. 모델이나 커널이 바뀔 때는 중첩 후 비용표, 선택한 분할, 남은 통신 시간을 함께 다시 만드는 회귀 시험이 필요합니다.
논문이 충분히 비용에 넣지 않은 문제는 프로파일의 유효 기간입니다. 커널 버전, 배치 모양, 라우팅 분포, GPU 펌웨어가 바뀌면 모델 그래프가 같아도 중첩 결과는 달라질 수 있습니다. 프로파일을 너무 늦게 갱신하면 나쁜 계획을 유지하고, 너무 자주 하면 귀한 클러스터 시간을 씁니다. 실제 시스템은 프로파일이 예측한 스테이지 시간과 관측값의 오차를 기록하고, 오차가 지속될 때만 재계획을 실행하며, 프로파일링 비용도 처리량 이득에서 빼야 합니다. 이 수명주기 관리가 없으면 중첩을 고려한 계획도 배포 첫날에만 정확한 정적 설정이 될 수 있습니다.
비용 모델은 실행 결과와 계속 대조해야 할 이유
Tessera의 분할과 중첩 계획은 층과 통신 프로파일의 예측 오차에 의존합니다. 운영 환경에서는 스테이지, 노출된 집합 통신, 동적 빈 구간마다 예측과 관측 시간을 남겨야 합니다. 전체 단계 시간만 맞으면 서로 상쇄된 오류가 다른 작업에서 잘못된 계획을 고를 수 있습니다.
MoE 라우팅과 공유 패브릭은 꼬리 변동을 만들므로 평균뿐 아니라 분포나 보수적 범위가 필요합니다. 동적 보정이 같은 정적 오류를 반복해서 고치면 이를 무료 용량으로 보지 말고 프로파일과 목적 함수를 갱신해야 합니다. 재분할에는 상태 이동과 통신 그룹 재구성이 들기 때문에 남은 학습 시간 안의 회수 기간도 계산해야 합니다.
모델 변경에 필요한 시스템 차이 보고서
새 어텐션, 전문가 크기, 라우팅, 문맥 길이, 정밀도는 품질뿐 아니라 스테이지 비용, 활성값 메모리, 집합 통신, 통신을 덮을 연산 구간을 바꿉니다. 목표 규모의 예상 분할, 노출 통신, 메모리 여유, MFU를 모델 변경과 함께 보여 줘야 전체 할당 뒤에 병목을 발견하는 일을 줄일 수 있습니다.
연산량이 적은 모델도 짧은 커널과 더 많은 전문가 통신 때문에 단계 시간이 길어질 수 있습니다. 반대로 로컬 연산을 조금 늘려 전송을 더 많이 가릴 수 있습니다. 일정 변경 뒤 같은 시드와 단계에서 손실과 출력이 유지되는지도 검증해 의도하지 않은 수치 변화가 성능 이득에 섞이지 않게 해야 합니다.
장비 배치와 파이프라인 계획이 연결돼야 할 이유
같은 GPU 수라도 약한 링크, 혼합 장치, 불리한 랙 경계는 균형 잡힌 계획을 무너뜨립니다. 일반 GPU 수가 아니라 실제 배정 토폴로지를 비용 모델에 넣고, 장애나 재시작으로 모양이 바뀌면 계획을 다시 만들거나 손실 범위를 확인해야 합니다. 프로파일, 배치, 링크 상태를 체크포인트와 함께 남기면 이 판단을 재현할 수 있습니다.
최종 용량 보고는 MFU에서 빠진 시간을 스테이지 불균형, 노출 통신, 시작·종료 빈 구간, 라우팅 변동, 메모리 대기, 런타임 비용으로 나눠야 합니다. Tessera의 핵심은 한 번의 분할이 아니라 측정, 계획, 동적 보정, 관측 오차 갱신의 순환 구조입니다. 모델과 토폴로지, 전환 비용, 수치 검증이 이 순환에 들어가야 다음 작업에서도 정확합니다.
장비군 스케줄러는 이 정보를 수용 결정에도 사용할 수 있습니다. 같은 GPU 수의 두 후보 중 하나가 예상 집합 통신과 중첩에 맞는 토폴로지를 제공하면, 더 늦게 배정되더라도 전체 학습 완료 시각은 앞설 수 있습니다. 대기 시간과 예상 토큰 처리량을 함께 계산해 첫 빈 장치보다 완료 시각이 빠른 연결 영역을 선택해야 합니다. 이때 선택한 근거와 실제 결과를 남기면 다음 작업의 토폴로지 비용 모델도 보정할 수 있습니다.
출처와 저작권 안내
이 글은 Silicon & Systems가 작성한 편집 요약입니다. 인용 논문의 주장과 결과를 우리 표현으로 다시 썼습니다. 원문의 문장, 표, 도판은 옮기지 않았으며 두 도판은 보고된 수치를 바탕으로 새로 만들었습니다. OSDI 2026 논문의 저작권은 원저자에게 있으며, USENIX가 발표 페이지에서 원문을 공개합니다. 저작권 (c) 2026 원저자.