강화학습 후처리는 자원 특성이 다른 두 단계를 반복합니다. 롤아웃은 토큰을 생성하며 주로 메모리 대역폭에 묶입니다. 학습은 모델을 갱신하며 밀집 연산을 사용합니다. 추론용 GPU와 학습용 GPU로 분리하면 효율적으로 보이지만, 동기식 온폴리시 학습에는 엄격한 의존성이 있습니다. 학습은 새 궤적을 기다리고, 다음 롤아웃은 갱신된 가중치를 기다립니다. 한쪽이 일하는 동안 다른 유료 클러스터가 쉬게 됩니다.
HKUST, Alibaba 등의 연구진이 발표한 Weave는 스케줄링 단위를 바꿉니다[1]. 여러 RL 작업을 공동 실행 그룹에 넣고 한 작업의 의존성 대기 시간을 다른 작업의 실행 단계로 채웁니다. 롤아웃은 H20, 학습은 H800에 남고, 각 작업 안의 온폴리시 장벽도 유지합니다. 2단계 스케줄러가 호환되는 그룹을 고르고 각 단계를 순환 배치합니다. 호스트 DRAM에는 작업 상태를 남겨 전환 때 모델을 다시 읽지 않습니다.
저렴한 롤아웃 GPU가 클러스터 비용을 보장하지 않습니다
논문의 두 클러스터는 각각 400 Gb/s InfiniBand를 사용하고, 클러스터 사이 트래픽은 20 Gb/s Ethernet을 통과합니다. 평가 비용 모델에서 H800의 시간당 가격은 H20의 2.85배입니다. 분리형 구성은 연산이 많은 학습을 H800에, 메모리 대역폭을 많이 쓰는 롤아웃을 H20에 둡니다. 그러나 2주 트레이스 재생에서 독립 분리 방식은 시간당 940달러가 필요해 같은 위치에서 실행한 veRL의 710달러보다 비쌌습니다. 하드웨어 특화로 아낀 비용보다 유휴 시간이 크면 분리가 손해가 됩니다.
비동기 실행은 장벽을 없앨 수 있지만 학습 조건을 바꿉니다. 완전 비동기 방식에서는 롤아웃이 이전 파라미터를 사용하므로 샘플 노후화가 생깁니다. Weave는 단계 의존성이 정확도와 수렴 조건의 일부인 동기식 PPO, GRPO, DAPO 등을 대상으로 합니다. 스케줄러는 한 학습 단계가 잘못된 모델 버전의 궤적을 사용하지 않으면서 유휴 자원을 회수해야 합니다.
전역 배치는 작업별 모델 크기, 응답 길이, 배치 크기, 롤아웃·학습 시간 비율이 달라 어렵습니다. 롤아웃 시간은 확률적이며 긴 꼬리를 가집니다. 작업자는 가중치, 옵티마이저 상태, 데이터 파이프라인, 환경 상태를 수백 GB씩 유지합니다. 일반 GPU 시간 분할은 작업이 단계를 바꾼다고만 봅니다. 두 종류 자원에 순서 제약이 있고 매번 다시 읽기에는 상태가 너무 큰 스케줄링 문제라는 사실은 보지 못합니다.


공동 실행 그룹이 탐색 문제를 줄입니다
새 작업이 들어오면 Weave는 새 그룹을 만들기 전에 기존 그룹을 검사합니다. 직접 배치는 이미 비용을 낸 롤아웃·학습의 빈 구간을 사용합니다. 롤아웃 확장은 학습 용량은 남지만 추론 대역폭이 부족한 그룹에 상대적으로 저렴한 H20만 추가합니다. 둘 다 불가능하면 독립 그룹을 만듭니다. 모든 후보는 그룹의 기존 작업을 포함해 허용 지연 SLO를 지켜야 하고, 각 노드의 호스트 메모리에 상태가 들어가야 합니다.
수용 판단은 모든 응답이 설정한 최대 토큰까지 생성된다고 가정한 보수적 시간을 사용합니다. 최악의 롤아웃에도 용량을 확보한 뒤 실제로 빨리 끝난 시간을 런타임이 여유로 회수합니다. 이미 포화된 그룹은 상세 탐색 전에 제외합니다. 그룹 하나에는 대체로 작업이 10개 미만이므로 판단 시간은 활성 그룹 수에 거의 선형으로 늘어납니다. 시뮬레이션에서 동시 작업 2,000개의 배치를 591 ms에 결정했고, 완전 탐색은 작업 수가 늘어나면 현실적인 시간 안에 풀기 어려웠습니다.
그룹 안에서는 순환 스케줄로 모든 작업의 롤아웃과 학습을 한 번씩 실행해 하나의 메타 반복을 만듭니다. 논문은 이 순서가 분석 모델이 가정한 조건에서 의존성 대기 시간을 최소화함을 증명합니다. 긴 꼬리 이동 기능은 마지막 일부 롤아웃 요청을 같은 종류의 H20 일부로 옮기고 나머지 GPU가 다음 작업을 시작하게 합니다. 미세 시험에서 처리량을 1.06~1.28배 더 높였고, Qwen2.5 7B·14B·32B의 측정 보상 궤적은 달라지지 않았습니다.
세밀한 전환에는 준비된 상태가 필요합니다
평가한 70B 롤아웃을 처음 읽는 시간은 최대 135.8초, 학습은 최대 116초였습니다. 차가운 전환은 전체 RL 처리량을 최대 45% 낮출 수 있습니다. Weave는 작업을 그룹 노드에 고정하고 모델 가중치와 실행 상태를 호스트 DRAM에 남깁니다. 상태를 메모리에 남긴 전환은 7B70B 구성에서 롤아웃 0.91.9초, 학습 4.1~5.9초가 필요해 전환 시간을 최대 71.5배 줄였습니다.
그룹 크기는 메모리가 제한합니다. GPU 8개 노드에서 저장해야 할 롤아웃 상태는 7B의 275.7 GB부터 평가한 32B 구성의 490.3 GB까지였습니다. 학습 상태는 240520.4 GB였습니다. 호스트 메모리 12 TB인 노드에는 작업을 약 2~5개만 남길 수 있습니다. 모든 작업을 어느 노드에서든 실행하지 않고 제한된 지역성 영역을 만드는 이유입니다.
모델 동기화는 네트워크 계층을 구분합니다. 갱신된 파라미터 한 부를 여러 점대점 스트림으로 느린 클러스터 사이 링크에 보내고, 받은 뒤 빠른 로컬 패브릭으로 전파합니다. H800 8개에서 H20 8개로 보내는 시험에서 7B32B 모델의 동기화 시간이 veRL보다 7.878.33배 짧았습니다. 16개 대 16개 구성에서도 2.62~2.75배의 이득을 유지했습니다.
운영 트레이스는 이용률과 비용을 분리해 보여줍니다
주요 재생 시험에는 한 테넌트의 2주 RL 작업 200개가 포함됩니다. Qwen 계열 모델은 3B32B, 최대 응답 길이는 4,00032,000토큰, 평균 작업 시간은 27.9시간입니다. 각 작업에는 독립 실행 시간의 1~2배 사이에서 균등하게 뽑은 허용 지연을 부여했습니다. 물리 시험 장비는 롤아웃용 H20과 학습용 H800 풀을 따로 두었으며, 각 풀은 최대 328개로 구성했습니다.
Weave는 시간당 510달러, 전체 18만8,800달러로 트레이스를 실행했습니다. 독립 분리는 34만7,900달러, 롤아웃과 학습을 같은 GPU 풀에서 실행한 veRL은 26만2,800달러가 필요해 각각 1.84배와 1.38배의 비용 효율을 얻었으며 부여한 SLO를 모두 지켰습니다. 작업 200개 중 60.5%는 기존 그룹에 바로 들어갔고, 15%는 롤아웃 용량만 추가했으며, 24.5%는 새 그룹을 만들었습니다.
독립 분리와 비교하면 롤아웃 GPU의 의존성 대기 시간이 24.4%, 학습 GPU는 43.1% 줄었습니다. 최대 H800 수량은 328개에서 152개, H20은 328개에서 216개로 감소했습니다. 하나의 이용률보다 이 수량이 비용 결과를 더 잘 설명합니다. 운영 작업이 롤아웃 중심이어서 학습 GPU의 유휴 시간을 더 많이 줄였습니다.

보수적 계획에는 비용과 적용 경계가 있습니다
최대 토큰 길이로 계획하면 SLO는 보호하지만 일반적인 롤아웃보다 많은 용량을 남길 수 있습니다. Weave는 단계 비율이 보완적인 동시 작업이 여러 개 있어야 합니다. 작은 클러스터나 하나의 큰 작업만 있는 환경은 교환할 대기 시간이 적습니다. 여러 상태를 남길 충분한 호스트 메모리도 필요합니다. 20 Gb/s 클러스터 사이 링크에서는 토폴로지 인식 동기화의 가치가 특히 큽니다. GPU 가격 비율이나 링크 계층이 다른 환경은 비용 모델을 다시 계산해야 합니다.
주요 재생의 지연 SLO도 운영 요청에서 가져온 값이 아니라 논문이 부여한 값입니다. 대규모 최적성 시험은 Microsoft Philly의 작업 도착 트레이스에 합성 RL 프로파일을 붙였습니다. 작업부하 변화 시뮬레이션에서 정적 배치 비용은 실제 운영에는 비현실적인 시간당 전역 재그룹 기준의 1.11배 이내였지만, 혼합 변화 조건의 SLO 충족률은 95.6%까지 내려갔습니다. 장애가 난 작업은 마지막 체크포인트부터 다시 배치합니다. 다른 작업과 장애를 격리하지만 체크포인트와 마지막 반복 손실을 없애지는 않습니다.
완전 비동기 RL은 회수할 구조적 롤아웃·학습 대기 시간이 없으므로 적용 범위 밖입니다. 반대로 제한된 비동기 방식이라도 의존 구간을 유지하면 적용할 수 있습니다. 기준은 알고리즘 이름이 아니라 스케줄러가 볼 수 있는 유휴 단계의 존재입니다.
RL 용량은 단계, 상태, 장벽으로 가격을 정해야 합니다
분리형 후처리를 평가하는 운영자는 작업마다 네 가지를 기록해야 합니다. 롤아웃과 학습 시간의 분포, 노드에 남길 상태 크기, 네트워크 계층별 동기화 바이트, 독립 실행 대비 허용 지연입니다. 평균 GPU 이용률만으로는 새 작업이 기존 작업을 보완하는지 같은 단계를 두고 경쟁하는지 알 수 없습니다.
Weave의 핵심 결과에는 조건이 있지만 의미가 큽니다. 특화 하드웨어는 분리가 만든 장벽까지 스케줄러가 계산한 뒤에만 비용을 낮춥니다. H20이나 H800 하나가 독립된 자원이 아닙니다. 서로 맞는 두 단계의 실행 구간, 준비된 전환을 위한 호스트 상태, 이를 완료된 온폴리시 갱신으로 바꾸는 일정이 실제 자원입니다.
출처와 저작권 안내
이 글은 Silicon & Systems가 작성한 편집 요약입니다. 논문의 작동 원리, 평가 조건, 결과, 한계를 우리 표현으로 다시 썼습니다. 원문의 문장, 표, 도판은 옮기지 않았으며, 본문의 도판 3개와 카드 이미지는 보고된 사실을 바탕으로 이 글을 위해 새로 만들었습니다. 저작권 (c) 2026 원저자. 원문은 USENIX OSDI 2026 페이지에서 공개되어 있습니다.