지도학습은 배치를 읽고 순전파·역전파를 실행하며 그래디언트를 동기화하고 매개변수를 갱신하는 규칙적 내부 반복을 갖습니다. 강화학습은 서로 같은 비율로 확장되지 않는 시스템을 추가합니다. 롤아웃 엔진은 길이가 다른 응답을 만들고, 추론 또는 보상 모델이 평가하며, 도구는 외부 서비스를 기다리고, 훈련기가 승인 데이터를 소비합니다. 가장 느린 단계가 반복 속도를 정합니다.
정적 할당은 같은 구성요소가 계속 병목이라고 가정합니다. 추론 작업은 시작에 롤아웃 수요가 크지만 시퀀스가 끝나면서 급감할 수 있습니다. 에이전트 작업은 한 에피소드가 여러 도구 호출을 거쳐 모델에 다시 들어와 긴 꼬리 큐를 만듭니다. 줄어드는 구성요소에 묶인 GPU는 다른 단계가 장벽을 막는 동안 놀 수 있습니다.
DynaRL은 작업 안에 스케줄러를 둡니다. 파이프라인 구성요소와 의존성을 찾고 큐와 처리량을 관찰하며, 작업자 하나를 더 받을 때 이득이 큰 구성요소를 예측해 롤아웃, 추론, 도구, 훈련 사이로 자원을 옮깁니다. 한 엔진의 사용률이 아니라 전체 진행을 목적함수로 둡니다.
최소 처리량으로 정해지는 동기 파이프라인
반복이 모든 구성요소의 출력을 요구하면 정상 처리량은 가장 느린 구성요소 처리량에 묶입니다. 병목이 아닌 단계에 GPU를 더하면 지역 사용률은 올라가도 장벽은 변하지 않을 수 있습니다. 반대로 과잉 단계에서 GPU를 빼도 그 단계가 최소값에 가까워질 때까지 전체 성능은 유지됩니다.
DynaRL은 현재 자원과 관측 상태에 따른 구성요소 처리량 함수를 만듭니다. 계획기는 과잉 구성요소에서 작은 자원 단위를 꺼내 다른 후보에 주는 경우를 비교합니다. 결과 최소 처리량을 예측하고 전역 개선이 양수일 때만 적용합니다.
이 함수는 고정되지 않습니다. 배치, 시퀀스 길이, KV 캐시 점유, 병렬화 정도, 큐 깊이가 GPU 한 개의 한계 가치를 바꿉니다. DynaRL은 오프라인 모델만 믿지 않고 최근 측정으로 계속 보정합니다.

프레임워크별 이동을 숨기는 작업자 그룹
실행 계층은 각 논리 구성요소를 자원 집합에 묶인 작업자 그룹으로 표현합니다. 공통 이동 인터페이스가 롤아웃 엔진 중지, 훈련 병렬화 크기 조절, 상태 이동, 세밀한 지원이 없는 구성요소 재시작을 처리합니다. 전역 스케줄러는 엔진 내부 API를 모두 알지 않고도 자원을 판단할 수 있습니다.
이동 전략 비용은 다릅니다. 상태가 약한 롤아웃과 도구 작업자는 빠르게 중지·재개할 수 있습니다. 훈련기는 옵티마이저 상태, 모델 조각, 통신 그룹을 보유하므로 배치를 바꾸면 재분할이나 집단 통신 문맥 재생성이 필요합니다. 네이티브 경로가 없는 구성요소는 재부팅 이동으로 상태를 다시 읽습니다.
보고된 대부분의 경우는 약 1초에 바뀌지만 모델 크기와 작업자 수에 따라 비용이 달라집니다. 평가 조건에서 훈련기 이동은 전체 지연의 0.5% 아래였습니다. 이동을 상쇄할 만큼 반복이 길다는 조건이 포함된 백분율입니다.
구현은 RLinf 위 Python 약 7,000줄이며 전역 스케줄러, 이동, 그래프 추출, 라우팅 모듈로 나뉩니다. 동적 할당이 Kubernetes 복제 수만 바꾸는 일이 아니라 모델 및 통신 상태 안으로 들어간다는 소프트웨어 비용을 보여 줍니다.
진동을 줄이는 2단계 결정
텔레메트리는 잡음이 있어 큐가 잠깐 줄 때 작업자를 바로 옮기면 일시 변화를 쫓습니다. DynaRL은 먼저 일정 구간 동안 지속된 과잉 배치를 찾습니다. 이후 처리량 예측기로 후보 재배치를 평가하고 전역 결과가 좋아질 때만 바꿉니다.
검색 비용은 전체 GPU 수가 아니라 후보 자원 감소 수와 파이프라인 구성요소 수에 비례합니다. 강화학습 파이프라인은 보통 구성요소가 몇 개뿐이어서 GPU 128개에서도 스케줄링이 200밀리초 안에 끝납니다. 보고한 온라인 스케줄링 오버헤드는 1% 아래입니다.
임계값은 운영 절충을 담습니다. 보수적이면 짧은 기회를 놓치고 공격적이면 이동비를 내며 캐시와 통신 그룹을 흔듭니다. 거절 계획, 예측 오차, 마지막 이동 뒤 시간, 이동 후 실제 이득을 노출해야 합니다.
요청 스케줄링이 필요한 에이전트 긴 꼬리
자원 수만 바꿔서는 롤아웃 내부 선두 지연을 없앨 수 없으며, 다중 턴 에피소드는 모델 생성과 도구 실행을 번갈아 수행합니다. 초기 턴은 대체로 길고 후반 턴은 짧으며 완료에 가까워서, 모든 요청을 같게 다루면 거의 끝난 에피소드가 긴 첫 턴 뒤에 남습니다.
DynaRL은 완료한 도구 호출 수로 우선순위를 정해 끝에 가까운 요청을 먼저 처리합니다. 남은 짧은 일을 배출해 반복 장벽을 빨리 해제합니다. 전체 완료는 좋아지지만 새 에피소드가 늦어질 수 있으므로 공유 서비스에서는 공정성과 최대 대기 시간을 함께 둬야 합니다.
KV 캐시 동작도 결정에 포함해야 합니다. 요청을 옮기거나 순서를 바꾸면 재사용이 줄고 메모리 압력이 늘 수 있습니다. 초당 토큰만 보는 지역 스케줄러는 잠깐 빨라 보이면서 이후 재계산을 키울 수 있습니다.
작업 단계와 규모에 의존하는 결과
평가는 최대 GPU 128개의 H100 클러스터, 수학 추론 강화학습, 다중 턴 에이전트 작업을 사용합니다. 수학 추론은 여러 설정에서 정적 RLinf보다 약 1.43배에서 1.55배이며 전체 최대는 1.98배입니다. 에이전트 사례는 모델과 규모에 따라 1.06배에서 1.53배 개선됐습니다.
큰 클러스터는 전체 작업자 단위로 옮길 여지가 많아 이득도 커질 수 있지만, 최소 병렬 단위가 클러스터 대부분을 차지하는 작은 작업은 선택지가 적습니다. 롤아웃, 추론, 훈련이 계속 균형을 유지하는 작업도 얻을 것이 작습니다.
타임라인은 원인을 보여 줍니다. 활성 롤아웃 시퀀스가 줄면 스케줄러가 롤아웃 작업자를 빼 추론이나 훈련에 줍니다. 다음 단계가 꼬리와 겹쳐 실행돼 모든 롤아웃 GPU가 한꺼번에 유휴 상태가 될 때까지 기다리지 않습니다.
동적 할당이 넓히는 장애 표면
자원을 반납한 뒤 대상이 준비되기 전에 이동이 실패할 수 있습니다. 제어 평면에는 멱등 연산, 임대 소유권, 시간 제한, 이전 할당 복원 경로가 필요합니다. 체크포인트는 모델 버전, 옵티마이저 상태, 무작위 상태, 샘플 위치를 묶어 조용한 훈련 발산을 막아야 합니다.
스케줄러 자체도 성능 핵심 기반이 됩니다. 잘못된 예측기가 큰 작업을 반복 이동하고 오래된 의존 그래프가 데이터 흐름을 막을 수 있습니다. 안전 모드는 마지막 유효 할당을 고정하고 기존 강화학습 프레임워크가 계속 진행하게 해야 합니다.
다중 테넌트 연동은 별도 층입니다. DynaRL은 작업 안에서 재배치하지만 클러스터 스케줄러는 작업 총 할당을 정합니다. 일시 GPU 차용이 선점, 토폴로지, 전력, 공정성 정책과 충돌할 수 있으므로 두 제어기가 탄력 범위와 이동비 계약을 공유해야 합니다.
장치가 아니라 진행을 스케줄링하는 기준
DynaRL의 핵심은 강화학습 파이프라인 상태를 스케줄러에 보이게 만드는 것입니다. GPU 사용률만으로는 임계 경로의 유효 작업과 장벽 뒤에 쌓이는 작업을 구분할 수 없습니다. 큐 압력, 구성요소 처리량, 에피소드 진행, 이동비가 필요한 신호를 제공합니다.
여러 탄력 단계가 있고 반복 안 변화가 큰 장시간 동기 작업에 적합합니다. 구성요소가 고정돼 있거나 반복이 짧아 이동비를 상쇄하지 못하고, 외부 도구 지연이 클러스터 제어 밖에서 지배하면 매력이 줄어듭니다.
사후 훈련이 에이전트형으로 바뀌면서 스케줄링 단위도 균일 훈련 작업에서 변하는 서비스 그래프로 이동합니다. 운영 질문은 작업이 GPU를 몇 개 소유하는지가 아니라 다음 GPU 1초를 더 이른 검증 훈련 데이터로 바꿀 단계가 어디인지입니다.
재배치를 설명하는 회계 평면
각 재배치는 전후 토폴로지, 예측 병목, 예상 이득, 이동 바이트, 중지 시간, 캐시 손실, 실제 반복 시간 변화를 사건으로 남겨야 합니다. 이를 모으면 개선이 더 나은 배치에서 왔는지 단순히 자원을 더 쓴 결과인지 구분할 수 있습니다. 이동비가 예상 이득을 반복해서 넘는 구성요소도 찾을 수 있습니다.
훈련 정확성은 최적화기가 임의로 바꿀 수 없는 경계에 둬야 합니다. 자원 이동이 샘플 구성, 보상 연결, 갱신 순서, 무작위 상태 계보를 바꾸면 새 실험으로 선언해야 합니다. 작은 작업의 결정론적 재실행, 이동 전후 체크섬 연속성, 정적 일정과의 주기 비교로 조용한 발산을 찾을 수 있습니다. 처리량은 결과 정책이 훈련 프로그램이 의도한 정책일 때만 가치가 있습니다.
출처와 저작권 안내
이 글은 Silicon & Systems의 편집 분석입니다. 구조, 스케줄링 논리, 측정값, 한계를 자체 문장으로 재구성했습니다. 원문의 문장, 표, 도판을 복제하지 않았으며 본문 도판은 이 글을 위해 새로 만들었습니다. 논문은 USENIX OSDI 2026 발표 페이지에서 확인할 수 있습니다. 저작권은 저자에게 있으며 연도는 2026년입니다.