클라우드 렌더링은 로컬 3D 연산을 비디오 왕복으로 바꿉니다. 스마트폰이 탭, 드래그, 확대 동작을 보내면 서버가 장면을 갱신하고 다음 프레임을 인코딩해 WebRTC로 돌려 줍니다. 단말 연산과 모델 다운로드는 줄지만 motion-to-photon 지연이 쇼핑 상호작용의 일부가 되므로, 비트레이트 제어기는 예상 대역폭 중 얼마를 화질에 쓰고 얼마를 큐 방지 여유로 남길지 결정해야 합니다.
Alibaba의 측정은 한 세션 안에서도 목표가 바뀐다는 점을 보여 줍니다[1]. 사용자가 물체를 회전하거나 확대할 때는 세밀한 화질보다 반응성이 중요하지만, 멈춰서 상품을 살필 때는 같은 지연 부담 없이 비트레이트를 높일 수 있습니다. 기존 제어기는 두 구간에 같은 화질·지연 정책을 적용하며, 동작 프레임은 평균 22% 크고 p99 지연은 비동작 프레임의 1.9배이므로 반응성이 가장 중요한 순간에 큐를 만들기 쉽습니다.
MARC는 이 관측을 프레임 단위 제어로 바꿉니다. 다음 프레임이 연속 동작 구간에 속하는지, pacing rate와 RTT가 어떻게 변할지 예측한 뒤 10프레임 구간의 비트레이트를 고릅니다. 동작 중에는 지연 벌점을 높이고 상품을 살피는 동안에는 화질에 더 큰 가중치를 둡니다. 전체 기능은 서버에서 실행되므로 모바일 클라이언트는 바뀌지 않습니다.
혼잡제어 위에 놓인 사용자 동작 신호
혼잡제어와 비트레이트 제어는 연결돼 있지만 같은 문제는 아닙니다. WebRTC 혼잡제어기가 경로가 감당할 트래픽을 추정하면 인코더 제어기는 그 추정치 아래에서 얼마나 많은 비디오를 만들지 정합니다. 고정 여유를 두면 큐 증가는 막을 수 있지만 경로에 여유가 있을 때 화질을 낭비하고, 추정 대역폭을 모두 사용하면 큰 프레임 하나나 급격한 대역폭 저하가 뒤 프레임까지 지연시킵니다.
MARC는 혼잡제어기를 대체하지 않습니다. 현재 pacing rate, 전송 큐 길이, RTT를 받아 사용자 상태 신호를 추가합니다. 서버는 렌더링을 위해 이미 입력 이벤트를 받으므로 드래그나 확대를 별도 단말 계측 없이 동작으로 표시할 수 있습니다. 작은 예측기는 최근 프레임 상태에서 다음 동작 연속 구간을 추정하고, 모델은 가까운 미래의 큐 변화, 프레임 전송 시간, 네트워크 전달, 화질, 지연을 계산합니다.
목적함수는 프레임 화질에서 지연 벌점을 뺀 값을 누적합니다. 일반 지연 민감도와 동작 중 추가 민감도를 서로 다른 계수로 표현합니다. 큰 프레임이 큐를 채우면 그 프레임의 지연뿐 아니라 뒤에서 기다리는 모든 프레임의 비용도 증가합니다. 따라서 순수 반응형 제어기가 지연 상승을 본 뒤가 아니라 그 전에 다음 비트레이트를 낮춥니다. 비동작 구간이 안정되면 가용 대역폭을 세부 화질에 더 쓸 수 있습니다.

구현은 순차 최소제곱 최적화를 사용합니다. 10프레임 창의 평균 계산 시간은 24.6µs, 최대는 5.4ms로 30fps의 33ms 프레임 간격보다 짧았습니다. 다른 후보 solver는 매우 짧은 창에서 더 빨랐지만 창이 커지면 반복 제한 안에 답을 찾지 못하는 경우가 있었습니다. 운영 제어에는 낮은 평균만이 아니라 제한 시간 안에 나오는 답이 필요합니다.
전체 정확도보다 중요한 동작 시작 예측
오프라인 데이터는 2024년 2월 23일부터 3월 27일까지 수집한 20만 세션 이상과 18억 프레임을 포함합니다. 동작 프레임은 전체의 3.4%뿐이어서 대부분을 비동작으로 답해도 높은 전체 정확도를 얻을 수 있습니다. 원문이 보고한 다음 프레임 분류 정확도는 과거 길이에 따라 94~96%였지만, 동작 시작 정확도와 재현율은 각각 최대 약 36.8%와 36.7%였습니다.
한번 동작이 시작되면 여러 프레임이 이어지기 때문에 제어기는 여전히 효과를 냅니다. 최초 동작 이후 프레임의 예측 정확도는 72% 개선됐습니다. 첫 프레임은 제스처를 미리 알지 못해 높은 비트레이트로 나갈 수 있지만 뒤의 회전·드래그 프레임은 큐가 누적되기 전에 낮출 수 있습니다. 추적 실험에서 동작 예측을 제거하면 중앙값 전송 시간이 두 배가 됐고, 예측한 연속 구간은 정답을 사용한 결과에 가까웠습니다.
예측 오류에는 화질 비용이 있습니다. 비동작 프레임 약 2%를 동작으로 잘못 분류해 중앙값 목표 비트레이트가 정답 조건보다 3% 낮았습니다. 동작 프레임의 목표도 정답보다 5% 낮았습니다. 지연 감소가 공짜로 생긴 것이 아니라 불확실할 때 일부 화질을 지불한 결과이므로, 평가는 지연 하나가 아니라 화질과 함께 그린 동작 범위로 해야 합니다.
오프라인 실험에서 확인한 제어 메커니즘
추적 기반 시뮬레이션은 MARC를 WebRTC 기본 제어기와 여러 실시간 영상 전략에 비교했습니다. 비슷한 화질에서 MARC는 동작 프레임의 p95 queueing 및 send duration을 30~55% 줄였습니다. 비슷한 지연에서는 선택한 구성의 평균 비트레이트가 Duo보다 35% 높았고, 여러 비교 방식보다 동작 프레임 p95 지연이 33~101ms 짧았습니다.
전체 프레임에서도 일반 지연 계수를 바꾸면 더 나은 화질·지연 곡선이 나왔습니다. 비슷한 목표 비트레이트에서 p95 프레임 지연은 22~60% 낮았습니다. 논문의 모델로 계산한 세션 QoE 중앙값은 비교 방식보다 3~36%, p95 QoE는 1.3~21% 높았습니다. 이 값은 연구가 학습한 QoE 함수에 의존하므로 모든 서비스에 적용할 만족도 단위가 아니라 내부 비교의 일관성을 보여 줍니다.
영상 품질 시험은 여러 네트워크 추적에서 500프레임 영상을 사용했습니다. MARC와 WebRTC는 PSNR 47.74 대 48.13dB, SSIM 0.9933 대 0.9937, 모바일 VMAF 95.7 대 96.4였습니다. 평균 처리량 요구 차이는 3% 미만이었습니다. 동작 부근 비트레이트를 낮춰 큐를 막는 대신 객관 화질이 소폭 낮아진다는 예상된 교환을 확인한 결과입니다.
100만 세션에서 확인한 사용자 행동 변화
Alibaba는 Taobao 모바일 클라우드 렌더링 서비스에 MARC를 배포하고 요청을 MARC 또는 기본 WebRTC 제어기에 무작위 배정했습니다. A/B 시험은 2024년 4월 4일부터 11일까지 100만 세션 넘게 포함했습니다. 하나의 상품과 사용자 집단이라는 한계는 있지만 실험실 추적보다 실제 행동 근거가 강합니다.
프레임 지연은 중앙값에서 29%, p99에서 20% 줄었습니다. motion-to-photon 지연이 150ms를 넘은 동작 프레임 비율은 20% 감소했고 평균 세션 freeze rate는 71% 낮아졌습니다. 세션 시간은 9%, 세션 중 상호작용 시간 비율은 20% 늘었습니다. 이 지표만으로 매출 증가를 인과적으로 증명할 수는 없지만, 네트워크 개선이 서버 계측값을 넘어 사용자 행동에 영향을 줬음을 보여 줍니다.
추가 계산은 모두 서버에 남았고 세션당 절대 CPU 사용률은 1.3%포인트 증가했습니다. 평가한 렌더링 노드는 GPU당 약 열 세션으로 이미 GPU가 한계였으므로 CPU는 용량 경계 아래였습니다. CPU가 먼저 포화되는 서비스에서는 계산이 달라지며, 세션 수가 많으면 1.3%포인트도 스케줄링과 비용 제약이 될 수 있습니다.
새 전송 계층이 아닌 프레임별 정책
MARC는 조작과 관찰이 교차하는 클라우드 데스크톱, 원격 설계 도구, VR·AR 스트림에도 적용할 수 있습니다. 포팅에는 마우스나 컨트롤러 입력 검출만으로 부족합니다. 해당 사용자가 지연과 화질을 어떻게 맞바꾸는지 다시 측정해 목적함수를 보정해야 합니다. 의료 영상, 게임, 쇼핑 카탈로그는 같은 150ms에 서로 다른 벌점을 줄 수 있습니다.
가까운 미래의 pacing rate와 RTT가 안정적이라는 가정도 필요합니다. 원문은 관측한 동작 연속 구간의 첫 프레임들에서 변동이 작았다고 보고하지만, 무선 상태가 갑자기 바뀌거나 기존 큐가 길면 예측이 틀릴 수 있습니다. 더 복잡한 예측은 정확도를 높일 수 있어도 한 프레임 안에 끝나고 실패할 때 안전한 값을 내야 합니다.
프레임 비트레이트는 간접 제어입니다. 복잡한 장면에서는 인코더가 목표를 넘을 수 있으며 MARC는 codec 내부를 바꾸지 않고 기존 API를 사용합니다. 양자화 계수나 재인코딩을 이용하면 제어는 정밀해지지만 계산 비용이 늘어납니다. 패킷 손실 복구와 last-mile 스케줄링도 별도 motion-to-photon 지연으로 남습니다.
일반화할 시스템 교훈은 사용자 가치가 바뀌는 시간 단위에 목적함수를 맞추는 것입니다. 세션 하나도 단일 작업 종류가 아닙니다. 경로 용량은 그대로여도 지연과 화질의 상대 비용은 프레임마다 뒤집힐 수 있습니다. MARC는 제어 루프에 이미 존재하는 애플리케이션 신호로 자원 배분을 바꿀 수 있음을 보여 주며, 예측 실패와 화질 저하, 서버 비용, 온라인 행동을 지연 감소와 함께 보고해야 그 결과를 옮길 수 있습니다.
출처와 저작권 안내
이 글은 Silicon & Systems가 작성한 편집 분석으로, 논문의 측정과 제어기, 한계를 우리 표현으로 다시 썼습니다. 원문의 문장, 표, 도판은 재수록하지 않았고 도판은 이 글을 위해 새로 만들었습니다. 전체 논문은 USENIX ATC 2025 발표 페이지에서 확인할 수 있으며, 저작권은 저자에게 있습니다. 2025.