GPU 훈련 시스템은 집단 통신, 병렬화, 모델 FLOP 활용률을 최적화하지만 모든 스텝은 바이트에서 시작합니다. ByteDance 운영 환경은 엑사바이트 데이터를 HDFS에 보관하고 10억 매개변수 텍스트 모델부터 1조 매개변수 멀티모달 모델까지 훈련합니다. 이 데이터 레이크는 AI 이외 파이프라인과도 공유하므로 교체하려면 엑사바이트를 이동해야 합니다.

저자들은 90일간 훈련 추적 3만 개를 분석해 서로 다른 동기화 장애 세 개를 찾았습니다. 평가는 작은 텐서 접근을 많이 사용해 데이터센터 사이 체크포인트를 읽습니다. 작업 시작에는 작업자 수천 개가 같은 메타데이터와 매개변수를 요청합니다. 멀티모달 훈련은 훈련 호스트 CPU에서 비디오와 이미지를 해독·변환하고, 가장 느린 호스트가 스텝 장벽에서 모든 GPU를 지연시킵니다.

해결책은 더 빠른 파일시스템 하나가 아닙니다. 각 병목은 저장 계층이 전에 받지 못한 정보를 노출합니다. 원격 평가에 필요한 체크포인트, 시작 시 여러 작업자가 함께 읽을 파일, 결정론적 다음 스텝이 사용할 샘플입니다.

대역폭이 아니라 지연에 묶인 데이터센터 간 평가

동반 평가는 훈련 중 최신 체크포인트를 읽어 품질 시험을 병렬 실행합니다. 평가 장비와 일정 때문에 다른 데이터센터에 배치될 수 있습니다. 체크포인트는 많은 텐서 조각으로 구성되고 읽기 프로그램은 작은 접근 수천 건을 발행하므로 전체 대역폭이 남아도 WAN 왕복이 지배합니다.

전역 이름 공간은 사이트 사이 파일 정체성을 이미 알고 있습니다. 새 서비스는 체크포인트 생성과 평가 예약을 관찰하고 대상 데이터센터를 예측해 평가가 열기 전에 전체 체크포인트를 복제합니다. 소비자는 같은 경로를 유지하고 이름 공간 배치가 실제 사본을 선택합니다.

예측은 커밋된 체크포인트에 묶여야 하며, 훈련이 쓰는 동안 조각을 복사하면 버전이 섞일 수 있습니다. 복제 제어기는 완료 및 체크섬 메타데이터를 확인한 뒤 원격 위치를 공개합니다. 평가가 끝나면 사본을 만료시켜 주기적 체크포인트가 영구 다중 사이트 용량이 되지 않게 합니다.

평가한 경로는 평가당 낭비 GPU 시간을 16,800에서 4,000으로 줄였습니다. 이 단위는 원격 데이터 때문에 GPU가 기다린 시간을 포함하며 저장 서버 시간만이 아닙니다. 비용 모델에는 WAN 전송과 복제 용량도 넣어야 하지만, 한 번의 선제 순차 복사는 큰 GPU 할당을 붙잡은 지연 중심 소형 읽기보다 쌀 수 있습니다.

ByteDance 파이프라인은 훈련 정보를 세 가지 저장 행동으로 바꿉니다. 전역 이름 공간은 읽기 전에 커밋된 체크포인트를 평가 데이터센터에 복제합니다. 시작 텔레메트리는 작업자 2,048개의 동시 접근 전에 공유 메타데이터와 매개변수 파일의 복제본을 늘립니다. 결정론적 샘플 일정은 GPU가 현재 스텝을 계산하는 동안 저장 CPU가 다음 멀티모달 배치를 변환하게 하며, 저장 부하가 높으면 원시 바이트로 대체합니다. 이 글을 위해 새로 만든 도판입니다.

작은 공유 집합에 몰리는 시작 플래시 크라우드

대규모 작업은 디버깅, 장애, 선점, 설정 변경으로 재시작합니다. 시작할 때 모든 작업자가 정상 상태의 분할 입출력에 들어가기 전에 전역 메타데이터와 일부 복제 매개변수를 요구합니다. 저장 복제본 몇 개가 클라이언트 수천 개의 동기 읽기 폭주를 받습니다.

제어기는 모두가 읽는 핫 파일과 작업자별 조각을 구분하고 복제 계수를 미리 올립니다. GPU 2,048개 평가에서는 핫 메타데이터와 복제 매개변수 파일을 128개 사본으로 늘렸습니다. 체크포인트 로딩은 38.5초에서 22.78초로 40.8% 개선됐습니다.

복제는 임시이고 작업 범위에 묶입니다. 모든 조각의 사본 128개를 남기면 용량과 쓰기 작업이 배수로 늘어납니다. 스케줄러나 훈련 서비스가 작업 크기와 시작 단계를 사본 생성에 충분히 일찍 알려야 하며, 갑작스러운 복구는 준비 전에 도착할 수 있습니다.

저장 토폴로지도 결과를 바꾸므로 복제본은 노드 이름뿐 아니라 장애 영역과 네트워크 경로에 분산해야 합니다. 한 랙에 모이면 병목이 디스크에서 상단 랙 링크로 이동합니다. 텔레메트리는 요청 팬아웃, 복제 준비, 노드별 큐 깊이, 클라이언트 완료 분포를 보여 줘야 합니다.

훈련 스텝의 지연 작업이 된 멀티모달 변환

텍스트 토큰화는 GPU 계산 뒤에 숨길 수 있습니다. 멀티모달 배치는 비디오 해독, 프레임 샘플링, 크기 조정, 잘라내기, 이미지 변환을 추가합니다. 결정론적 로더는 원시 미디어를 큰 바이너리 묶음에 저장하고 논리 샘플을 오프셋에 매핑합니다. 훈련 호스트가 바이트를 읽고 CPU에서 변환한 뒤 텐서를 GPU로 보냅니다.

큰 멀티모달 추적에서 변환은 데이터 로딩 지연의 94.4%를 차지했습니다. 샘플 구간의 가장 느린 호스트는 42.72초가 걸렸고 평균 로딩은 훨씬 짧았습니다. 동기 훈련은 이 호스트를 기다리므로 보고된 장치군에서 하루 1만 GPU 시간 이상을 낭비했습니다.

모든 가능 출력을 미리 변환하는 방식은 실용적이지 않습니다. 해독 비디오는 40배에서 100배 커질 수 있고 잘라내기 크기, 해상도, 프레임 수, 증강이 모델 실험마다 바뀝니다. 페타바이트를 다시 만들면 용량을 소비하고 연구를 지연시킵니다.

반면 저장 노드는 네트워크와 디스크를 기다리며 CPU 사용률이 약 20%에서 30%인 경우가 많았습니다. 결정론적 로더는 미래 샘플 식별자와 스텝 진행을 압니다. 이 일정을 저장소에 보내면 노드가 원시 묶음을 읽고, GPU가 스텝 N을 계산할 때 등록 변환 연산자로 스텝 N+1을 준비합니다.

비디오는 저장 바이트 옆에서 프레임을 골라 사용하지 않을 프레임이 네트워크를 건너지 않습니다. 반환 페이로드는 완전 해독 비디오가 아니라 크기가 제한된 텐서입니다. 훈련 클라이언트가 변환 텐서와 원시 바이너리를 모두 받게 해 투명하게 대체할 수 있습니다.

공유 데이터 레이크를 보호하는 역압력

저장 계층 계산은 메타데이터, 복제, 복구, 다른 테넌트의 CPU를 빼앗을 수 있습니다. 서비스는 예시로 80% CPU 안전 임계값을 둡니다. 이를 넘으면 노드가 변환을 중단하고 원시 바이트를 반환하며, 훈련 호스트가 형식을 감지해 기존 로컬 경로를 실행합니다.

이 대체 경로는 최적화를 기회형으로 만듭니다. 한 훈련 작업이 엑사바이트 공유 저장소를 제한 없는 계산 클러스터로 바꾸지 못하게 합니다. 관련 없는 저장 테넌트에 따라 성능이 달라질 수 있으므로 스케줄러는 일정 처리량을 가정하지 말고 오프로딩 가능 상태를 봐야 합니다.

오프로딩은 p99 데이터 로딩 지연을 85.7%, 로딩으로 생긴 중단을 63.2% 줄이고 상대 훈련 성능을 10.8% 높였습니다. 훈련 호스트의 데이터 로딩 CPU는 94% 줄었습니다. 이 값은 멀티모달 작업과 여유 CPU가 있는 저장 장치군의 결과이며, 얇은 객체 저장 장비나 CPU가 포화된 삭제 코딩 노드는 재현하지 못할 수 있습니다.

한 번 통과하는 사전 훈련은 매개변수나 증강이 바뀌기 전에 샘플을 다시 읽지 않아 처리 데이터 캐시의 가치가 작았습니다. 반복 파인튜닝과 강화 학습은 재사용이 더 많을 수 있습니다. 오래된 텐서를 학습하지 않도록 캐시 키에 데이터셋 버전, 변환 코드, 매개변수, 무작위 시드를 넣어야 합니다.

최적화 인터페이스가 된 결정론

세 기법은 모두 미래 정보를 사용합니다. 체크포인트 생명주기가 평가 입력을 예측하고 스케줄러가 시작 팬아웃을 예측하며 결정론적 로더가 샘플을 예측합니다. HDFS 블록 경로에 모델 훈련 논리를 넣지 않고 저장 시스템을 선제적으로 만듭니다.

이 인터페이스는 불확실성을 명시해야 합니다. 취소한 평가는 사용하지 않은 복제본을 남기고, 실패한 시작은 실행하지 않을 작업의 핫 사본을 만들며, 동적 데이터 혼합과 온라인 샘플링은 다음 배치 목록을 무효화합니다. 제어기는 예측 적중률, 준비했지만 쓰지 않은 바이트, 선행 시간, 대체 비율을 기록해야 합니다.

개인정보와 거버넌스는 사본을 따라갑니다. 데이터센터 간 복제가 관할권이나 데이터 상주 경계를 넘을 수 있습니다. 체크포인트 메타데이터는 배치 정책, 암호화 키, 보존, 삭제 의무를 운반해야 합니다. 전역 이름 공간에 보이는 모든 경로가 이동 가능한 것은 아닙니다.

변환 실행은 공급망 위험도 만들며, 등록 디코더가 저장 노드에서 신뢰하지 않는 미디어를 처리하기 때문입니다. 샌드박스, 자원 제한, 서명된 변환 버전, 결정론 수치 시험이 필요합니다. 디코더 장애가 저장 데몬에 영향을 주거나 원시 데이터를 손상해서는 안 됩니다.

측정된 불일치만 고치는 기존 시스템 갱신

논문은 HDFS가 이미 엑사바이트를 보유하고 다른 처리 작업도 제공하므로 신규 AI 저장소로 전환하지 않습니다. 세 확장은 이름 공간 안내 복사, 복제 수 조정, 제한된 계산 사이드카로 좁습니다. 기존 경로와 파일 형식을 유지합니다.

데이터 중력이 이동 비용을 지배하고 작업 의도를 얻을 수 있을 때 강한 선택입니다. 레거시 데이터가 없는 신규 배치는 집단 로딩, GPU 직접 경로, 풍부한 샘플 서비스를 갖춘 AI 전용 저장소를 선호할 수 있습니다. 연구는 HDFS가 본질적으로 최적이라고 주장하지 않고 제어 평면 결정론을 노출하면 기존 구조도 훈련 목표를 만족할 수 있음을 보여 줍니다.

용량 계획은 GPU 대기와 저장 자원의 가격을 비교해야 합니다. GPU 2,048개에서 1초를 줄이는 작업은 작은 작업의 1초보다 훨씬 많은 복제와 CPU를 정당화합니다. 정책은 모든 파일을 같게 다루지 말고 예상 가속기 시간 수익으로 선제 작업을 배분해야 합니다.

더 큰 교훈은 훈련 데이터 파이프라인이 백그라운드 읽기 도구가 아니라 조정된 분산 시스템이라는 점입니다. 규모가 커지면 작은 공유 파일, 원격 이름 공간 결정, 느린 디코더 하나가 가속기 수천 개를 막습니다. ByteDance의 절감은 이 장벽을 예측하고 형성되기 전에 작업을 옮긴 결과입니다.

출처와 저작권 안내

이 글은 Silicon & Systems의 편집 분석입니다. 운영 분석, 메커니즘, 측정값, 한계를 자체 문장으로 재구성했습니다. 원문의 문장, 표, 도판을 복제하지 않았으며 본문 도판은 이 글을 위해 새로 만들었습니다. 논문은 USENIX OSDI 2026 발표 페이지에서 확인할 수 있습니다. 저작권은 저자에게 있으며 연도는 2026년입니다.