클라우드 로컬 SSD의 출발점은 단순합니다. 드라이브가 연산 서버 안에 있으므로 입출력이 데이터센터 네트워크를 건너지 않습니다. 그러나 물리적으로 가깝다는 사실만으로 장치 성능을 얻지는 못합니다. Alibaba의 운영 기록을 보면 SSD 위치는 그대로인데 실제 병목은 커널 전환, 폴링 전용 코어, DPU 처리량, 장애 복구 순서로 계속 이동했습니다[1].

FAST 2026 논문은 이 변화를 수천 대에서 수만 대 규모의 배포 경험과 함께 설명합니다. 3세대 RISTRETTO는 PCIe Gen4 SSD를 가상 디스크로 제공하면서 물리 장치에 가까운 성능을 냈습니다. 다만 로컬 디스크가 연산 노드와 함께 사라지는 문제, 장치 단위로 용량을 배정해야 하는 문제, 다른 노드로 즉시 확장하기 어려운 문제는 남았습니다. 후속 시제품 LATTE는 로컬 SSD 뒤에 표준 탄력적 블록 스토리지(EBS)를 붙여 이 계약을 바꾸려 합니다. 따라서 이 논문의 핵심은 가장 빠른 데이터 경로 하나가 아니라 성능과 내구성을 같은 구조에서 판단하는 방법입니다.

첫 병목은 NAND가 아니라 소프트웨어였습니다

초기 로컬 스토리지 스택은 하드디스크 시기에 만들어졌습니다. 가상 머신이 virtio와 KVM을 거쳐 요청을 보내면 호스트 커널이 장치 입출력을 수행하고, 완료 신호가 다시 여러 전환과 인터럽트를 지나 돌아왔습니다. 매체가 느릴 때는 이 비용이 두드러지지 않았습니다. PCIe Gen3 NVMe를 연결하자 기존 경로는 장치 최대 IOPS의 9.54%만 제공하면서 CPU를 최대 1.4코어까지 사용했습니다. 짧아진 매체 지연시간이 소프트웨어 왕복 비용을 드러낸 것입니다.

ESPRESSO는 SPDK 기반 사용자 공간으로 경로를 옮기고 가상 디스크마다 폴링 스레드를 배정했습니다. SSD 12개를 장착한 서버는 최대 38.4 GB/s와 576만 IOPS를 기록했습니다. 드라이브 하나로 나누면 3.2 GB/s와 48만 IOPS입니다. 2017년 무렵 출시된 이 구조는 수만 대의 서버로 확대됐고, HDD용 스택과 비교한 소프트웨어 오버헤드는 82.35% 줄었습니다.

그 대신 비용의 형태가 바뀌었습니다. 각 스레드가 전용 코어를 점유했지만 현장 측정에서 실제 사용률의 99퍼센타일은 60% 아래였습니다. 순간적인 입출력 급증을 받아야 하므로 비어 보이는 주기를 다른 작업에 안정적으로 넘길 수도 없었습니다. 호스트 CPU를 써야 하므로 베어메탈 인스턴스에도 맞지 않았습니다. 완료 통지가 가상 머신 경계를 넘는 과정에는 평가 조건에서 5~12 마이크로초가 추가됐습니다. 지연시간을 줄이는 대신 판매 가능한 연산 자원을 예약한 셈입니다.

따라서 로컬 스토리지 가격에는 가상화 경로가 점유하는 CPU와 메모리를 포함해야 합니다. SSD IOPS가 높아질수록 폴링 코어를 더 요구한다면 장치는 빨라져도 서버 경제성은 나빠질 수 있습니다. 장치 사양과 인스턴스 원가는 같은 방향으로 움직이지 않습니다.

Alibaba 로컬 스토리지의 제어 경로를 서버 규모에서 개념적으로 나타냈습니다. ESPRESSO는 사용자 공간 폴링으로 이동해 드라이브 12개에서 576만 IOPS를 냈고, DOPPIO는 ASIC DPU로 경로를 오프로드해 600만 IOPS를 기록했습니다. RISTRETTO는 ASIC과 Arm SoC를 결합해 가상 디스크 8개에서 720만 IOPS를 냈습니다. LATTE는 로컬 캐시 뒤에 표준 EBS를 두는 시제품입니다. 섀시는 Alibaba의 실제 제품이나 보드 배치를 재현한 것이 아닌 일반적인 재질 원판이며, 라벨과 수치는 논문에 보고된 사실을 코드로 합성했습니다. 이 글을 위해 새로 만든 도판입니다.

DPU는 호스트 코어를 없애고 새로운 상한을 만들었습니다

DOPPIO는 가상화된 입출력 경로를 상용 ASIC DPU로 옮겼습니다. DPU 하나가 SSD 두 개를 관리하고, 호스트 요청 수신과 고정 하드웨어 기능, 완료 인터럽트를 처리했습니다. DPU 여섯 개와 PCIe Gen3 SSD 12개 구성은 최대 38.4 GB/s와 600만 IOPS를 냈습니다. ESPRESSO가 사용하던 호스트 코어가 필요하지 않아 베어메탈 서비스도 제공할 수 있었습니다.

다음 병목은 오프로드 장치 자체였습니다. 선택한 ASIC DPU는 SSD 하나당 약 50만 IOPS를 처리했지만 2023년형 SSD는 읽기 150만 IOPS 수준까지 빨라졌습니다. 고정 로직에는 논리 볼륨 관리 같은 새 기능을 넣기도 어려웠습니다. FPGA로 유연성을 늘리는 선택지는 전력과 설비비가 커서 채택하지 않았습니다.

여기서 DPU의 보편적인 조건이 드러납니다. 반복되는 안정된 경로가 비싼 범용 코어를 소비할 때 오프로드는 유리합니다. 같은 전문화가 다음 세대 매체 성능을 가두거나 제어 기능 추가를 늦출 수도 있습니다. 도입 전에는 어느 부분이 고정됐는지, 무엇을 소프트웨어로 바꿀 수 있는지, 다음 SSD 세대까지 처리 여유가 남는지를 물어야 합니다. 부품의 마케팅 명칭보다 이 세 가지가 중요합니다.

RISTRETTO는 빠른 경로와 변하는 경로를 나눴습니다

RISTRETTO는 ASIC과 Arm Cortex-A72 코어 네 개, DRAM 64 GB를 한 PCIe 확장 카드에 결합합니다. ASIC은 가상 NVMe 컨트롤러와 명령·데이터 이동처럼 반복되는 빠른 경로를 담당합니다. SoC 소프트웨어는 블록 추상화와 앞으로 바뀔 가능성이 큰 기능을 맡습니다. DOPPIO에서 문제가 된 고정 하드웨어와 범용 소프트웨어 사이를 역할의 변경 주기로 나눈 구조입니다.

가장 큰 평가 구성은 가상 디스크 여덟 개에서 720만 IOPS를 기록했습니다. 가상 디스크 하나의 읽기는 90만 IOPS와 6.7 GB/s였고, 비교한 물리 SSD는 100만 IOPS와 6.9 GB/s였습니다. 안정 상태 쓰기는 두 경로 모두 18만 IOPS였으며 처리량 차이는 0.1 GB/s였습니다. 가상화 계층이 더 이상 지배적인 손실이 아니라는 점이 이 수치의 의미입니다.

RISTRETTO는 2023년에 배포를 시작해 논문 기준 수천 노드까지 확대됐습니다. 전체 SSD 또는 파티션을 SR-IOV로 노출하며, SoC에서 큐 매핑과 스토리지 기능을 바꿀 수 있습니다. 다만 이 결과가 모든 클라우드에 맞는 ASIC-SoC 카드를 요구하지는 않습니다. IOPS 목표가 낮거나 남는 CPU가 있는 환경은 호스트 소프트웨어의 운영 단순성을 택할 수 있습니다. 호스트 코어가 매출 자원이고 베어메탈이 필요하며 자체 하드웨어를 상각할 만큼 규모가 클 때 이 구조의 가치가 커집니다.

물리 장치에 가까운 성능도 장애 계약은 바꾸지 못합니다

RISTRETTO가 데이터 경로 비용을 줄이자 로컬 스토리지의 원래 약점이 다시 중심으로 올라왔습니다. 용량은 장치나 파티션 단위로 배정됩니다. 데이터는 한 연산 노드에 붙어 있습니다. 디스크나 노드가 고장 나면 애플리케이션이 직접 복제했거나 손실을 감수해야 합니다. 논문은 로컬 디스크의 연간 장애율로 약 0.44%를 인용하지만, 운영에서 더 중요한 것은 연산과 데이터가 함께 사라지고 복구용 노드가 같은 시간에 준비되지 않을 수 있다는 점입니다.

LLM 시스템은 이 충돌을 더 분명하게 만듭니다. 로컬 플래시는 모델 파라미터와 체크포인트, KV 캐시를 낮은 비용과 짧은 지연시간으로 담을 수 있습니다. 동적으로 확장하려면 다른 노드가 같은 데이터를 읽어야 합니다. 애플리케이션이 세 개 복제본을 만들면 해결할 수 있지만 매체 가격의 이점이 줄고 모든 개발팀이 배치와 복구를 구현해야 합니다.

표준 EBS는 원격 접근과 중복 저장, 탄력성을 포함한 다른 계약을 제공합니다. 논문이 제시한 고성능 Alibaba EBS는 100만 IOPS와 약 30마이크로초에 도달하지만 가격이 높습니다. 그러므로 올바른 비교는 로컬 지연시간과 원격 지연시간의 차이가 아닙니다. 같은 가용성과 복구성, 확장성을 제공하는 데 드는 전체 비용을 비교해야 합니다.

LATTE는 원격 복사본을 권위 있는 상태로 만듭니다

LATTE는 RISTRETTO 기반 로컬 캐시 하나와 상대적으로 저렴한 표준 EBS 볼륨을 결합합니다. 쓰기는 캐시에 들어가거나 이를 우회한 뒤 최종적으로 백엔드에 도달합니다. 읽기는 로컬 매핑을 확인하고 블록이 없으면 EBS에서 가져옵니다. 학습 기반 디스패처는 최근 입출력과 혼잡을 보고 경로를 고르며, 진입·축출 제어기는 한 번만 읽는 블록이 캐시를 채우지 않도록 합니다.

평가한 트레이스에서 진입 정책의 적중률은 82%를 넘었습니다. 읽기 적중률을 75%로 둔 조건에서는 로컬 캐시와 백엔드가 동시에 요청을 처리해 RISTRETTO 단독보다 높은 IOPS를 냈습니다. 적중률이 100%가 되면 백엔드는 쉬고 결과는 다시 로컬 장치의 상한으로 돌아갑니다. 하이브리드의 이점은 캐시 적중 자체가 아니라 두 자원을 함께 스케줄링한 데 있습니다.

4 TB RISTRETTO의 월 비용을 1로 정규화한 모델에서, 백엔드를 최대로 잡은 LATTE는 13이었고 자동 프로비저닝 구성은 2.1~4.0이었습니다. 고성능 EBS 비교는 소프트웨어 스택과 3중 복제를 포함해 약 19였습니다. 이는 공개 클라우드 요금표가 아니라 논문 내부의 설비비 모델입니다. 원격 대역폭과 복제 방식, 캐시 적중률, 예약한 로컬 용량이 결과를 어떻게 움직이는지 보여 주는 값으로 읽어야 합니다.

가장 중요한 제한은 LATTE가 아직 시제품이라는 사실입니다. 저자들은 동시 장애 처리와 더 효율적인 백엔드 중복 구성을 후속 과제로 남겼습니다. 운영 규모의 내구성, 다중 테넌트 격리, 학습 디스패처의 장기 동작은 입증되지 않았습니다. ESPRESSO부터 RISTRETTO까지는 운영 이력이 있지만 LATTE는 시제품 평가가 뒷받침하는 설계 방향입니다.

학습 기반 경로 선택에는 결정적인 우회로가 필요합니다

LATTE의 중심은 기계학습 자체가 아닙니다. 한 블록 인터페이스 아래에서 로컬과 원격 경로를 동시에 쓸 수 있다는 구조가 핵심입니다. 학습 모델은 짧은 최근 요청 구간과 지연시간을 보고 더 나은 경로를 추정합니다. 실제 배포에서는 모델이 오래됐거나 사용할 수 없고 워크로드가 급변해도 동작하는 안전한 기본 경로가 필요합니다.

기본 경로는 세 가지를 보장해야 합니다. 내구성이 있다고 응답한 쓰기는 원격 계층에서 복구할 수 있어야 합니다. 캐시와 백엔드 사이를 이동해도 순서가 보존돼야 합니다. 잘못된 예측은 지연시간만 늘릴 뿐 데이터 값을 바꾸면 안 됩니다. 각 요청이 캐시나 EBS를 선택한 이유, 당시 큐 상태, 원격 복사본이 권위 있는 상태가 된 시각도 기록해야 합니다.

이 관측 정보는 좋은 평균값이 나쁜 꼬리 지연시간을 가리는 일을 막습니다. 평가에서는 적중과 미스, 쓰기 응답과 원격 영속화, 로컬 장치 손실 뒤 복구를 따로 측정해야 합니다. 이 분모가 모델 로딩과 임시 분석 데이터, 데이터베이스, 체크포인트 중 어디에 하이브리드를 쓸 수 있는지 결정합니다.

다음 SSD 세대가 나오면 제어 경로부터 다시 점검해야 합니다

Alibaba의 네 구조는 실무적인 점검 순서를 제공합니다. 매체가 빨라지면 먼저 커널 전환이 지배적인지 확인합니다. 사용자 공간 폴링으로 해결된다면 전용 코어 비용을 계산합니다. 그 코어를 쓸 수 없다면 오프로드를 검토하고, 고정 로직과 처리량이 다음 장치를 감당하는지 측정합니다. 물리 장치에 가까운 접근을 얻었다면 데이터 경로 최적화를 멈추고 가용성 계약을 살펴봐야 합니다.

이 순서는 이전 세대의 해법을 다음 세대 병목에 그대로 적용하는 오류를 줄입니다. ESPRESSO는 전환 비용을, DOPPIO는 호스트 코어 점유를, RISTRETTO는 DPU의 처리량과 변경 가능성을 다뤘습니다. LATTE는 어떤 로컬 데이터 경로도 혼자 제공할 수 없는 내구성과 탄력성을 겨냥합니다. 단계마다 부족한 자원이 달라졌습니다.

인프라 구매자는 SSD IOPS 옆에 여섯 수치를 놓을 수 있습니다. 드라이브당 예약하는 호스트 코어, 가상 장치와 물리 장치의 지연시간 차이, 오프로드 장치의 처리 상한, 최소 할당 용량, 노드 장애 뒤 서비스 복구 시간, 권위 있는 원격 복사본의 비용입니다. 이 값이 없다면 ’물리 장치에 가까운 성능’은 완성되지 않은 시스템에서 가장 빠른 부분만 설명합니다.

출처와 저작권 안내

이 글은 저자들이 공개한 FAST 논문을 바탕으로 Silicon & Systems가 독립적으로 작성한 편집 요약입니다. 메커니즘과 측정 조건, 배포 이력, 한계를 새로운 표현으로 설명했으며 원문 문장과 표, 출판사 도판을 옮기지 않았습니다. 하드웨어 도판과 썸네일은 보고된 사실과 일반적인 서버 재질 원판을 사용해 이 글을 위해 만들었습니다. 논문의 저작권은 저자들에게 있습니다. 원문은 USENIX FAST 2026 공식 페이지에서 확인할 수 있습니다.