2025년 산업계 논문은 범용 메모리 하나로 수렴하지 않았습니다. 반대 방향으로 움직였습니다. ISSCC 논문 6편은 LPDDR과 GDDR, NAND, STT-MRAM을 서로 다른 용도에 맞춰 특화했습니다. FAST 논문 15편은 GPU 데이터와 KV 캐시, 메타데이터, DPU, 모바일 스토리지, 이기종 장치의 소프트웨어 경로를 바꿨습니다. ACM Transactions on Storage(TOS)의 회사 소속 논문 13편은 바이트 주소형 색인부터 자기 테이프와 유리 아카이브까지 범위를 넓혔습니다. 34편을 함께 보면 물리 특성이 더 달라진 계층을 하나의 정책으로 운영하는 방향이 보입니다.

이 목록은 ISSCC의 외장 메모리 주 세션, FAST 정규 기술 논문, 2025년에 처음 공개된 ACM TOS 논문을 대상으로 합니다. 프로세서 내부 SRAM과 메모리 내 연산은 연례 회로 시리즈에서 다룹니다. 기조연설과 패널, 서문, 회사 저자가 없는 조사 논문은 제외했고 같은 연구의 저널 확장판은 중복 집계하지 않았습니다. Mooncake는 기존 심층 분석 글이 있으므로 발행 기록에는 포함하되 별도 다이제스트를 다시 만들지 않았습니다.

DRAM과 컨트롤러, 가속기, NVMe 매체가 있는 개념 메모리·스토리지 서버 위에 2025년 ISSCC, FAST, ACM TOS의 회사 소속 논문 34편을 표시했습니다. 실제 제품 사진이 아닙니다. 이 글을 위해 새로 만든 도판입니다.

LPDDR과 GDDR은 시스템 에너지를 지키기 위해 회로를 더 넣었습니다

Samsung의 16 Gb LPDDR5 Ultra Pro는 5세대 10 nm DRAM 공정에서 핀당 12.7 Gb/s를 보고했습니다. 4위상 자체 보정과 AC 결합 송수신기 이퀄라이제이션은 타이밍 오차와 채널 손실을 고정 마진으로 남겨 두지 않고 회로가 직접 줄입니다. LPDDR의 장점은 낮은 에너지와 짧은 채널이지만, 클록 배분과 종단, 보정, 신뢰성 때문에 과도한 여유를 잡으면 그 장점이 시스템에서 사라집니다.[1]

Samsung의 24 Gb GDDR7은 42.5 Gb/s에 도달했습니다. 쓰기 클록 배분과 송신 강조 회로를 조정하면서 전압·타이밍 마진의 전력 비용을 낮췄습니다. GDDR과 LPDDR은 핀 속도만으로 비교할 수 없습니다. GDDR은 보드 채널에서 총대역폭을 얻고 더 큰 전력 범위를 사용합니다. LPDDR은 에너지 제약이 강한 시스템과 짧은 채널을 겨냥합니다. 실제 대역폭은 메모리 컨트롤러와 패키지, 보드, 워크로드가 함께 결정합니다.

NAND는 적층 수와 함께 에너지·처리량을 방어했습니다

Samsung은 4XX단 1 Tb TLC NAND에서 28 Gb/mm²와 핀당 5.6 Gb/s를 보고했습니다. KIOXIA와 Western Digital은 읽기 에너지 효율을 29% 높이고 4.8 Gb/s 입출력을 갖춘 1 Tb TLC를 공개했습니다. SK hynix의 321단 2 Tb QLC는 75 MB/s 프로그램 처리량을 기록했습니다. 각 논문이 개선한 병목은 밀도와 읽기 에너지, 인터페이스 이동, 프로그램 병렬성으로 다릅니다.[1]

하나의 수치로 세 소자를 순위화할 수 없습니다. QLC는 셀당 비트 수를 늘리지만 전압 여유가 줄고 컨트롤러 작업이 늘어납니다. 적층 수를 늘리면 면적 밀도는 높아지지만 공정과 수직 채널의 난도가 커집니다. 핀 속도는 데이터가 준비된 뒤의 이동을 빠르게 할 뿐 모든 프로그램·소거 시간을 줄이지 않습니다. 읽기·쓰기 비율과 큐 깊이, 내구성 목표, 백그라운드 작업을 함께 봐야 합니다.

KIOXIA와 SK hynix의 64 Gb DDR4 호환 STT-MRAM은 다른 선택을 했습니다. 시간 제어 방전 읽기로 1T-1MTJ 교차점 셀을 지원했습니다. DDR4 인터페이스는 익숙한 시스템 경계를 제공하지만 비휘발성은 보존과 쓰기, 내구성 조건을 바꿉니다. 호환성은 도입 비용을 낮출 수 있어도 매체를 DRAM처럼 만들지는 않습니다.

GPU가 파일시스템의 일급 참여자가 됐습니다

GeminiFS는 GPU를 CPU 뒤에서 데이터를 받는 수동 장치가 아니라 파일시스템 참여자로 다뤘습니다. PolyStore는 이기종 스토리지의 기능을 결합했고, HiDPU는 분리형 스토리지 색인을 DPU 쪽에 배치했습니다. HaSiS는 분석·트랜잭션이 공유하는 색인에 하드웨어를 사용했습니다. 메타데이터와 색인을 데이터를 소비하는 엔진 가까이 옮긴 연구입니다.[2]

연산을 스토리지 가까이 옮기는 것만으로 이득이 보장되지는 않습니다. GPU 경로는 격리와 파일시스템 의미를 지켜야 합니다. DPU 색인은 호스트 상태와 일관성을 유지해야 합니다. 계산형 장치는 PCIe 트래픽을 줄이는 대신 두 번째 실행·장애 영역을 만듭니다. 가속 커널만이 아니라 동기화와 실패 시 대체 경로를 포함한 전체 경로를 측정해야 주장이 유효합니다.

Samsung의 DJFS는 장치 기능과 소프트웨어 계약을 더 직접적으로 보여 줬습니다. 디렉터리 단위 저널링은 일반 블록 장치보다 많은 기능을 드러내는 CMM-H SSD를 대상으로 합니다. Samsung이 참여한 PolyStore와 후속 저널 확장판도 이기종 매체에 공통 제어 계층이 필요하다는 점을 보여 줍니다. 파일시스템이 장치 기능을 언제 사용할지 결정할 수 있어야 소자 기능이 제품 가치가 됩니다.

KV 캐시가 추론을 데이터 관리 문제로 바꿨습니다

Mooncake는 LLM 서빙의 KV 캐시를 GPU 연산에서 분리하고 분산 스토리지를 이용해 용량과 재연산을 교환했습니다. IMPRESS는 중요도 추정을 사용해 접두사 KV를 여러 계층에 배치했습니다. Huawei 협업팀의 대규모 벡터 탐색 논문은 필터링과 재순위를 CPU와 GPU에 나눴습니다. 추론이 상태 배치와 재사용에 지배되면서 이 연구들이 스토리지 논문이 됐습니다.[2]

판단 기준은 명목 스토리지 대역폭이 아닙니다. 요청한 접두사나 벡터 후보가 가속기가 재연산을 끝내기 전에 도착하는지가 중요합니다. 늦게 도착한 적중은 사실상 미스입니다. 진입과 프리페치, 네트워크 스케줄링, 축출에 모델 서빙 문맥이 필요합니다. Mooncake 심층 분석은 이 구조를 따로 다루며, 연례 목록은 중복 글 없이 2025년 발행 기록을 보존합니다.

클라우드 스토리지는 여러 제어 루프의 묶음이 됐습니다

NetApp의 Cloudscape는 최신 클라우드 구조에서 스토리지 서비스가 쓰이는 방식을 조사했습니다. Huawei의 FlacIO는 컨테이너 이미지 입출력을 바꿨고, Alibaba의 GogetaFS는 중복 제거 메타데이터를 합쳤습니다. Ant Group의 AtomicDisk는 신뢰 실행 환경이 사용하는 가상 디스크를 보호했습니다. OPPO의 MedFS는 모바일 장치에서 메타데이터 기반 델타 압축을 사용했습니다. 매체는 다르지만 일반 블록 입출력이 잃어버린 정보를 경계에서 다시 사용하는 공통점이 있습니다.[2]

ACM TOS 논문은 운영 방향을 더 분명히 보여 줍니다. Alibaba는 성능과 탄력성, 가용성, 하드웨어 오프로딩을 포함한 클라우드 블록 스토어의 진화를 설명했습니다. Amazon이 참여한 SquirrelFS는 Rust 형식 체계로 충돌 일관성을 점검합니다. Dell의 IDEA 저널판은 중복 제거 색인을 FAST 논문보다 넓게 다뤘습니다. Huawei는 RDMA 메모리를 SSD로 확장하고 큰 리프 노드를 가진 B+ tree를 연구했습니다. 저널이라는 이유보다 긴 설계 변화를 공개했다는 점이 중요합니다.

아카이브는 성능의 뜻을 바꿨습니다

Microsoft의 Project Silica와 홀로그래픽 스토리지 논문은 장기 클라우드 아카이브용 유리를 연구했습니다. IBM 연구진은 자기 테이프를 분석했습니다. DDN과 Whamcloud는 Lustre의 진화를 정리했고, Western Digital은 존 스토리지용 키-값 저장소 ZonesDB에 참여했습니다. GPU가 재사용하는 수초 단위 데이터부터 수년 동안 보존하는 데이터까지 하나의 계층에 들어왔습니다.[3]

아카이브에서는 처리량만 볼 수 없습니다. 매체 수명과 환경 제어, 마이그레이션 주기, 로봇 접근, 색인 내구성, 데이터를 읽을 수 있게 유지하는 에너지가 더 중요할 수 있습니다. 유리나 테이프의 접근 지연을 플래시와 직접 비교하면 안 됩니다. 수 세대의 하드웨어를 건너 차가운 데이터를 지키는 총비용과 위험이 비교 기준입니다.

계층을 결정하는 세 가지 질문

첫째, 어떤 계층의 데이터가 권위 있는 원본인지 정해야 합니다. GPU 메모리와 호스트 DRAM, 장치 캐시, 원격 KV 저장소, 플래시, 디스크, 테이프, 유리가 모두 원본일 수는 없습니다. 복구와 일관성은 하나의 권위와 계층 전환 절차에 달려 있습니다.

둘째, 숨긴 지연과 실제로 지불한 지연을 나눠야 합니다. 프리페치와 계층화는 이동을 겹쳐 실행할 수 있지만 없애지는 못합니다. 진입 정책은 적중률뿐 아니라 늦은 적중과 낭비한 전송, 재연산을 함께 보고해야 합니다.

셋째, 다른 자원을 아끼기 위해 무엇을 소비했는지 확인해야 합니다. QLC는 밀도를 얻기 위해 마진과 컨트롤러 작업을 사용합니다. 학습 캐시는 장치 트래픽을 줄이기 위해 모델 복잡도를 사용합니다. 하드웨어 오프로딩은 CPU 시간을 줄이는 대신 새로운 실행 영역을 만듭니다. 아카이브는 장기 비용을 낮추기 위해 접근 지연을 허용합니다.

2025년 회사 논문 전체 목록

ISSCC 외장 메모리 6편

  • 30.1, 4XX단 1 Tb TLC NAND, 28 Gb/mm², 핀당 5.6 Gb/s, Samsung Electronics.
  • 30.2, 읽기 에너지 효율을 29% 높인 1 Tb TLC NAND, 4.8 Gb/s, KIOXIA·Western Digital.
  • 30.3, 24 Gb 42.5 Gb/s GDDR7, Samsung Electronics.
  • 30.4, 16 Gb 핀당 12.7 Gb/s LPDDR5 Ultra Pro, Samsung Electronics.
  • 30.5, 321단 2 Tb QLC NAND, 75 MB/s 프로그램 처리량, SK hynix.
  • 30.6, 64 Gb DDR4 호환 STT-MRAM, KIOXIA·SK hynix.[1]

FAST 스토리지 시스템 15편

ACM Transactions on Storage 13편

출처와 저작권 안내

이 글은 ISSCC 공식 프로그램, USENIX 공개 논문 페이지, ACM 발행 기록을 독립적으로 분석해 다시 쓴 편집 다이제스트입니다. 기술 아이디어와 측정값은 새로운 문장으로 설명했으며 출판사 도판이나 표를 사용하지 않았습니다. 설명 도판은 로고가 없는 개념 서버 이미지 위에 레이블을 코드로 합성해 이 글을 위해 만들었습니다. ISSCC 논문의 저작권은 © IEEE 2025이며 FAST와 ACM TOS 논문의 권리 조건은 각 링크의 발행 기록을 따릅니다.