데이터센터 SSD 장애 예측은 불균형한 의사결정 문제입니다. 정상 장치는 매일 수백만 건의 텔레메트리 샘플을 만들지만 장애 장치는 드뭅니다. 분류기는 거의 모든 샘플을 정상이라고 판정해 높은 정확도를 얻으면서 중요한 사건을 놓칠 수 있습니다. 반대로 민감한 검출기는 잘못된 교체를 너무 많이 만들어 신뢰성 이득을 없앨 수 있습니다.

정상 데이터를 줄이면 학습 균형을 맞출 수 있지만 무작위 제거는 장애 경계를 정의하는 데 가장 유용한 정상 샘플을 지웁니다. 특성 선택도 손실을 만듭니다. 혼자서는 약한 텔레메트리 속성이 오류 횟수나 변화율과 결합될 때 결정적일 수 있습니다. 전체 중요도 점수는 그 조건부 범위를 운영자에게 보여 주지 못합니다.

FailureMiner는 경계에 가까운 샘플을 보존하고 속성 대신 판단을 해석합니다. 무작위 포리스트를 학습하고, 장애 장치로 올바르게 이어진 분기를 찾고, 임계값 판단에 기여도를 부여하며, 함께 반복되는 조합을 채굴합니다. 출력은 수정 불가능 NAND 오류 증가와 다른 상태 조건처럼 사람이 읽을 수 있는 소수의 규칙입니다.

구분하기 어려운 정상 장치를 남기는 샘플링

방법은 텔레메트리를 정규화하고 장애 및 정상 장치를 모니터링 프로필에 따라 군집화합니다. 각 군집에서 무작위가 아니라 장애 데이터와의 거리를 기준으로 정상 예시를 선택합니다. 장애와 가까운 정상 점은 남겨 모델이 미세한 차이를 배우게 하고, 멀리 있는 중복 정상 점은 저비용으로 제거합니다.

군집 수는 불균형과 전문화 정도를 함께 조절하므로, 너무 적으면 서로 다른 장애 패턴이 섞이고 불균형이 남지만 너무 많으면 작은 그룹에 과적합하고 판단 추출 비용이 늘어납니다. 보고된 민감도 시험에서는 10개에서 100개가 안정적이었고 50개를 실용적 균형으로 사용했습니다. 200개에서는 재현율이 낮아지고 학습 부담이 커졌습니다.

포리스트에는 원래 텔레메트리 속성을 모두 넣습니다. 다른 임계값과 함께 있을 때만 의미가 있는 보조 신호를 조기에 제거하지 않기 위해서입니다. 잡음은 이후 판단 단계에서 거릅니다. 이 단계에서는 모든 문맥의 속성 하나가 아니라 구체적인 속성 < 값 또는 변화량 >= 값 분기의 기여를 평가할 수 있습니다.

FailureMiner는 해석 단위를 바꿉니다. 텔레메트리를 장애 패턴 주변으로 군집화하고 분류 경계에 가까운 정상 샘플을 남깁니다. 군집별 무작위 포리스트가 올바른 장애 경로를 만들면 판단 SHAP 점수로 임계값 분기를 고릅니다. 이어서 자주 함께 나타나고 기여도가 높은 조합을 강한 또는 약한 결합 판단으로 만들어 예측과 유지보수에 사용합니다. 이 글을 위해 새로 만든 도판입니다.

트리의 상호작용을 유지하며 줄이는 결합 판단

FailureMiner는 장애를 올바르게 분류한 판단 경로를 순회합니다. SHAP에서 유도한 영향도를 각 분기 판단에 계산하고 임계값보다 높은 후보를 남깁니다. 같은 임계값이 여러 트리와 경로에 나타날 수 있으므로 등장할 때의 기여를 합산합니다.

이후 Apriori 방식 탐색이 자주 함께 등장하는 판단 집합을 만듭니다. 결합 점수는 개별 영향과 동시 등장 빈도를 함께 사용합니다. 높은 점수는 인기 있는 속성 여러 개가 아니라 장애에 반복적으로 이어진 경로를 나타냅니다. 한 개 판단 집합에서 더 큰 조합으로 확장하며 조건을 만족하는 확장이 없을 때 멈춥니다.

학습 정밀도가 50% 이상인 집합은 강한 판단으로 정의해 운영 예측에 사용할 수 있습니다. 정밀도가 낮은 약한 판단은 바로 교체를 촉발하지 않지만 유지보수와 제품 분석을 안내합니다. 신호가 건강 저하와 관련 있어도 중단을 수반하는 행동을 정당화하지 못할 수 있다는 구분입니다.

시스템은 개별 판단 117,404개가 포함된 포리스트에서 강한 조합 세 개를 뽑았습니다. 수정 불가능 NAND 오류, DRAM, 커패시터 건강 패턴과 연결됐습니다. 각 결합 규칙의 F0.5 점수는 구성 임계값 하나만 쓴 경우보다 높았고, 보조 조건이 오경보를 제거했음을 보여 줍니다.

사람과 장비를 소비하는 오경보를 반영한 정밀도

평가는 정밀도, 재현율, F0.5를 사용하며 F0.5는 재현율보다 정밀도에 더 큰 가중치를 둡니다. 정밀도는 경보 중 실제 장애가 된 비율이고 재현율은 전체 장애 중 찾은 비율입니다. 데이터센터 규모에서는 낮은 오경보율도 정상 장치 수십만 개에 적용하면 마이그레이션과 교체 수백 건이 됩니다.

실제 Tencent 텔레메트리에서 강한 판단은 평가한 이전 방법보다 평균 정밀도를 38.6%, 재현율을 80.5% 개선했습니다. 수정 불가능 오류 관련 결합 규칙 하나는 정밀도 81.9%와 재현율 23.6%를 기록했습니다. 무작위 포리스트 비교는 정밀도 55.4%였고, 시간 특성을 만든 MVTRF 기준은 정밀도 68.1%, 재현율 19.6%, F0.5 0.46이었습니다.

이 값은 모델 계열의 보편적 순위가 아니라 서로 다른 작동점입니다. 임계값, 관찰 창, 장애 라벨, 장치 모델, 교체 정책이 두 지표를 바꿉니다. Alibaba SMART 데이터셋은 다른 속성으로 일반화 가능성을 확인했지만 운영 배포 근거는 Tencent 장치에서 나왔습니다.

요소 제거 시험은 두 기여를 나눴습니다. 경계 보존 축소와 포리스트를 결합하면 비교 경로보다 정밀도와 재현율이 각각 21.7% 및 49.3% 좋아졌습니다. 결합 핵심 판단 추출은 인용된 분석에서 다시 20.4%와 25.5%를 개선했고, 두 기능을 모두 쓴 방법의 보고 값이 가장 높았습니다.

모든 규칙에 필요한 선행 시간과 행동

강한 판단은 Tencent 데이터센터의 SSD 35만 개 이상에서 1년 넘게 실행됐습니다. 경보는 서비스 마이그레이션이나 장치 교체를 수행할 수 있는 운영 절차로 들어갔습니다. 수정 불가능 오류 판단이 경보한 장치의 51%는 1주 안에 장애로 보고됐습니다. DRAM 관련 장애는 경보 뒤 30일이 지나 나타날 수도 있었으므로 모든 패턴에 같은 기한을 적용할 수 없습니다.

선행 시간 분포는 재현율만큼 중요합니다. 장치 손실 수분 전에 도착한 경보는 정확해도 마이그레이션에 쓸 수 없습니다. 수개월 일찍 도착하면 예비 용량을 오래 묶고 안전하게 서비스할 장치를 교체할 수 있습니다. 각 결합 판단에는 정밀도, 예상 장애 시간 분포, 적용 모델과 펌웨어, 권장 행동을 함께 붙여야 합니다.

규칙은 원인 분석을 돕지만 인과를 증명하지는 않습니다. NandUECC 임계값은 관찰된 수정 불가능 오류를 가리킬 뿐 NAND 마모, 읽기 방해, 펌웨어, 작업 중 무엇이 시작점인지 정하지 않습니다. DRAM과 커패시터 신호는 분해 분석과 펌웨어 검토의 방향을 제시할 수 있습니다. 제품 설계를 바꾸기 전에 제조사 피드백과 하드웨어 분석이 필요합니다.

약한 판단은 PCIe 오류, 불량 블록, 종단 간 오류를 포함했습니다. 정밀도가 50% 아래라 직접 장애 경보로는 부적합했지만 해당 집단의 이후 장애율은 일반 정상 장치보다 높았습니다. 모니터링 빈도 증가, 작업 축소, 예약 유지보수처럼 비용이 낮은 행동에는 이러한 신호를 쓸 수 있습니다.

읽기 쉬운 규칙도 무효화하는 장치군 변화

해석 가능하다고 임계값이 영구적인 것은 아닙니다. SSD 컨트롤러 펌웨어, NAND 세대, 과할당, 텔레메트리 정의, 작업 구성, 장치군 연령이 바뀝니다. 한 모델에서 배운 규칙이 다른 모델에서 너무 자주 울리거나 새 장애를 놓칠 수 있습니다. 운영 시스템은 모델 및 펌웨어별 규칙 버전을 관리하고 확인된 결과로 계속 보정해야 합니다.

일일 텔레메트리에도 시간 모호성이 있습니다. 변화량은 수집 간격과 누락 샘플에 좌우됩니다. 시계 오차, 전원 재시작 뒤 계수기 초기화, 포화, 제조사별 단위가 장애 패턴처럼 보일 수 있습니다. 판단 전에 입력 검증을 수행하고 신뢰할 수 없는 텔레메트리 자체를 별도 경보로 처리해야 합니다.

배포 모니터링은 경보 수, 라벨 지연을 반영한 정밀도, 재현율, 선행 시간 분위수, 마이그레이션, 교체, 예방한 서비스 사고, 무고장 판정으로 돌아온 장치를 보고해야 합니다. 장치군 비용 모델이 오경보와 미검출의 가격을 다르게 두고, 강한 판단과 약한 판단이 촉발할 행동을 선택할 수 있습니다.

이 방법의 가치는 규칙 세 개가 기계 학습을 대체한다는 데 있지 않습니다. 무작위 포리스트가 고차원 장치군의 상호작용을 찾고 결합 마이닝이 유용한 경로를 운영 인터페이스로 압축합니다. 재학습으로 규칙은 바뀔 수 있지만 운영자는 특정 장치가 선택된 이유를 계속 감사할 수 있습니다.

속성 조합과 시간을 묶은 실행 가능 단위

FailureMiner는 특성 중요도가 저장 운영에 너무 거친 이유를 보여 줍니다. “NAND 오류가 중요하다”만으로는 오류 수, 변화 속도, 함께 있어야 하는 조건, 장애까지 남은 시간을 알 수 없습니다. 결합 판단이 임계값과 논리곱을 제공하고 배포 통계가 정밀도와 선행 시간을 제공합니다.

정밀도 38.6% 및 재현율 80.5%의 평균 개선, 1년 운영, 장치 35만 개 규모는 실용 가능성을 보여 줍니다. 결과는 평가한 라벨과 장치군에 묶이며, 일부 고정밀 규칙의 낮은 재현율은 완전한 장애 방패가 아님을 뜻합니다. 구매자는 규칙의 모델 간 이전 방법, 결과 확인 절차, 끝내 장애로 보고되지 않은 경보의 처리를 확인해야 합니다.

가장 강한 배치는 행동을 단계화합니다. 선행 시간이 짧은 고정밀 규칙은 즉시 마이그레이션을 촉발하고, 긴 규칙은 교체를 예약하며, 약한 판단은 샘플링 빈도를 높일 수 있습니다. 이 구조에서 모델 해석은 대시보드 설명이 아니라 자원 배분 기능이 됩니다.

출처와 저작권 안내

이 글은 Silicon & Systems의 편집 분석입니다. 방법, 측정값, 배포 근거, 한계를 자체 문장으로 재구성했습니다. 원문의 문장, 표, 도판을 복제하지 않았으며 본문 도판은 이 글을 위해 새로 만들었습니다. 논문은 USENIX FAST 2026 발표 페이지에서 확인할 수 있습니다. 저작권은 저자에게 있으며 연도는 2026년입니다.