AI 서비스는 가속기만으로 실행되지 않습니다. 에이전트는 계획을 세우고, 검색이나 데이터베이스 도구를 호출하고, 결과를 해석한 다음 입력을 바꾸어 다시 모델을 부릅니다. 이 과정은 앞 단계가 끝나야 다음 단계가 정해지는 경우가 많습니다. 모델이 계산되는 동안에는 GPU 처리량이 중요하지만, 호출 사이에서는 직렬 제어 흐름, 포인터를 많이 쓰는 소프트웨어, 공유 상태가 다시 전체 지연을 결정합니다. NVIDIA의 Vera 백서는 이런 시스템 균형에 관한 주장으로 읽는 편이 정확합니다. 대규모 가속기 옆의 CPU를 일반 호스트처럼 구성하면 안 되며, 단일 스레드 성능과 메모리 대역폭, 일관성을 유지한 데이터 이동을 충분히 공급해 가속기가 CPU를 기다리지 않게 해야 한다는 주장입니다[1].

Vera는 커스텀 Armv9.2 Olympus 코어 88개, 하드웨어 스레드 176개, 공유 최종 단계 캐시 164MB, SOCAMM2 메모리 모듈 여덟 개로 이를 구현합니다. 모듈에는 LPDDR5X를 256GB부터 1.5TB까지 넣을 수 있고, 9600MT/s에서 최대 1.2TB/s를 제공합니다. 듀얼 소켓은 코어 176개, 용량 3TB, 대역폭 2.4TB/s로 늘어납니다. 소켓당 PCIe 6.4 레인 88개, CXL 3.1 Type-3 연결, GPU 쪽과 잇는 1.8TB/s NVLink-C2C도 갖춥니다. 그러나 최대 수치를 나열하는 것만으로는 설계 의도를 알기 어렵습니다. CPU, 캐시, 패브릭, 메모리를 같은 작업부하에 맞추어 비례 있게 구성했는지가 핵심입니다.

의존성이 긴 작업을 위한 폭넓은 코어

Olympus는 10-wide 코어입니다. 이 숫자는 NVIDIA가 트랜지스터를 어디에 배분했는지 보여 줍니다. 좁은 코어 수를 더 늘리는 대신 스레드 하나에서 매 사이클 더 많은 유효 명령을 처리하려고 했습니다. 프런트엔드는 사이클당 taken branch 두 개까지 찾아내며, 신경망 방식과 용도별 분기 예측기를 함께 사용합니다. 코어마다 명령 캐시 64KB, 데이터 캐시 96KB, 전용 L2 캐시 2MB를 둡니다. 백서는 선택한 마이크로벤치마크에서 비교 대상 x86 프로세서보다 단일 스레드 IPC가 최대 1.9배였고, 사이클당 분기 예측은 2.3배, taken branch 처리는 3.5배였다고 보고합니다[1].

이 선택은 에이전트 실행에서 다루기 까다로운 구간과 맞닿습니다. 도구 호출, 인터프리터, 검색 로직, 그래프 순회는 수천 개 GPU 실행 레인을 채우는 규칙적인 행렬 연산이 아닙니다. 분기 결과나 객체, 캐시 라인이 도착한 뒤에야 다음 작업을 발견하는 경우가 많습니다. 서로 독립적인 일이 충분할 때는 코어 수가 도움이 되지만, 폭넓은 코어는 의존성이 이어지는 한 경로의 실행 시간을 줄입니다. 코어당 실행 문맥을 두 개 제공하는 Spatial Multithreading은 처리량을 보완합니다. 그래도 설계의 중심 판단은 바뀌지 않습니다. 메모리 공급이 부족한 더 큰 코어 수보다, GPU 옆에서는 작업 하나를 빠르게 전진시키는 88개 코어가 나을 수 있다는 판단입니다.

에이전트 실행에서 CPU 쪽 엔진을 맡는 Vera. Olympus 코어 88개가 제어 흐름, 도구 실행, 데이터 준비를 처리하고, 시스템 수준 캐시 164MB와 3.4TB/s 일관성 패브릭이 교체 가능한 LPDDR5X 모듈 여덟 개, PCIe·CXL 장치, 가속기로 향하는 1.8TB/s NVLink-C2C 경로를 연결합니다. 실제 물리 배치가 아니라 구조를 설명하기 위한 도판입니다. 이 글을 위해 새로 만든 도판.

메모리 대역폭을 코어당 기준으로 배분합니다

Vera의 가장 분명한 설계 판단은 코어 수와 메모리의 비율입니다. LPDDR5X 컨트롤러 여덟 개가 교체 가능한 SOCAMM2 모듈 여덟 개에 합산 최대 1.2TB/s를 공급합니다. 코어 88개로 나누면 코어당 약 14GB/s입니다. NVIDIA는 부하를 건 측정에서 코어당 12.7GB/s를 보고했고, 비교 대상으로 쓴 듀얼 소켓 AMD EPYC 9755 시스템은 3.1GB/s였습니다[1]. 측정값이 구조에서 계산한 코어당 상한의 약 91%에 도달한 셈입니다. 여기서 두 수치를 구분해야 합니다. 14GB/s는 최대 인터페이스 대역폭을 코어 수로 나눈 값이고, 12.7GB/s는 공급사가 시험에서 얻었다고 밝힌 결과입니다.

LPDDR5X는 고용량 DDR5 시스템의 전력 특성을 그대로 따르지 않으면서 이 대역폭을 제공합니다. NVIDIA는 용량에 따라 완전히 채운 Vera 메모리 시스템이 약 30~40W를 사용한다고 추정합니다. 고용량 DDR5 구성은 100W를 넘고 MRDIMM 구성은 조건에 따라 200W를 넘을 수 있다고 비교합니다. 이는 독립 기관이 같은 조건에서 모듈을 시험한 결과가 아니라 공급사의 시스템 수준 추정입니다. 다만 왜 이 설계가 서버에서 익숙하지 않은 메모리 경로를 택했는지는 설명합니다. SOCAMM2는 납땜형 LPDDR에 없던 현장 교체 단위를 되찾았고, 백서는 다중 심볼 오류 정정, 패키징 이후 수리, 페이지 제외, 채널 스페어링, 모듈 교체를 RAS 기능으로 제시합니다.

운영상 부담이 사라진 것은 아닙니다. SOCAMM2의 공급망과 정비 생태계는 DDR5 RDIMM보다 새롭고, 기능 목록만으로 장비군의 실제 신뢰성을 판단할 수 없습니다. 용량 증설도 기존 서버 메모리만큼 다양한 공급사와 모듈 선택지를 아직 갖추지 못한 시장에 달려 있습니다. Vera가 보여 준 것은 전기적·기계적으로 성립하는 해법입니다. 고장률, 교체 절차, 가격은 양산 데이터로 판단해야 합니다.

Vera의 메모리 배치를 물리 관점에서 개념적으로 나타냈습니다. 중앙 CPU 패키지 하나 주위에 현장에서 교체할 수 있는 SOCAMM2 모듈 여덟 개를 짧은 전기 경로로 배치하며, 소켓당 256 GB~1.5 TB 용량과 합산 최대 1.2 TB/s 인터페이스를 제공합니다. 보드 렌더링은 NVIDIA 제품 사진, 제조 도면, 공개된 실제 보드 배치가 아닌 독창적인 재질 원판이며, 장치 수와 묶음, 라벨, 수치는 백서를 바탕으로 코드로 정확히 그렸습니다. 이 글을 위해 새로 만든 도판.

메모리가 넓어지면 일관성 경로도 넓어져야 합니다

중앙 캐시나 일관성 관리 지점이 요청을 직렬화하면 넓은 메모리 인터페이스를 제대로 쓸 수 없습니다. Vera는 3.4TB/s 양분 대역폭을 제공하는 확장형 일관성 패브릭(SCF)과 공유 캐시 164MB에 이 일을 분산합니다. 캐시는 패브릭 둘레에 물리적으로 나뉘어 있어 메모리 컨트롤러, CPU 코어, I/O 에이전트가 하나의 중앙 블록에 모든 트랜잭션을 몰지 않고 참여할 수 있습니다. NVIDIA는 단일 소켓을 NUMA 도메인 하나로 제시하고, 듀얼 소켓은 NUMA 노드 두 개로 보이게 합니다. 메모리 컨트롤러마다 별도 배치 문제를 노출하지 않고, 소프트웨어가 이미 다루는 소켓 경계를 유지합니다.

외부 연결도 같은 판단을 따릅니다. NVLink-C2C는 CPU와 GPU 사이에 1.8TB/s의 일관성 경로를 제공하고, PCIe 6.4는 일반 장치를, CXL 3.1은 Type-3 메모리 확장을 맡습니다. 그렇다고 모든 바이트의 거리가 같아지는 것은 아닙니다. 소프트웨어는 로컬 LPDDR5X, 다른 소켓의 메모리, 가속기 메모리, CXL로 붙인 용량을 구분해야 합니다. 다만 런타임이 판단할 수 있는 계층을 제공합니다. Vera가 제시하는 원칙은 불필요한 복사는 일관성으로 줄이되, 남아 있는 배치 비용까지 감추지는 말자는 것입니다.

Vera의 시스템 균형. a, 소켓 하나가 코어 88개, 공유 캐시 164MB, 패브릭 양분 대역폭 3.4TB/s, LPDDR5X 최대 1.2TB/s를 결합합니다. b, 공급사가 부하를 걸어 측정한 코어당 대역폭은 Vera 12.7GB/s, 듀얼 소켓 EPYC 9755 기준 시스템 3.1GB/s입니다. Vera의 14GB/s는 코어당 구조적 상한이며 측정 결과가 아닙니다. 이 글을 위해 새로 만든 도판.

평가가 입증한 범위와 남은 범위

백서는 서로 다른 성격의 결과를 구분할 수 있을 만큼 시험 조건을 공개합니다. 메모리 시험에서 NVIDIA는 비교 시스템보다 합산 대역폭이 3배 이상이고, 부하가 걸린 메모리 지연은 최대 40% 낮으며, 코어당 대역폭은 12.7GB/s 대 3.1GB/s라고 보고합니다. 그래프 순회는 2.6배, ClickHouse는 1.2배 성능을 제시합니다. 에이전트 작업을 본뜬 내부 프록시 네 개에서는 코어당 완전 부하 성능이 최대 1.8배였습니다. CPU가 GPU 작업의 준비와 전달에 참여하는 강화학습 훈련도 1.8배로 보고합니다[1]. 불규칙한 메모리 접근이나 CPU 참여가 큰 작업에서 코어와 메모리의 비율이 중요하다는 설계 주장을 뒷받침하는 결과입니다.

그러나 범용 CPU 순위를 확정하는 자료는 아닙니다. 아키텍처를 만든 NVIDIA가 작업부하를 골라 자체 측정했습니다. 주 비교 대상인 AMD EPYC 9755는 소켓당 코어가 128개이고 Vera는 88개이므로 코어당 그래프와 전체 시스템 그래프가 답하는 질문도 다릅니다. 추정 SPEC CPU 2026 결과는 특히 제한해서 읽어야 합니다. Vera 기준 시스템은 벤치마크의 구매 가능 시점 요건을 만족하지 않고, 두 시스템은 GCC 15.2에 각 아키텍처용 플래그를 사용했으며, NVIDIA도 결과를 추정치라고 표시합니다. 듀얼 소켓에서 Vera 925, AMD 시스템 898로 제시한 rate는 Vera가 일반 연산을 크게 희생하지 않았는지 확인하는 참고값이지만, 제출·공인된 SPEC 결과로 취급할 수 없습니다.

전력도 같은 주의가 필요합니다. CPU의 열설계전력은 250~450W로 설정할 수 있지만, 응용 비교에 대한 전체 시스템 벽전력은 백서에 없습니다. 메모리에서 수십 와트를 줄여도 CPU가 설정 범위 상단에서 동작할 수 있습니다. 구매자가 물어야 할 것은 메모리 모듈만의 전력이 아니라 가속기가 CPU를 기다린 시간까지 포함한 에이전트 작업 1건당 에너지입니다.

Vera 평가 결과의 근거 단계. 공급사 측정값에는 코어당 12.7GB/s, 그래프 순회 2.6배, 에이전트 프록시 네 개에서 최대 1.8배가 포함됩니다. 추정 SPEC CPU 2026 비교, 메모리 전력 추정, 제품 수준 효율 주장은 구매 가능 시점, 구성, 벽전력 조건이 다르므로 별도로 판단해야 합니다. 이 글을 위해 새로 만든 도판.

우리가 읽은 결론

Vera가 남기는 설계 원칙은 모든 서버에 LPDDR을 쓰자는 주장이 아닙니다. AI 가속기 옆의 호스트 CPU를 가속기 활용률을 결정하는 실행 고리의 일부로 평가해야 한다는 것입니다. 좁거나 메모리 공급이 부족한 호스트는 CPU 가격만 보면 저렴할 수 있습니다. 그러나 도구 실행, 검색, 전처리, 오케스트레이션 때문에 GPU가 쉬면 시스템 전체로는 비쌉니다. NVIDIA는 코어 수를 절제하고, 코어 하나를 넓게 만들고, 코어마다 높은 메모리·일관성 대역폭을 배분하는 방식으로 답했습니다.

따라서 구매 기준도 달라져야 합니다. 코어 수와 소켓 가격만으로는 부족합니다. 의존성 경로에서 CPU가 차지하는 시간, 활성 코어당 실제 대역폭, 호스트 작업 때문에 생기는 가속기 유휴 구간, 완료된 워크플로당 에너지를 측정해야 합니다. LPDDR, GPU 메모리, 다른 소켓, CXL 사이에 데이터를 배치할 때 새 계층이 복사 트래픽으로 바뀌지 않는지도 시험해야 합니다. Vera는 일관된 아키텍처와 상세한 공급사 근거를 제시했습니다. 이 답이 실제 소프트웨어, 장비군의 고장, 전체 플랫폼 전력에서도 유지되는지는 독립 시스템 평가가 결정할 것입니다.

출처와 저작권 안내

이 글은 NVIDIA Vera CPU Architecture White Paper 1.11판과 위에 인용한 공개 자료를 바탕으로 Silicon & Systems가 작성한 편집 리뷰입니다. 아키텍처, 평가 조건, 한계를 우리 표현으로 다시 썼습니다. 원문의 문장, 표, 도판은 재수록하지 않았고 이 페이지의 모든 도판은 이 리뷰를 위해 새로 만들었습니다. 백서와 제품 자료의 저작권은 NVIDIA Corporation에 있습니다(2026).