OpenAI가 Jalapeño에서 줄이려는 비용은 행렬 연산 자체보다 추론 단계 사이의 데이터 이동과 대기시간입니다. 하나의 요청은 입력을 처리하는 프리필에서 시작해 지연시간에 민감한 초안 모델을 거친 뒤, 모델 상태를 대량으로 읽고 전문가 병렬 통신을 수행하는 검증 단계로 넘어갈 수 있습니다. 각 단계에 맞는 전용 장치를 따로 두면 개별 장치의 효율은 높일 수 있지만, 단계가 바뀔 때마다 KV 캐시를 옮기거나 다른 패키지를 유휴 상태로 유지하는 비용이 생깁니다.

OpenAI가 Hot Chips 2026에서 제시한 답은 데이터 지역성입니다. Jalapeño는 HBM4 메모리 시스템, 64개 공간형 코어 슬라이스, 집합 통신 전용 경로, 별도의 일반 온칩 네트워크를 하나의 ASIC에 묶고, 128개 ASIC의 로컬 영역에서 2,048개 ASIC의 전역 시스템까지 Ethernet 계층으로 확장합니다[1]. SemiAnalysis의 InferenceX로 공개 모델 세 개를 시험한 결과에서는 선택한 NVIDIA 시스템보다 전력당 처리량이 높으면서 종단 지연시간도 낮았다고 보고합니다[2]. 다만 비교 분모는 같은 랙의 실제 입력 전력이 아니라 각 가속기의 공개 패키지 TDP입니다.

Jalapeño의 핵심은 범용 가속기 순위가 아니라 추론 시스템의 구성 방식입니다. 단계마다 다른 장치로 상태를 보내는 대신 한 칩 안에서 연산·메모리·통신의 활성 비율을 바꿉니다. 공개된 세 모델의 낮은 지연시간 구간에서는 이 구조를 뒷받침하는 결과가 나왔습니다. 양산 환경의 랙 전력, 장애 시 동작, 소프트웨어 성숙도와 더 넓은 모델 범위는 아직 별도로 확인해야 합니다.

최대 연산량보다 중요한 요청 완료 시간

최대 FLOPS는 유리한 커널에서 가속기가 발행할 수 있는 연산량을 보여 줍니다. 대화형 서비스가 실제로 필요로 하는 값은 정해진 전력과 지연시간 안에서 끝낸 요청 수입니다. 에이전트 작업에서는 한 번의 사용자 요청이 앞 단계의 결과를 기다리는 모델 호출 여러 개로 이어질 수 있으므로, 배치 처리량이 조금 늘어나는 것보다 한 단계의 대기시간을 줄이는 편이 전체 완료 시간을 더 크게 바꿀 수 있습니다.

OpenAI는 이 차이를 마지막 토큰까지 걸린 시간과 전력당 유효 작업으로 표현합니다. InferenceX는 최대 처리량 한 점만 보고하지 않고, 각 시스템의 지연시간과 처리량이 바뀌는 운용 범위를 훑습니다[2]. 배치를 키워 처리량을 높이는 대신 사용자가 더 오래 기다렸는지, 토큰 사이 간격을 줄였을 때 동시 요청 처리량이 얼마나 감소했는지를 함께 볼 수 있습니다. 대화형 추론에서는 피크 텐서 성능보다 적절한 평가 계약입니다.

그러나 전력 경계를 분명히 해야 합니다. Jalapeño의 정격은 700W이고, OpenAI는 시험한 작업에서 지속 전력이 550W 이하였다며 자체 측정값을 공개했습니다. 비교 계산에는 Jalapeño 700W, GB200 1,200W, GB300 1,400W의 패키지 TDP를 사용했습니다[2]. 호스트, 스위치, 광모듈, 저장장치, 전력 변환, 냉각은 이 분모에 포함되지 않습니다. 이 결과는 같은 정규화 규칙에서 칩 운용점의 우위를 보여 주지만, 완료된 요청당 시설 비용까지 입증하지는 않습니다.

세 가지 실행 단계와 고정된 전용 장치 비율의 비용

하나의 요청에서도 필요한 하드웨어 비율은 계속 달라집니다. 프리필은 입력 문맥을 처리하므로 행렬 연산 자원을 많이 사용합니다. 추측 실행을 위한 작은 초안 모델은 배치가 작고 다음 단계가 결과를 기다리므로 지연시간이 중요합니다. 검증은 모델 상태를 더 많이 읽어 HBM 대역폭을 사용하며, MoE 모델에서는 짧은 시간에 전문가 병렬 통신이 몰릴 수 있습니다. 문맥 길이, 초안 토큰의 채택률, 모델 구조, 요청 구성에 따라 세 단계의 비중도 바뀝니다.

단계별 전용 가속기를 두는 장비군에서는 경계가 서비스 비용으로 들어옵니다. KV 캐시를 다음 장치로 옮기면 네트워크 대역폭과 동기화 시간이 필요합니다. 상태를 원래 장치에 둔 채 다른 전용 엔진이 연산하면, 사용하지 않는 가속기와 그 패키지의 메모리·I/O가 켜진 상태로 남을 수 있습니다. 모델이나 트래픽 구성이 바뀌면 처음에 정한 장치 비율도 맞지 않게 됩니다.

Jalapeño는 균형을 맞춘 ASIC 하나를 두고 단계별 활성 자원을 바꾸는 쪽을 택합니다. 프리필에서는 행렬 연산을 더 사용하고, 검증에서는 로컬 메모리 대역폭을 끌어오며, 통신이 필요한 구간에는 적합한 네트워크 경로를 활성화합니다. 쓰지 않는 블록은 패키지 안에서 전력을 줄일 수 있습니다. 이 설계가 이질성을 없앤 것은 아닙니다. 이질적인 실행 자원을 하나의 스케줄링·메모리 영역 안으로 옮겨, 요청의 장기 상태를 장비군 경계 너머로 복사하지 않게 했습니다.

패키지 안에서 시작되는 데이터 지역성

공개된 패키지는 중앙 연산 다이 하나와 HBM4 스택 여섯 개를 결합합니다. 메모리 용량은 216GiB, 합산 대역폭은 15.4TB/s이며, 700W 패키지에서 MXFP4 행렬 연산은 최대 13.4PFLOP/s로 제시됐습니다[4]. 이는 응용 프로그램이 달성한 처리량이 아니라 구조 사양입니다. 단계가 달라질 때마다 패키지 밖으로 나가지 않아도 되도록 연산량과 메모리 용량, 대역폭을 한곳에 제공하는 것이 목적입니다.

Jalapeño의 데이터 지역성을 패키지 규모에서 개념적으로 나타냈습니다. 중앙 연산 다이 하나 주위에 HBM형 스택 여섯 개를 짧은 인터포저 경로로 배치했으며, 공개 사양인 216GiB와 15.4TB/s에 대응합니다. 재질 렌더링은 OpenAI 또는 Broadcom 제품 사진, 실제 플로어플랜, 제조 도면이 아니며, 장치 수와 호출선은 Hot Chips 공개 내용을 바탕으로 코드로 정확히 합성했습니다. 이 글을 위해 새로 만든 도판입니다.

물리적인 HBM 스택과 논리적인 메모리 슬라이스는 구분해야 합니다. Jalapeño에는 코어 슬라이스 64개가 있고, 각 슬라이스는 하나의 통합 메모리 장치에 모두 경합하는 대신 가까운 HBM 영역을 보도록 설계됐습니다[4]. 물리 스택 여섯 개는 채널과 용량을 제공하고, 아키텍처는 그 자원을 여러 연산 영역에 논리적으로 나눕니다. 소프트웨어가 텐서의 물리 위치를 알아야 하지만, 반복해서 쓰는 피연산자를 같은 코어 주변에 유지할 수 있습니다.

통신 경로도 두 종류로 나누었습니다. 집합 통신 전용 네트워크는 자주 쓰는 고대역폭 패턴을 예측 가능한 레지스터 간 이동으로 처리합니다. 일반 온칩 네트워크(NoC)는 원격 메모리 접근, 빈도가 낮은 전송, 외부 네트워크 연결을 맡습니다. 하나의 네트워크가 두 역할을 모두 담당하려면 최악의 상황에 맞춘 버퍼, 라우팅, 중재 회로가 필요합니다. 경로를 나누면 반복되는 집합 연산이 일반 통신의 경합과 긴 지연시간 허용 설계에 묶이지 않습니다.

Jalapeño의 논리 구조와 실행 단계의 대응 관계입니다. a, 64개 공간형 코어 슬라이스가 로컬 HBM 영역을 사용하고, 자주 쓰는 슬라이스 간 이동은 집합 통신 전용 경로가, 원격·비정형 통신은 별도의 일반 NoC가 담당합니다. 물리 HBM4 스택 여섯 개를 논리 NUMA 영역 여섯 개로 해석하면 안 됩니다. b, 프리필·초안 생성·검증은 KV 상태를 다른 종류의 가속기로 옮기지 않고 같은 ASIC 안에서 연산·메모리·통신 비율을 달리 사용합니다. 이 글을 위해 새로 만든 도판입니다.

하드웨어 단순화가 컴파일러에 넘긴 일

여러 단계에 쓸 수 있는 가속기라고 해서 모든 블록이 모든 연산을 같은 효율로 처리하는 것은 아닙니다. Jalapeño의 공간형 프로그래밍 모델은 로컬 텐서, 명시적인 통신, 예측 가능한 동기화를 소프트웨어에 드러냅니다. 컴파일러와 런타임은 작업을 64개 슬라이스에 배치하고, 집합 통신과 일반 경로 가운데 하나를 고르며, 파이프라인과 텐서의 물리 위치를 관리해야 합니다. 하드웨어에서 줄인 복잡성 일부가 명시적인 매핑 문제로 옮겨 갑니다.

OpenAI는 이 탐색 공간을 AI가 최적화하기 적합하다고 판단했습니다. 자체 모델을 구현과 초기 구동에 사용했고, 원래 양산 계획에 없던 공개 모델 세 개를 두 달 안에 높은 성능으로 옮겼다고 설명합니다. GPT-OSS의 일부 어텐션·MoE 블록에서는 AI가 만든 구현이 기존 전문가 구현보다 1.5~1.8배 빨랐습니다[2]. 이 수치는 선택한 커널 블록에 적용되며, 전체 모델의 실행시간이 같은 비율로 줄었다는 의미는 아닙니다.

전용 ASIC을 도입하려면 컴파일러와 런타임까지 함께 바꿔야 합니다. GPU는 폭넓은 프로그래밍 기능과 성숙한 라이브러리, 큰 개발자 생태계로 작업의 불규칙성을 받아냅니다. Jalapeño는 추론 패턴에 맞춰 하드웨어 범위를 좁히고, 매핑 도구로 모델 변화에 대응합니다. OpenAI는 모델, 서빙 소프트웨어, 컴파일러, 칩과 장비군을 함께 운영하므로 내부 작업 기록을 최적화에 바로 사용할 수 있습니다. 외부 고객에게 판매하는 가속기라면 같은 자료와 도구가 없는 고객에게도 이 유연성을 제공해야 합니다.

명확한 계층을 전제로 한 Ethernet 스케일업

패키지 다음의 지역성 경계는 ASIC 128개입니다. 공개 자료는 이 로컬 영역에서 프로세서당 네트워크 대역폭 600GB/s를 제공하고, ASIC 2,048개의 전역 영역에서는 프로세서당 200GB/s를 제공한다고 설명합니다. 더 큰 시스템은 Broadcom Tomahawk 6 Ethernet 스위치를 사용한 반평탄화 2단계 Clos 토폴로지이며, 텐서 병렬 통신에는 더 넓은 경로를, 전문가 병렬 통신에는 상대적으로 좁은 경로를 배분합니다[4]. 모든 장치를 더한 사양은 MXFP4 27EFLOP/s, HBM4 432TiB, 합산 메모리 대역폭 32PB/s입니다.

이 합산값은 전송 하나가 사용할 수 있는 대역폭이 아닙니다. 로컬 영역의 텐서 병렬 집합 통신과 전역 단계로 넘어가는 전문가 트래픽은 서로 다른 경로를 지납니다. 오버서브스크립션, 라우팅, 메시지 크기, 동시에 발생한 집합 통신 수가 실제 처리량을 결정합니다. 따라서 Ethernet이라는 이름만으로 스케일업 특성을 판단할 수 없습니다. 지연시간과 트래픽이 큰 교환은 ASIC 128개 안에 남기고, 더 좁은 장치당 경로를 허용할 수 있는 통신만 2,048개 영역으로 보내는 계층 구조가 핵심입니다.

장애 범위도 이 계층을 따릅니다. ASIC 2,048개를 묶으면 일부 끝단이나 링크, 스위치가 사라진 상태에서도 라우팅과 작업 배치를 유지해야 합니다. Hot Chips 자료는 토폴로지와 링크 속도를 공개했지만, 장기간 운영한 장비군의 고장 분포, 복구 시간, 서비스 수준은 제시하지 않았습니다. 로컬 영역의 링크나 가속기를 잃었을 때 런타임이 모델을 어떻게 다시 배치하고, 그 과정에서 처음 확보한 KV 지역성을 보존하는지가 운영 검증 항목입니다.

낮은 지연시간 구간에서 두드러진 성능 결과

OpenAI는 GPT-OSS 120B를 GB200과 비교하고, DeepSeek R1 670B와 Kimi K2.5 1T는 GB300과 비교했습니다. 공개된 InferenceX 조건은 입력 8k 토큰과 출력 1k 토큰을 명목 길이로 사용하며, 주요 표는 단일 토큰 예측(STP)을 기준으로 합니다. 최대 혼합 처리량은 GPT-OSS에서 kW당 초당 85,448 대 44,960토큰, DeepSeek에서 19,641 대 11,781토큰, Kimi에서 18,195 대 11,862토큰이었습니다. 각각 약 1.9배, 1.7배, 1.5배입니다[2].

지역성 설계를 더 잘 보여 주는 값은 종단 지연시간입니다. GPT-OSS는 1.03초 대 1.80초, DeepSeek은 1.65초 대 5.99초, Kimi는 1.56초 대 5.31초로 보고됐습니다. 최소 토큰 간격은 Jalapeño가 각각 0.69ms, 1.43ms, 1.44ms였고, 비교 시스템은 1.87ms, 5.90ms, 5.48ms였습니다. 메모리와 통신을 기다리는 시간이 사용자에게 직접 보이는 운용점에서 차이가 커졌다는 점이 구조적 주장과 연결됩니다.

입력 8k 토큰과 출력 1k 토큰, 단일 토큰 예측을 사용한 InferenceX 공개 비교입니다. a, 최대 혼합 처리량은 GPT-OSS에서 kW당 초당 85,448 대 44,960토큰, DeepSeek R1에서 19,641 대 11,781토큰, Kimi K2.5에서 18,195 대 11,862토큰입니다. b, 종단 지연시간은 각각 1.03 대 1.80초, 1.65 대 5.99초, 1.56 대 5.31초입니다. 전력은 Jalapeño 700W, GB200 1,200W, GB300 1,400W의 패키지 TDP로 정규화했습니다. 지연시간은 낮을수록 좋습니다. OpenAI가 공개한 수치를 바탕으로 이 글을 위해 다시 그린 도표입니다.

53.7배, 104.3배, 56.1배라는 수치는 극단적인 저지연 조건에서 나왔습니다. 기존 시스템의 최소 토큰 간격을 맞춘 지점에서 Jalapeño가 보고한 전력당 처리량 차이이며, 비교 시스템의 전체 트래픽이 작아지는 좌표입니다. 전체 운용 범위의 평균 개선폭은 아닙니다. Jalapeño가 처리량과 지연시간의 선택 범위를 넓혔다는 근거는 되지만, 모든 데이터센터 추론 작업을 104.3배 빨리 끝낸다는 뜻은 아닙니다.

추측 실행 방식도 비교에 영향을 줍니다. Hot Chips 현장 분석에 따르면 주요 Jalapeño 결과는 단일 토큰 예측을 사용했고, 일부 NVIDIA 운용점은 다중 토큰 예측을 사용했습니다[4]. OpenAI가 별도로 제시한 DeepSeek 비교에서는 단일 토큰 Jalapeño가 다중 토큰 GB300보다 최대 전력당 처리량은 약 1.5배 높고 종단 지연시간은 2.2배 낮았습니다. 알고리즘 이점을 비교 시스템 쪽에 둔 유용한 결과이지만, 완전한 재현에는 소프트웨어 버전, 배치 정책, 병렬 배치, 전체 시스템 구성이 더 필요합니다.

아직 비용으로 환산할 수 없는 범위

첫째, 패키지 효율은 시설 효율과 다릅니다. 호스트, 스위치, 광모듈, 저장장치, 전력 변환, 냉각을 포함하면 칩 TDP의 비율과 랙 전력의 비율이 달라질 수 있습니다. 같은 모델을 담기 위해 필요한 장치 수와 네트워크 구성도 비교해야 합니다. 동일한 랙 입력 전력에서 지연시간 목표를 만족한 요청 수를 측정해야 칩의 장점이 시스템 비용으로 이어지는지 알 수 있습니다.

둘째, 공개 벤치마크라고 해서 중립적인 제품 평가가 되는 것은 아닙니다. InferenceX는 공개된 시험 방식이고 세 가지 공개 모델을 사용했으므로 OpenAI 내부 모델 한 개보다 근거 범위가 넓습니다. 그러나 Jalapeño는 OpenAI 연구실에서 자체 컴파일러와 커널, 선택한 운용점으로 시험했습니다. 구매 가능한 하드웨어에서 독립 운영자가 결과를 재현하기 전에는 일반적인 조달 순위로 확정할 수 없습니다. OpenAI도 2026년 말 내부 배포를 앞두고 양산 검증, 소프트웨어 성숙화, 더 많은 모델에 대한 시험을 진행 중이라고 밝혔습니다[2].

셋째, 지역성을 확보하려면 희소한 HBM4 자원을 많이 사용합니다. 스택 여섯 개와 216GiB는 한 패키지에 큰 대역폭과 모델 용량을 제공하지만, 공급량, 수율, 가격이 장비군 규모를 제한할 수 있습니다. ASIC 128개와 2,048개 구성은 설계한 시스템 영역을 보여 주며, 장기간 가동한 양산 장비군의 신뢰성 연구가 아닙니다. 부품 공급, 교체 절차, 성능을 낮춘 상태의 운영이 실제 제공 가능한 용량을 결정합니다.

마지막으로 Jalapeño는 추론용 ASIC입니다. 공개 자료는 훈련 성능, 일반 과학 계산, GPU 소프트웨어와의 폭넓은 호환성을 입증하지 않습니다. OpenAI도 NVIDIA와 다른 파트너의 가속기를 훈련과 추론에 계속 배치하겠다고 밝혔습니다[2]. 데이터센터의 모든 가속기를 즉시 바꾼다는 결론보다, 빠르게 커지는 추론 영역 일부를 자체 구조로 분리한다는 해석이 정확합니다.

9개월 테이프아웃과 연속 검증의 부담

OpenAI와 Broadcom은 초기 설계에서 테이프아웃까지 9개월이 걸렸다고 발표했습니다[3]. AI 모델은 구현 후보를 탐색하고 측정·검증 반복을 줄였으며, 일부 산술 회로의 전력·성능·면적을 최적화하는 데 사용됐습니다. Hot Chips 발표에서는 RTL 동결 직전까지도 큰 변경을 반영했다고 설명합니다. 짧은 일정이 의미 있으려면 설계가 계속 바뀌는 동안에도 정확성을 보존하는 검증 체계가 함께 있어야 합니다.

명시적인 배치와 동기화는 이 과정에 도움이 됩니다. 로컬 텐서와 예측 가능한 통신은 엔지니어와 최적화 모델이 탐색할 범위를 줄입니다. 동시에 컴파일러, 런타임, 실리콘을 함께 검증해야 하는 부담도 만듭니다. 어떤 텐서 모양에서 빠른 매핑이 다른 모양에서는 로컬 저장공간을 넘기거나 긴 통신 경로를 만들 수 있습니다. 새 모델 계열마다 커널 최적화가 필요하다는 점은 OpenAI도 인정합니다[2].

다른 칩 개발사가 그대로 가져갈 교훈은 9개월이라는 숫자가 아닙니다. OpenAI는 첫 세대의 범위를 추론으로 좁혔고, Broadcom의 실리콘 구현 경험, Celestica의 시스템 통합, 실제 서비스 작업 기록을 함께 사용했습니다. 이런 입력이 없는 조직은 코드 생성은 빨라져도 아키텍처 탐색이나 사인오프, 소프트웨어 초기 구동에 시간이 더 필요할 수 있습니다. 재사용 가능한 원칙은 작업 측정, 아키텍처, RTL, 검증, 물리 설계를 연속해서 맞추는 방식입니다.

요청과 랙 규모에서 필요한 도입 검증

도입 시험은 요청의 전체 경로를 유지해야 합니다. 단계별 계측값에는 프리필 연산 점유율, 초안 반복의 지연시간, 검증 단계의 메모리 대역폭, 집합 통신 사용률, KV 캐시 이동량이 들어가야 합니다. 마지막 토큰까지 걸린 시간은 명시한 요청 도착 분포, 문맥 길이 분포, 추측 토큰 채택률에서 p50·p95·p99로 보고해야 합니다. 평균 토큰 처리량만으로는 포화된 통신 경로 뒤에서 일부 사용자가 기다리는 상황을 찾기 어렵습니다.

에너지는 랙 입력에서 측정해야 합니다. 가속기 패키지, 호스트, 스위칭, 광통신, 냉각을 분리해 기록한 뒤, 지연시간 목표를 만족한 완료 요청 수로 전체를 나누는 방식이 적합합니다. 로컬 영역과 전역 영역에서는 텐서 병렬·전문가 병렬 트래픽을 동시에 늘려 유효 처리량이 더 이상 증가하지 않는 지점을 찾아야 합니다. 가속기, 링크, 스위치를 하나씩 제거하는 장애 주입으로 상태 복원, 모델 재배치, 지연시간 회복도 측정할 필요가 있습니다.

소프트웨어 이식 비용도 별도 예산으로 봐야 합니다. 새 모델을 올리는 데 필요한 개발 시간, 자동 최적화 전후의 커널 범위, 정확성 결함, 컴파일러의 대체 경로, 모델 수정 뒤 유지되는 성능을 기록해야 합니다. 선택한 커널에서 얻은 1.5~1.8배 개선은 도구가 유용한 매핑을 찾을 수 있다는 근거입니다. 조달 판단은 이 개선을 매번 얻으면서도 모델 갱신이 소수의 내부 하드웨어 팀에 종속되지 않는지까지 확인해야 합니다.

오래 남을 설계 판단인 데이터 이동 통제

Jalapeño의 핵심 기여는 700W 패키지 하나가 모든 GPU를 이긴다는 주장이 아닙니다. 추론 효율은 상태가 이동하고 동기화 범위가 커지며 활성 하드웨어 비율이 요청과 맞지 않는 단계 경계에서 줄어든다는 시스템 분석입니다. Jalapeño는 64개 슬라이스의 로컬 HBM 영역, 다이 안의 집합 통신·일반 통신 분리, 다이 밖의 128개·2,048개 Ethernet 계층으로 이 문제에 대응합니다.

따라서 평가 기준도 달라집니다. 최대 FLOPS와 HBM 대역폭은 필요한 용량 지표지만, 요청의 데이터가 가까이 남아 있는지, 낮은 지연시간이 유효 부하에서도 유지되는지, 쉬는 패키지가 절감한 전력을 다시 소비하는지는 알려 주지 않습니다. 첫 실리콘과 공개 모델 결과는 지역성 중심 추론 구조가 성립할 가능성을 보여 줍니다. 랙 전력, 장애 복구, 독립 재현, 새 모델을 계속 매핑하는 비용이 이 구조의 경제성을 결정할 것입니다.

출처와 저작권 안내

이 글은 OpenAI의 Hot Chips 2026 발표, 공식 성능 보고서와 최초 공개 자료, 위에 인용한 현장 분석을 바탕으로 Silicon & Systems가 작성한 독립 편집 다이제스트입니다. 아키텍처, 측정 결과, 한계를 우리 표현으로 다시 썼으며 원문의 문장, 표, 슬라이드, 도판을 재수록하지 않았습니다. 패키지 재질 이미지는 실제 제품 사진이나 제조 도면이 아닌 독창적인 개념 렌더링이고, 라벨·토폴로지·도표는 이 글을 위해 코드로 제작했습니다. Hot Chips 발표와 OpenAI 자료의 저작권은 각 권리자에게 있습니다(2026).