자동차 가속기는 제한된 전력과 원가 안에서 인지·계획·언어·콕핏 모델을 실행해야 합니다. 좁은 전용 가속기는 현재 모델에는 효율적이지만 다음 모델에서 빠르게 낡습니다. Li Auto의 M100은 GPU의 큰 캐시 계층 대신 소프트웨어가 텐서 이동을 명시적으로 조정하는 중간 지점을 택합니다[1].

캐시 미스가 아니라 데이터 이동을 계획합니다

컴파일러와 런타임이 텐서를 컴퓨트 클러스터, 데이터 이동 엔진, 온칩 메모리, 외부 DDR로 보냅니다. 하드웨어 관리 캐시는 대부분 제거했습니다. 일정 단위는 텐서이므로 명령어와 동기화 비용을 줄이면서 크기는 바꿀 수 있습니다. 다만 규칙적인 데이터 흐름을 전제로 하므로 불규칙한 제어는 소프트웨어가 처리해야 합니다.

M100 데이터 흐름의 개념적 하드웨어 도판. 일반 캐시 계층에 의존하는 대신 컴파일러와 런타임이 연산기와 메모리 사이의 텐서 이동을 계획합니다. M100과 Thor-U 비교는 같은 273 GB/s DDR 대역폭과 같은 전력 조건입니다. 실제 제품 사진이나 제조 도면이 아닙니다. 이 글을 위해 새로 만든 도판.

같은 전력과 273 GB/s DDR 조건에서 M100은 UniAD 구성 요소별 1.2~6.3×, 종단 간 프레임률 3.8×를 보고합니다. 클러스터 14개 중 8개만 UniAD에 써서 동시 작업 여지도 남겼습니다. Llama-2 7B 디코드는 20 ms와 21.34 ms로 비슷합니다. 외부 메모리 대역폭이 지배하기 때문입니다. 프리필 표에서는 Thor-U가 더 빠르므로 결과를 보편적 우위로 읽으면 안 됩니다.

우리가 읽은 결론

M100은 데이터 흐름이 이기는 구간과 물리 한계를 함께 보여 줍니다. 구조화된 인지 그래프에서는 명시적 일정으로 활용률을 높이지만 대역폭 제한 디코드는 같은 DDR 상한에 수렴합니다. 컴파일러가 모델 변화보다 빠르게 적응하고 줄인 캐시 복잡도가 실제 전력·원가 절감으로 이어지는지가 관건입니다.

출처와 저작권 안내

이 글은 독립적인 문장과 새 개념 도판으로 작성했습니다. 원문의 문장·도판·표를 재사용하지 않았습니다. 공개 arXiv 원고가 있으며 공식 판본은 (c) IEEE 2026입니다.