Meta는 추천 모델 1,500개 이상을 NVIDIA GPU, AMD GPU, 자체 MTIA에서 운영한다고 설명합니다. 필요한 커널이 없거나 느리면 CPU 계층을 따로 두어 네트워크 지연을 감수하거나 모델 출시를 미뤄야 합니다. KernelEvolve는 이 조합 문제를 한 번의 코드 생성이 아니라 측정이 포함된 탐색으로 다룹니다[1].
만들고 실행하고 선택하고 기억합니다
시스템은 최적화 후보를 그래프 상태로 표현합니다. 에이전트가 문서와 운영 코드를 검색해 Triton·CuTe DSL·저수준 코드를 만들고, 컴파일·정확성 검사·성능 측정을 거쳐 좋은 가지를 확장합니다. 일반 모델이 학습하지 못한 자체 가속기 규칙은 지속 지식 저장소에서 가져옵니다.

KernelBench 250개와 ATen 연산자-플랫폼 조합 480개를 모두 통과했습니다. 운영 작업의 PyTorch 기준 대비 속도 향상은 1.25~17×이고 개발 기간은 수주에서 수시간으로 줄었다고 보고합니다. 입력 모양에 따라 성능이 나빠지는 후보도 있으므로 배포 판정에는 한 입력이 아니라 운영 분포를 사용합니다.
우리가 읽은 결론
에이전트 코딩은 실행이 순환을 닫을 때 인프라가 됩니다. 검색은 비공개 하드웨어 지식을 공급하고, 시험은 틀린 코드를 제거하고, 성능 측정은 문체 선호 대신 근거를 제공합니다. 최고 속도보다 중요한 결과는 생성 코드를 실행 전에는 신뢰하지 않으면서 변화하는 칩의 커널 범위를 유지하는 절차입니다.
출처와 저작권 안내
이 글은 독립적인 문장과 새 도판으로 작성했습니다. 원문의 문장·코드·도판·표를 복제하지 않았습니다. Meta가 전문 기술 보고서를 공개했으며 ISCA 판본은 (c) IEEE 2026입니다.