AI는 칩 설계의 모든 단계에서 같은 속도로 발전하지 않았습니다. 대중적인 시연은 자연어로 RTL을 만드는 장면에서 시작하지만 더 강한 산업 근거는 물리 설계에서 나오고 있습니다. 타이밍 분석, 게이트 크기 선택, 배치는 기존 사인오프 흐름과 반복해서 비교할 수 있는 목표가 있습니다. 탐색 공간은 크지만 후보마다 구조화된 피드백을 얻을 수 있습니다.
NVIDIA가 주도한 세 논문이 이 조건을 보여 줍니다. INSTA는 GPU에서 동작하는 미분 가능한 통계적 타이밍 엔진을 만들고, 핀 1,500만 개 규모의 상용 3 nm 설계에서 산업계 사인오프 도구와 0.999의 상관관계를 보고했습니다[1]. LEGO-Size는 이 타이밍 신호를 게이트 크기 선택에 연결하고, 학습에 사용하지 않은 백만 게이트급 상용 3 nm 설계 다섯 개에서 최대 125배 속도 향상을 보였습니다[2]. GOALPlace는 배선 이후 결과에서 배치 밀도 목표를 학습하고 설계 규칙 위반을 최대 10배 줄였습니다[3]. 서로 다른 도구지만 모두 물리 상태, 빠른 평가, 구현 가능한 수정 동작을 하나의 과정으로 묶습니다.
반복할 때마다 확인되는 물리 목표
물리 설계는 넷리스트를 타이밍, 배선, 전력, 면적, 제조 규칙을 만족하는 기하 구조로 바꿉니다. 셀을 옮기면 배선 길이와 혼잡이 달라집니다. 게이트를 키우면 지연, 슬루, 부하, 누설 전력, 주변 배치 압력이 바뀝니다. 밀도 목표는 라우팅 공간을 결정합니다. 문제는 목표가 없어서 어렵다기보다 여러 효과가 서로 연결되어 있어 어렵습니다.
이 구조에서는 학습 모델과 미분 가능한 엔진이 유용합니다. 어느 방향으로 움직이면 지표가 좋아지는지 예측하고 실제 구현 흐름으로 확인할 수 있습니다. 수정 동작도 문장으로 표현할 필요가 없습니다. 셀 좌표, 합법적인 셀 크기, 영역별 밀도 목표가 됩니다. GPU가 평가를 충분히 빠르게 만들면 같은 과정을 여러 번 반복할 수 있습니다.
아키텍처 탐색은 피드백 경로가 더 깁니다. 캐시나 실행 폭의 가치는 컴파일러, 워크로드, RTL, 물리 구현, 시스템 측정 뒤에 나타날 수 있습니다. 물리 설계는 기능 선택이 상당 부분 고정된 뒤 시작하고 남은 절충이 실제 기하 구조에 나타납니다.

타이밍을 최적화 입력으로 바꾼 INSTA
정적 타이밍 분석은 조합 경로를 통과한 데이터가 클록 시간 안에 도착하는지 판단합니다. 기존 사인오프 엔진은 정확하지만 모든 최적화 단계에서 호출하기에는 비용이 큽니다. 학습된 대리 모델은 빠를 수 있지만 임계 경로 주변의 작은 오차가 후보 순위를 바꾸면 위험합니다. INSTA는 통계적 타이밍 연산을 GPU에 구현하고 엔진을 미분 가능하게 만들어 두 문제를 함께 다룹니다[1].
0.999 상관관계의 분모가 중요합니다. 평가는 핀 1,500만 개 규모의 상용 3 nm 설계를 포함합니다. 재수렴 경로와 메모리 접근이 시스템 병목이 되는 규모입니다. INSTA는 0.1초 미만 분석과 증분 타이밍 25배 가속을 보고했습니다. 타이밍 결과가 끝의 보고서가 아니라 다른 최적화기를 이끄는 입력이 될 수 있는 속도입니다.
상관관계가 사인오프와 같은 뜻은 아닙니다. 실제 실패는 가장 나쁜 경로에서 결정되므로 임계점 주변의 절대 오차와 순위 정확도가 평균 경향보다 중요합니다. 공정 코너, 온칩 변동, 크로스토크, 신호 무결성, 예외 제약도 적용 범위를 정합니다. INSTA의 의미는 상용 분석기를 없앤 것이 아니라 사인오프에 가까운 타이밍 신호를 최적화 속도로 끌어온 데 있습니다.
INSTA-Size와 INSTA-Place는 미분 가능성의 용도를 보여 줍니다. 숫자만 반환하는 엔진은 후보가 좋아졌는지 알려 줍니다. 기울기를 반환하면 어떤 셀이나 좌표가 목표에 영향을 주는지도 알 수 있습니다. 논문은 INSTA-Size가 총 음의 슬랙을 최대 15% 개선하면서 크기를 바꾼 셀을 68% 줄였고, INSTA-Place가 ICCAD 벤치마크에서 반둘레 배선 길이 최대 16%, 총 음의 슬랙 최대 59.4%를 개선했다고 보고했습니다[1].
이산적인 셀 선택과 기울기를 연결한 LEGO-Size
게이트 크기는 이산적입니다. 표준 셀 라이브러리가 제공하는 구동 강도와 문턱전압 선택지 중 하나를 골라야 합니다. 한 셀을 바꾸면 다음 셀의 부하와 도착 시간이 달라지므로 영향은 전역적입니다. 모든 조합을 시험할 수 없고 국소 휴리스틱은 한 경로를 고친 뒤 다른 경로를 악화시킬 수 있습니다.
LEGO-Size는 GPU 기반 미분 가능 타이밍과 이산적인 셀 선택을 연결합니다[2]. 기울기로 영향이 큰 셀을 찾고 합법적인 크기를 선택한 뒤 새 설계를 평가합니다. 상용 3 nm 공정의 학습에 사용하지 않은 백만 게이트급 산업 설계 다섯 개에서 산업계 사인오프 흐름보다 최대 125배 빠르고 총 음의 슬랙을 37% 개선했으며 전력과 면적 증가는 제한적이었다고 보고했습니다.
학습하지 않은 설계에서 평가했다는 조건이 중요합니다. 학습 블록에서만 동작하면 배치 패턴이나 타이밍 분포를 외운 것일 수 있습니다. 새로운 설계는 타이밍 표현과 수정 규칙이 이전되는지를 확인합니다. 다만 다른 공정과 라이브러리, 제약으로의 이전은 별도 근거가 필요합니다.
도입 방식도 명확합니다. AI가 표준 셀 라이브러리, 합법화, 사인오프를 대체하지 않습니다. 정해진 규칙 안에서 후보 선택을 빠르게 합니다. 출력은 합법적인 셀을 사용한 일반 넷리스트이고 기존 흐름이 성능 저하를 거부할 수 있습니다.
배선 결과를 앞단 목표로 바꾼 GOALPlace
글로벌 배치는 상세 배선이 가능할지를 알기 전에 배선 길이와 밀도를 맞춥니다. 균일한 밀도 패널티는 충분하지 않을 수 있습니다. 핀 접근과 배선 수요가 높은 영역은 빈 공간이 필요하고 다른 영역은 더 조밀하게 배치할 수 있습니다. 적절한 목표는 설계와 후단 라우터에 따라 달라집니다.
GOALPlace는 상용 도구의 배선 이후 결과에서 밀도 목표를 학습합니다[3]. 배치 뒤 혼잡을 예측하는 데서 멈추지 않고, 후단 근거를 다음 배치를 이끄는 목표로 바꿉니다. 논문은 설계 규칙 위반 최대 10배 감소, 배선 길이 5% 감소, 최악 음의 슬랙 30%, 총 음의 슬랙 60% 개선을 보고했습니다.
수치보다 중요한 점은 피드백의 위치입니다. 배선 품질은 보통 늦게 받는 판정입니다. GOALPlace는 이를 앞단의 학습 자료로 사용합니다. 계산하기 쉬운 배치 목표와 라우팅과 타이밍에서 실제로 나타나는 제약의 차이를 줄입니다.
유지 비용도 생깁니다. 학습된 목표에는 라우터, 공정 규칙, 라이브러리, 설계 유형이 반영됩니다. 이 조건이 바뀌면 분포가 이동할 수 있습니다. 실제 운영에서는 새로운 배선 결과와 계속 비교하고 불확실성이 커지면 보수적인 목표로 돌아가야 합니다.

합법적인 동작으로 이어지는 기울기
연속 모델의 기울기가 손실을 줄이는 방향을 가리켜도 실제 설계 공간은 이산적이고 제약이 많습니다. 셀은 행 안에 있어야 하고 매크로는 겹칠 수 없으며 라우팅 트랙은 유한하고 라이브러리 선택은 범주형입니다. 수학적인 이동을 합법적인 물리 동작으로 투영해야 합니다.
기존 EDA 기능이 필요한 이유입니다. 합법화, 증분 추출, 라이브러리 조회, 라우팅 추정이 제안된 방향을 구현 가능한 후보로 바꿉니다. 투영 과정에서 예상한 이점이 사라지면 그 결과를 다음 반복에 반영해야 합니다. 이 수정 경로가 없으면 미분 가능한 대리 모델이 실제 구현에서는 쓸 수 없는 기울기를 만들 수 있습니다.
여러 목표도 분리해서 봐야 합니다. 셀을 많이 키워 슬랙을 개선하면 전력, 면적, 혼잡이 늘 수 있습니다. 배선 길이를 줄이다가 핀 접근을 악화시킬 수 있습니다. 하나의 고정 점수로 숨기지 말고 어느 자원을 사용해 이득을 얻었는지 보여 줘야 합니다.
전체 구현 흐름을 포함한 산업 근거
학계 벤치마크는 재현성에 유용하지만 산업 도입을 주장하려면 실제 규모와 후단 검증이 필요합니다. 넷리스트 크기만으로는 부족합니다. 공정, 라이브러리, 타이밍 코너, 배선 단계, 사인오프 기준, 같은 시작점을 사용했는지를 밝혀야 합니다. 앞단 대리 지표보다 전체 흐름 이후 PPA가 더 강한 근거입니다.
세 논문은 서로 보완합니다. INSTA는 평가기를 상용 타이밍에 대조합니다. LEGO-Size는 새로운 산업 설계에서 평가기와 수정 동작을 연결합니다. GOALPlace는 상용 배선 결과로 앞단 목표를 학습합니다. 예측, 수정, 후단 결과라는 세 부분이 이어집니다.
모든 제품으로의 이전을 한 번에 증명한 것은 아닙니다. GPU 블록, CPU 코어, 메모리 컨트롤러는 계층, 매크로, 혼잡, 타이밍 분포가 다릅니다. 공정이 바뀌면 배치와 지연의 관계도 달라집니다. 학습과 검증 범위에 가까운 블록 계열부터 시작하고 사인오프 차이가 안정적일 때 범위를 넓혀야 합니다.
물리 설계자의 역할 변화
최적화기는 엔지니어가 정한 제약 안에서 동작합니다. 클록 구조, 플로어플랜, 매크로 배치, 전력 공급, 계층, 허용할 절충이 가능한 영역을 정합니다. 빠른 최적화기는 나쁜 제약을 더 빨리 드러낼 수 있지만 타이밍 손실만 보고 제품 의도를 결정할 수는 없습니다.
물리 설계자는 흐름이 막힌 원인도 판단합니다. 혼잡은 핀 토폴로지, 플로어플랜 통로, 합성 과정의 로직 복제, 비현실적인 타이밍 제약에서 생길 수 있습니다. 표준 셀만 계속 옮기면 한 층만 고칩니다. 좋은 자동화는 원인 패턴을 보여 주고 로직, 플로어플랜, 아키텍처 중 어디로 문제를 올려야 하는지 알려 줘야 합니다.
엔지니어의 일이 사라지기보다 위치가 바뀝니다. 국소 설정을 반복 시험하는 시간은 줄고 목표 설정, 계속 남는 위반의 해석, 어느 상위 결정을 바꿀지 판단하는 비중이 늘어납니다. 개별 최적화 동작에서 최적화 문제의 구조를 책임지는 역할로 이동합니다.
도입 판단의 기준
AI가 물리 설계에서 먼저 성과를 낸 데에는 세 조건이 맞았습니다. 상태가 기계가 읽을 수 있는 기하 구조와 타이밍 그래프이고, 목표를 반복해서 평가할 수 있으며, 기존 구현 흐름으로 동작을 검증할 수 있습니다. GPU 가속은 이 과정을 실제로 반복할 수 있는 속도로 만듭니다.
구매자는 모델 이름보다 전체 과정을 평가해야 합니다. 시스템이 어떤 물리 상태를 관측하고 어느 사인오프 엔진을 기준으로 삼는지, 제안한 동작을 어떻게 합법화하는지, 불확실성을 어떻게 표시하는지, 배선과 타이밍 마감 뒤에도 이점이 남는지를 확인해야 합니다. 라이브러리, 공정, 도구 버전이 바뀔 때 재보정하는 방법도 필요합니다.
INSTA, LEGO-Size, GOALPlace는 AI가 칩 전체의 권한을 갖지 않고도 산업 흐름에 들어갈 수 있음을 보여 줍니다. 범위가 좁고 피드백 경로가 강했기 때문에 가능한 결과입니다. 이 구조가 다른 AI 반도체 설계 분야로 가져갈 수 있는 핵심입니다.
출처와 저작권 안내
이 글은 인용한 세 논문과 공식 연구 기록을 바탕으로 Silicon & Systems가 독립적으로 작성한 편집 분석입니다. 기술 내용과 수치는 우리 표현으로 다시 설명했으며 원문의 문장, 표, 레이아웃 또는 도판을 복제하지 않았습니다. 두 도판은 이 글을 위해 새로 만들었습니다. 인용 논문의 저작권은 각 출판사와 저자에게 있습니다.