최신 물리 설계 도구에는 수백 개의 옵션, 노력 수준, 임계값, 단계별 스위치가 있습니다. CPU 코어, 가속기, 인터페이스 블록이 같은 방식으로 실패하지 않기 때문에 이런 유연성이 필요합니다. 동시에 새로운 설계를 시작할 때마다 유용한 흐름 설정을 다시 찾는 운영 비용이 생깁니다.
블랙박스 최적화는 수동 조합 시험보다 낫지만 각 실행을 최종 점수 하나로 다루는 경우가 많습니다. 어떤 레시피가 더 좋았는지는 알지만 왜 좋았는지는 모릅니다. 다음 블록의 타이밍 그래프, 혼잡, 전력 분포가 바뀌면 탐색을 처음부터 다시 시작할 수 있습니다.
InsightAlign과 FastTuner는 이전 경험을 가져가는 두 방법을 제시합니다. InsightAlign은 전문가가 판단하는 설계 상태를 수치화하고, 학습하지 않은 설계에서도 레시피 조합의 순위를 예측합니다[1]. FastTuner는 설계 그래프를 인코딩하고 Transformer 기반 강화학습 정책으로 설정값을 순서대로 고르며, 전체 물리 설계를 매번 실행하는 대신 오프라인에서 학습한 PPA 평가기로 보상을 계산합니다[2]. 목표는 같습니다. 과거 실행이 다음 설계에서 다시 쓸 수 있는 자산이 되어야 합니다.
설정값 묶음보다 넓은 레시피의 의미
같은 옵션도 적용 단계와 설계 상태에 따라 다른 결과를 냅니다. 높은 배치 노력 수준이 한 블록에서는 좋아도 다른 블록의 혼잡을 키울 수 있습니다. 타이밍 최적화 스위치가 총 음의 슬랙을 줄이면서 셀을 더 넣어 전력과 배선 압력을 높일 수 있습니다. 레시피의 의미는 적용 시점의 설계 상태와 함께 정해집니다.
엔지니어도 같은 방법으로 판단합니다. 이용률, 임계 경로 구성, 밀도, 팬아웃, 버퍼, 홀드 압력, 혼잡, 클록 동작을 확인한 뒤 흐름을 바꿉니다. 이전 가능한 시스템은 최종 PPA뿐 아니라 이런 조건을 표현해야 합니다. 그렇지 않으면 어떤 설정이 통했는지만 외우고 어떤 문제를 해결했는지는 학습하지 못합니다.
일반적인 하이퍼파라미터 탐색과 레시피 학습의 차이가 여기에 있습니다. 전자는 좋은 점을 찾습니다. 후자는 설계 근거와 순서가 있는 동작을 연결해 다음에도 사용할 수 있게 만듭니다.

절대값 대신 상대 순위를 학습하는 InsightAlign
서로 다른 설계와 공정, 흐름 단계에서 정확한 PPA 값을 한 모델로 예측하기는 어렵습니다. 같은 1 ns 오차도 클록과 타이밍 분포가 다른 블록에서는 의미가 다릅니다. InsightAlign은 하나의 절대 예측기를 요구하지 않습니다. 레시피 추천을 순위 문제로 바꾸고 언어 모델 정렬에 쓰이는 방법을 적용해 한 레시피가 다른 레시피보다 나은지를 학습합니다[1].
입력에는 혼잡, 밀도, 타이밍, 전력 동작 등 흐름의 상태를 나타내는 설계 인사이트가 포함됩니다. 오프라인 실행에서 더 좋은 레시피와 나쁜 레시피의 쌍을 만들고, 선호 학습 방식으로 설계 상태와 목표 절충에 맞는 순서를 학습합니다.
평가는 45 nm부터 10 nm 미만 공정까지 산업 설계 17개를 사용하고 학습하지 않은 설계의 제로샷 추천을 중심으로 합니다[1]. 제품 주장을 확인하는 데 맞는 평가입니다. 학습에 있던 블록만 개선하면 과거 실행 검색에 가깝습니다. 제로샷 평가는 설계 상태 표현이 새로운 사례를 안내할 만큼 일반화됐는지를 봅니다.
순위 방식은 엔지니어가 추천을 사용하는 방법과도 맞습니다. 최종 슬랙과 전력을 완벽하게 예측할 필요는 없습니다. 비용이 큰 실제 실행을 제한된 횟수만 수행할 수 있도록 유망한 레시피를 앞에 놓으면 됩니다. 따라서 운영 지표는 예측 오차뿐 아니라 상위 k개 안의 성공률, 목표에 도달한 실행 횟수, 실패 확률을 포함해야 합니다.
학습된 평가기로 보상 비용을 줄인 FastTuner
강화학습은 설정을 순서대로 고르는 문제와 잘 맞습니다. 배치 단계의 선택은 클록과 라우팅 단계에서 어떤 선택이 유용한지를 바꿉니다. 최종 PPA는 모든 선택이 끝난 뒤에 보상으로 나타납니다. 단순하게 구현하면 한 경로마다 전체 물리 설계를 실행해야 하므로 비용이 너무 큽니다.
FastTuner는 평가기 학습과 정책 사용을 나눕니다[2]. 그래프 신경망으로 설계 특징을 인코딩하고 Transformer 디코더가 이전 선택을 고려해 설정값을 순서대로 고릅니다. 오프라인에서 학습한 PPA 평가기가 빠르게 보상을 주므로 모든 후보마다 전체 배치배선을 실행하지 않아도 됩니다.
ACM의 정식 저널판은 TSMC 28 nm 산업 설계 일곱 개와 여러 최적화 목표를 평가합니다. 비교한 설계 공간 탐색 방식보다 총 음의 슬랙을 최대 79.38%, 총 전력을 최대 12.22% 개선했고 실행 시간을 50배 넘게 줄였다고 보고했습니다[2]. 설계 인코딩과 학습된 보상이 새로운 설계의 초기 탐색과 평가 비용을 함께 줄일 수 있음을 보여 줍니다.
PPA 평가기는 가장 큰 위험이기도 합니다. 학습하지 않은 영역의 순위를 잘못 예측하면 정책은 실제 설계가 아니라 대리 모델의 빈틈을 최적화할 수 있습니다. 정기적인 전체 흐름 확인, 불확실성 추정, 검증 범위를 벗어나면 상용 기준 도구로 탐색을 되돌리는 규칙이 필요합니다.

후보 수와 평가 비용이라는 서로 다른 문제
InsightAlign은 실제로 시험해야 할 레시피 수를 줄입니다. FastTuner는 정책을 탐색할 때 각 경로의 평가 비용을 줄입니다. 개념적으로 결합할 수 있지만 같은 이점은 아닙니다.
과거 실행과 전문가 진단은 많지만 모든 설계의 절대 PPA를 한 모델로 예측하기 어렵다면 순위 모델이 적합합니다. 새 설계 상태에 따라 소수 후보를 추천하고 기존 흐름이 최종 결과를 확인할 수 있습니다. 설정 사이의 순서 관계가 강하고 충분히 넓은 데이터로 신뢰할 수 있는 평가기를 만들 수 있다면 강화학습 방식이 유리합니다.
필요한 데이터도 다릅니다. 선호 학습에는 어떤 목표에서 어느 결과가 나은지를 일관되게 표시한 쌍이 필요합니다. 보상 모델에는 정책이 탐색할 범위의 설계 특징과 정확한 최종 결과가 필요합니다. 두 경우 모두 도구 버전, 라이브러리, 공정, 제약, 시작점, 실행 상태의 출처를 정리해야 합니다.
전략 자산으로 바뀌는 도구 실행 이력
EDA 조직은 이미 많은 실행 기록을 만들지만 이전 학습에 맞게 정리되지 않은 경우가 많습니다. 실패한 작업은 버리고, 설정 변경 이유는 엔지니어의 스크립트에만 남으며, 프로젝트마다 목표와 단계 이름이 다릅니다. 어떤 동작이 어떤 상태를 해결했는지 학습하기 어렵습니다.
유용한 데이터에는 네 층이 필요합니다. 설계 층은 구조와 물리 특징을 담습니다. 레시피 층은 단계별 설정의 순서를 기록합니다. 결과 층은 타이밍, 전력, 면적, 혼잡, 설계 규칙 위반, 실행 시간, 실패 상태를 저장합니다. 판단 층은 관측과 결정을 연결하며 전문가 진단이나 자동으로 계산한 상태 지표가 들어갑니다.
실패 기록도 남겨야 합니다. 안전하지 않은 영역을 정의하고, PPA가 좋아 보여도 흐름이 중단되거나 하드 제약을 어기면 사용할 수 없다는 것을 학습시킵니다. 시간 초과, 수렴 실패, 라우팅 폭증, 사인오프 불일치는 다른 실패 유형이므로 하나의 패널티로 합치지 않는 편이 좋습니다.
측정해야 하는 이전 범위
한 공정 안의 블록 사이 이전은 공정, 라이브러리, 도구 버전을 모두 바꾸는 것보다 쉽습니다. 28 nm에서 혼잡을 나타내는 특징이 10 nm 미만 공정의 핀 접근과 같은 관계를 가지지 않을 수 있습니다. 옵션 이름이 같아도 도구 버전에서 구현이 바뀔 수 있습니다.
시스템은 이전 거리를 보고해야 합니다. 공정, 라이브러리 계열, 설계 크기, 계층, 매크로 비율, 이용률, 클록 수, 활동량이 주요 축입니다. 새 설계가 학습 범위에서 멀어질수록 불확실성을 높여야 합니다. 엔지니어는 제로샷 후보를 그대로 시험할지, 온라인 조정을 허용할지, 보호된 탐색을 새로 시작할지 판단할 수 있습니다.
온라인 학습에는 격리도 필요합니다. 한 프로젝트의 잘못된 실행이 곧바로 전체 정책을 바꾸면 안 됩니다. 프로젝트 전용 층에서 후보 업데이트를 평가하고 반복해서 근거가 확인된 뒤 전역 정책으로 승격해야 합니다. 소프트웨어 배포와 마찬가지로 국소 실험, 제한된 검증, 버전 관리가 필요합니다.
제품 판단으로 남겨둘 목표
PPA는 하나의 목표가 아닙니다. 타이밍 마감은 하드 제약이고, 전력이 제품 한계이며, 면적은 고정 가중치가 아니라 비용 곡선을 가질 수 있습니다. 합친 점수로 학습한 추천기는 사용하면 안 되는 자원을 조용히 소비할 수 있습니다.
순위 모델과 강화학습 모두 명시적인 품질 목표를 입력받아야 합니다. 추천 결과에는 예상 절충 벡터와 순위 근거가 함께 있어야 합니다. 총 음의 슬랙을 줄이는 대신 누설 전력이 늘었는지, 실행 시간을 줄인 이유가 탐색 범위를 좁혔기 때문인지 확인할 수 있습니다.
불법 또는 수렴하지 않는 레시피는 큰 패널티로 다른 이득과 교환하기보다 가능한 집합에서 제외하는 편이 안전합니다. 하드 제약을 먼저 적용하고 남은 후보를 제품 우선순위로 정렬해야 한 지표의 큰 이득이 사용할 수 없는 결과를 보상하지 않습니다.
모델보다 넓은 학습 서비스
레시피 이전은 모델 파일 하나를 프로젝트마다 전달하는 방식으로 운영하기 어렵습니다. 실행 기록을 받아 메타데이터를 정규화하고, 분포 이동을 측정하고, 후보를 제안하고, 실험을 실행하며, 검증된 결과를 다시 기록하는 서비스가 필요합니다. 모델은 이 과정의 한 구성 요소입니다.
재현성을 위해 레시피와 실행 환경을 함께 버전으로 관리해야 합니다. 추천에는 정확한 도구 빌드, 라이브러리, 제약, 시드, 시작 데이터베이스가 연결되어야 합니다. 거부된 후보도 남겨두면 도구 버전이 바뀐 뒤 다시 평가할 수 있습니다.
물리 설계 데이터는 제품 구조와 공정 가정을 드러내므로 보안과 기밀성도 중요합니다. 실행 기록을 중앙화하기 전에 학습 경계, 접근 권한, 보존 정책을 정해야 합니다. 이전 가능한 모델의 가치가 누적된 독점 경험을 담는 데 있기 때문입니다.
도입 순서와 장기 가치
첫 번째 질문은 일관된 실행 이력이 충분한지입니다. 없다면 강화학습 알고리즘을 고르는 일보다 로그와 목표를 표준화하는 일이 먼저입니다. 두 번째 질문은 대상 설계들이 의미 있는 분포를 공유하는지입니다. 서로 관련 없는 공정과 방법론 사이의 이전을 가정할 수 없습니다.
성숙한 흐름은 단계적으로 도입할 수 있습니다. 오프라인 순위 모델로 소수 후보를 제안하고 최종 평가는 기존 도구에 맡깁니다. 예측 오차와 불확실성이 충분히 알려진 범위에서만 설계 인지형 보상 모델을 추가합니다. 온라인 정책 조정은 엄격한 전체 흐름 검증 뒤에서 허용합니다.
경쟁력은 한 벤치마크에서 이긴 설정값에 있지 않습니다. 새 블록의 상태를 읽고 관련 있는 과거 조건을 찾으며, 적은 수의 비싼 실행으로 검증된 레시피에 도달하는 능력이 중요합니다. 이 지식은 테이프아웃이 늘수록 축적되므로 고립된 최적화 스크립트보다 오래 남는 EDA 자산이 됩니다.
출처와 저작권 안내
이 글은 인용한 두 논문과 공식 공개 기록을 바탕으로 Silicon & Systems가 독립적으로 작성한 편집 분석입니다. 기술 내용과 수치는 우리 표현으로 다시 설명했으며 원문의 문장, 표, 학습 구성 또는 도판을 복제하지 않았습니다. 두 도판은 이 글을 위해 새로 만들었습니다. 인용 논문의 저작권은 IEEE, ACM, 각 저자와 소속 기관에 있습니다.