AI 인프라
07-13[ai-infra]데이터센터 전체가 런타임이 되었습니다: 산업계 논문 9편으로 읽는 AI 인프라29m07-13[ai-infra]GPU 15만 장이 있어도 쓸 수 없는 이유18m07-13[ai-infra]조용히 틀린 GPU를 찾는 세 단계: 검출, 장비 격리, 연산 추적18m07-13[ai-infra]에이전트 워크플로 전체를 스케줄링하는 클라우드: Murakkab19m07-13[ai-infra]모든 요청을 기록하지 않고도 느린 한 요청을 설명하는 법18m07-13[ai-infra]같은 층 수로는 맞지 않는다: Qwen 1조 매개변수 학습의 파이프라인 재설계18m07-13[ai-infra]전체 재시작 없이 GPU 한 장을 교체하는 TrainMover18m07-13[ai-infra]롤아웃과 학습 사이의 빈 시간을 회수하는 Weave19m06-27[ai-infra]20년 뒤 날씨를 모르면 냉각 용량도 틀린다23m05-23[ai-infra]150 MW 전력 한도에서 GPU 8만3천 장을 운영하는 법28m05-19[ai-infra]추론 연산량보다 먼저 메모리 용량 한계에 닿는 추론형 모델17m05-18[ai-infra]수백만 개 구성에서 SLO를 지키는 하나를 찾는 법19m05-04[ai-infra]호출이 빨라도 늦게 끝나는 AI 에이전트, Agentix의 프로그램 단위 스케줄링18m05-04[ai-infra]부하를 고르게 나눠도 느려지는 스토리지, Alibaba의 버스트 제어와 I/O 스케줄링18m05-04[ai-infra]특화 모델이 같은 문맥을 다시 읽는 비용, DroidSpeak의 모델 간 KV 캐시 재사용17m05-04[ai-infra]GPU는 바쁜데 학습은 느릴 때, 실행 단계에서 원인을 찾는 EROICA13m05-04[ai-infra]추론은 지연시간을 지키고 미세조정은 빈 구간을 쓰는 FlexLLM14m04-26[ai-infra]한 배치의 서로 다른 기한, 요청별 추측 트리를 만드는 AdaServe13m04-26[ai-infra]값은 그대로, PCIe 전송량만 줄이는 IBP 무손실 압축13m04-22[ai-infra]TPU 한 세대에 네트워크 두 개: 학습과 추론을 나눈 이유22m03-22[ai-infra]같은 H100, 다른 클라우드 성능20m02-24[ai-infra]AI 스토리지가 작업 의도를 읽는 법: AITURBO의 그룹 I/O19m
# 2025
12-29[ai-infra]커널 최적화에 탐색 트리와 기억을 붙인 Meta의 에이전트16m12-16[ai-infra]네오클라우드의 숫자는 무엇을 증명하는가22m10-13[ai-infra]GPU 한 장에서 모델 일곱 개를 서빙한 Aegaeon18m10-13[ai-infra]GPU 9,600장의 장기 학습을 지킨 ByteRobust19m10-12[ai-infra]원격 HBM을 컴파일러가 관리하는 메모리 계층으로20m10-12[ai-infra]통신 장벽을 없앤 Mercury, 원격 HBM까지 컴파일하는 방법14m08-27[ai-infra]호스트·PCIe·패브릭을 함께 바꾼 Alibaba Stellar17m08-04[ai-infra]수천 개 GPU가 스토리지를 기다릴 때, MLPerf 스토리지 2.0 읽는 법18m07-07[ai-infra]모델 적재가 끝나기 전부터 GPU를 활용하는 BlitzScale20m07-07[ai-infra]멈추지 않은 GPU 하나가 대규모 학습을 늦출 때20m07-07[ai-infra]GPU 커널 내부의 대기 원인을 찾는 KPerfIR18m07-07[ai-infra]PCIe GPU 서버에서 효과가 커지는 탄력적 텐서14m07-07[ai-infra]추론이 오면 5ms 안에 메모리를 돌려 주는 SIRIUS16m07-07[ai-infra]요청이 올 때만 GPU를 쓰는 서버리스 추론19m07-07[ai-infra]GPU처럼 다루면 느려지는 백만 코어, 웨이퍼 메쉬에 맞춘 WaferLLM15m06-21[ai-infra]제한된 NVLink에서 학습한 DeepSeek V3의 하드웨어 요구20m06-21[ai-infra]Llama 3 학습에 네 가지 병렬화가 동시에 필요했던 이유16m05-12[ai-infra]긴 문맥에서 비는 마지막 GPU 웨이브, LeanAttention의 디코드 재배치15m04-28[ai-infra]GPU 구성이 달라져도 다시 읽는 체크포인트, 논리 텐서를 저장하는 ByteCheckpoint14m04-10[ai-infra]세계 전력 3%보다 중요한 숫자, AI 데이터센터가 몰리는 곳18m03-30[ai-infra]학습이 보낸 그래디언트로 체크포인트를 갱신하는 FlowCheck14m03-30[ai-infra]위에는 컨트롤러 하나, 아래에는 여럿: verl의 설계도 HybridFlow19m03-30[ai-infra]가상머신 안에서도 GPU 통신 경로를 짧게 유지한 Vela의 1,500 GPU 운영14m03-01[ai-infra]집합 통신으로 학습 클러스터의 장애까지 진단하다17m03-01[ai-infra]GPU 학습 장애를 대형 작업만으로 설명할 수 없는 이유17m03-01[ai-infra]마이크로와트에서 메가와트까지 통하는 AI 전력 측정법17m02-25[ai-infra]DRAM과 SSD로 KV 캐시를 확장한 Mooncake18m