ChatGPT 이후 GPU 부족부터 CPU, 메모리, 스토리지까지 이어지는 AI 인프라 병목 현상과 데이터센터 건설 비용 급등의 실체를 분석합니다.
AI 인프라 병목 현상: GPU에서 스토리지까지의 연쇄 위기
핵심 요약
- 순차적 병목 현상: GPU 부족 → 메모리 공급 마비 → CPU 가격 급등 → 스토리지 수급 악화로 이어지는 릴레이 구조
- 2023년 GPU 충격: ChatGPT 출시 후 온디맨드 H100 렌탈 요금이 시간당 9달러를 넘어섰고, 서버 출하량은 22% 감소
- 메모리 위기: HBM 생산으로 전환하면서 DRAM 가격 60% 초반대, 엔터프라이즈 SSD 가격 80% 상승
- CPU와 스토리지 압박: 에이전트 워크플로우로 CPU 수요 급증(27% 가격 상승), 고가 플래시 스토리지로 HDD 회귀
- 데이터센터 건설 비용: 기가와트당 200억 달러 이상, 변압기 리드 타임 3년까지 증가
AI 인프라의 릴레이 경주: 순차적 병목 현상
AI 인프라 부족은 하나의 위기가 아닙니다. GPU가 부족했고, 메모리가 처리량을 막았으며, CPU가 부담을 떠안았고, 스토리지가 문제를 일으키기 시작했습니다. 가격 데이터는 이러한 릴레이가 실제로 존재하되, 느리게 진행된다는 점 을 보여줍니다.
각 병목 현상이 다음 구성 요소의 공급망을 마비시키지만, 그 지연은 수년에 걸쳐 발생합니다. 가장 중요한 점은 각 파동이 더 높은 기본 비용을 고착화 시킨다는 것입니다. 이는 단순한 일시적 공급 부족이 아니라, 시스템 전체의 가격 구조를 영구적으로 상승시키는 구조입니다.
2023년 GPU 위기: ChatGPT의 수요 충격
2023년 초, 부족의 화살은 GPU 를 향했습니다. ChatGPT가 출시되자 구매자들은 GPU 조달에 자본을 집중했습니다. 온디맨드 Nvidia H100 렌탈 요금이 시간당 9달러를 넘어섰습니다.
이 단일 목표 집착은 기존 컴퓨팅 시장을 거의 마비시켰습니다. 2023년 서버 출하량은 전년 대비 22% 감소 하여 1,100만 대 미만으로 떨어졌고, 이는 2018년 수준보다도 5% 낮은 수치 입니다. 구매자들이 교체 주기를 연기하며 GPU 자금 조달에 집중했기 때문입니다.
팬데믹 이후 200억 달러 이상의 손실을 입혔던 메모리 제조업체들은 더욱 치명적인 타격을 입었습니다. 기존에 과잉 공급으로 휘청거리던 상황에서, 서버 수요의 급락은 재고 소진의 기회를 빼앗았습니다.
18개월 후, 메모리 위기로의 전환
GPU 부족에서 벗어나자 압력은 메모리로 옮겨갔습니다. 제조업체들은 AI 마진을 쫓기 위해 생산 설비를 고대역폭 메모리(HBM) 생산으로 전환했습니다.
이 전환의 파급력은 상상 이상입니다. HBM은 표준 DDR5 기가바이트당 약 3배의 웨이퍼 용량을 소비합니다. 즉, HBM 생산량 1비트당 약 3비트의 기존 DRAM 공급량이 사라집니다.
결과는 급격했습니다:
- 엔터프라이즈 SSD 계약 가격: 한 분기 만에 80% 상승
- DRAM 가격: 마이크론 기준으로 60% 초반대 범위 상승
메모리 시장은 단순히 수급이 맞지 않는 것이 아니라, 생산 구조 자체가 AI에 최적화되면서 기존 인프라 수요가 완전히 외면받게 된 것입니다.
2025년: 에이전트 워크플로우가 CPU를 압박하다
2025년 말, AI 인프라의 병목은 다시 이동했습니다. 이번에는 서버 CPU 가 압박받기 시작했습니다.
GPU와 CPU의 비율 변화는 근본적입니다:
- 기존 훈련 클러스터: CPU 1개당 GPU 8개
- 에이전트 워크플로우: CPU 1개당 GPU 1개
자율 시스템은 코드 컴파일, 도구 호출, 상태 관리에 CPU 사이클을 대량으로 소비하기 때문입니다. 이는 단순한 수요 증가가 아니라 아키텍처 패러다임의 변화 를 의미합니다.
인텔의 반응은 가격 지수에 명확히 드러났습니다:
- 서버 CPU 평균 판매 가격(ASP): 전년 대비 27% 상승 (단위 판매량이 감소했음에도 불구하고)
- 미충족 Xeon 수요: 수십억 달러에 달함
2026년: 스토리지 공급 마진의 붕괴
2026년이 되자, 부족 현상은 대용량 스토리지 에까지 미쳤습니다.
고속 플래시 스토리지의 가격이 테라바이트당 150달러에 달하자, 클라우드 설계자들은 대규모 훈련 데이터 레이크를 위해 기술 사다리를 내려와 전통적인 하드 디스크 드라이브(HDD)로 회귀 했습니다.
이는 AI 인프라 설계자들이 더 이상 최신 기술을 선택할 여유가 없다는 뜻입니다. Western Digital과 Seagate의 2026년 니어라인 생산량은 전부 매진되었습니다.
데이터센터 건설 비용 폭증: 인프라의 새로운 병목
서버 섀시를 넘어, 진정한 병목은 데이터센터 건설 자체 입니다.
비용 급등의 규모는 놀랍습니다:
- 전체 건설 비용: 기가와트당 200억 달러 이상
- 전기 시스템 비중: 건설 예산의 절반
- 평방 피트당 건설 비용: 1,033달러로 세 배 급증
더욱 심각한 것은 공급 체인의 거대한 지연 입니다. 발전기 승압 변압기의 평균 리드 타임이 거의 3년에 달합니다. GE Vernova와 Siemens Energy는 2029년까지의 터빈 생산량을 모두 판매했고, 주문 장부는 2031년까지 이어지고 있습니다.
채찍 효과: 장기 리드 타임이 만드는 과잉 투자
Siemens의 배리 파월은 이 상황을 명확히 진단했습니다:
"하든 안 하든 망하는 상황입니다. 충분히 짓지 않으면 시장 점유율을 잃어 손해를 볼 것이고, 너무 많이 지으면 고정 비용 때문에 손해를 볼 것입니다."
이는 물리적 하드웨어에서의 채찍 효과(Bullwhip Effect) 입니다. 가치 사슬이 수년간의 제조 지연을 겪을 때, 하류의 갑작스러운 수요 충격은 상류에서 거대하고 지연된 과잉 반응으로 증폭됩니다.
한 병목 현상에서 압력을 완화하면, 예측 가능한 지연과 함께 다음 구성 요소로 밀려납니다. 마침내 파도가 부서질 때, 긴 리드 타임을 가진 자본재들이 과잉 생산에 노출된 채 남겨집니다.
2027~2028년 공급 예정:
- 20억 달러 이상의 국내 변압기 확장
- 차세대 300단 NAND 팹
- 새로운 터빈 생산 라인
최종 사용자 소프트웨어 수익이 기가와트당 200억 달러 규모의 시설 투자 속도를 따라가지 못한다면, 자본 지출은 전형적인 채찍 효과의 타격을 맞게 될 것입니다.
결론
AI 인프라 부족은 단순한 수급 문제가 아닙니다. 이는 연쇄적인 병목 현상 이 수년에 걸쳐 시스템 전체의 가격 기반을 영구적으로 상승시키는 구조입니다. GPU에서 시작된 충격이 메모리, CPU, 스토리지를 거쳐 데이터센터 건설 자체까지 밀려오고 있으며, 3년 리드 타임의 자본재 투자는 AI 수요의 실제 궤적과 맞지 않을 위험이 커지고 있습니다.
Original source: The AI Bullwhip
powered by osmu.app