오스틴 라이언스 칩스트래트 대표: 엔비디아의 랙 단위 해자는 실존하며, 순환 출자 우려는 과장되었고, 아직 LLM 전용 칩은 세상에 없다
테크 서지 팟캐스트, 2026년 9월 22일 — 크리에이티브 스트래티지스의 반도체 애널리스트가 진단하는 시스템 판매 시대와 차세대 1조 달러 반도체 기업의 탄생 후보지
크리에이티브 스트래티지스(Creative Strategies)의 반도체 애널리스트이자 '칩스트래트(Chipstrat)' 뉴스레터를 집필하는 오스틴 라이언스(Austin Lyons)가 '테크 서지(Tech Surge)' 팟캐스트에 출연해 AI 인프라 투자 업계의 통념을 정면으로 반박하는 통찰을 내놓았습니다. 업계가 점차 범용화(commoditization) 단계로 접어들고 있다는 시각과 달리, 라이언스는 구매자들이 개별 칩이 아닌 '시스템 전체'를 구매하는 방향으로 완전히 선회했다고 진단했습니다. 이러한 변화는 표면 아래에서 투자자들이 미처 예의주시하지 못하는 방식으로 지형이 쪼개지는 상황 속에서도 엔비디아의 경쟁 우위를 더욱 공고히 만들었습니다.
LLM만을 위해 특화 설계된 칩은 아직 없다
이번 대담에서 가장 눈에 띄는 주장이자 가장 단순한 진실은 바로 이것입니다. AI 인프라에 수조 달러의 막대한 자금이 쏟아지고 있음에도 불구하고, 대규모 언어 모델(LLM) 추론을 위해 백지상태에서부터 전용으로 설계된 실리콘 벤더는 아직 단 한 곳도 없다는 점입니다. 엔비디아의 GPU에 대해 라이언스는 "그래픽 분야에 뿌리를 두고 병렬 처리 능력을 발전시키면서 AI 중심 체제로 전환해 온 역사"를 지니고 있지만, 그 아키텍처는 여전히 이전 세대의 유전자를 이어받은 범용 제품에 가깝지 순수 LLM 엔진은 아니라고 설명했습니다. AMD의 헬리오스(Helios) 랙이나 엔비디아의 GPU+LPU 결합 제품 역시 그가 표현한 대로 "해당 워크로드에 맞춰 변형된(morphed)" 칩일 뿐, 애초부터 그 목적을 위해 구상된 칩은 아니라는 것입니다.
바로 이 공백지대에서 그는 신생 도전자들에게 기회가 있다고 보고 있습니다. 핫 칩스(Hot Chips)에서 공개된 오프엔(OpenAI)의 신규 잘라피뇨(Jalapeno) 칩이 대표적인 사례입니다. 시스템 전반에 걸쳐 공유 KV 캐시를 주고받는 방식 대신, 설계 단계부터 각 가속기에 자체 HBM 슬라이스를 부여함으로써 기성 실리콘의 고질적인 문제인 메모리 병목 현상을 원천 차단했습니다. 행렬 곱셈 대신 로그 연산(log math)을 채택해 곱셈을 실리콘 상에서 더 빠르게 구동되는 덧셈으로 전환한 텐서다인(Tensor dyne)의 접근법 역시 기존 벤더들이 감수하려 하지 않는 아키텍처적 승부수의 또 다른 예입니다. 라이언스가 그 이유를 설명하는 것은 간단합니다. 기존 선두 업체들은 가장 넓은 고객층을 타깃으로 최적화하며, 첫 세대 제품에 급진적인 트레이드오프를 시도했다가 커리어에 타격을 입을 리스크를 꺼리기 때문입니다. 검증되지 않은 아키텍처에 위험을 감수하기보다는, 안전하고 점진적인 설계를 채택해도 여전히 제품이 잘 팔리는 상황에서 상용 벤더들이 "굳이 리스크를 감내할 유인이 없을 것"이라고 그는 지적했습니다.
엔비디아의 랙 단위 우위가 쉽게 흔들리지 않는 이유
라이언스는 시스템 판매 중심의 전환이 단순한 기술적 현실에 기인한다고 분석했습니다. 2조 개 이상의 파라미터(매개변수)를 가진 프론티어 모델은 단일 GPU의 메모리 용량에 담을 수 없기 때문에, 불가피하게 수십 개의 칩에 워크로드를 쪼개어 담고 이들이 완벽하게 실시간으로 소통하도록 만들어야 합니다. 엔비디아의 우위는 이러한 복잡성을 선제적으로 턴키(turnkey) 솔루션으로 구현해 낸 데서 비롯되었습니다. GPU, CPU, 네트워킹, 전력, 쿨링(냉각)을 그레이스 블랙웰 NVL72(Grace Blackwell NVL72) 같은 랙 제품군으로 묶어내고, 시스템 전체를 조율하는 다이나모(Dynamo) 같은 소프트웨어까지 패키지로 제공한 것입니다. 그는 "엔비디아는 솔직히 이 복잡한 시스템을 시장에 가장 먼저 선보이고 턴키화하는 데 훌륭한 성과를 거두었다"며, 오늘날 구매자들은 최저 비용보다 시장 출시 속도(time to market)를 최우선으로 최적화하고 있다고 짚었습니다. 일론 머스크가 xAI를 통해 데이터센터를 초고속으로 구축해 나간 사례가 이를 보여주는 가장 명확한 증거입니다.
이러한 역학 관계 때문에 칩 스타트업들이 실효성 있는 개념 증명(PoC) 단계에 도달하는 데만 과거 수백만 달러 규모를 넘어 이제는 수억 달러의 자금이 필요하게 되었다고 라이언스는 강조했습니다. 독자 노선을 걷는 데 따르는 비용을 보여주는 대표적 사례가 바로 세레바스(Cerebras)입니다. 이 회사의 웨이퍼 스케일 엔진은 새로운 칩 설계뿐만 아니라 통신, 냉각, 전력 공급을 아우르는 전체 지원 스택까지 독자 발명해야 했고, 이로 인해 시장 출시 시기가 상당히 지연되는 부담을 안았습니다.
프리필-디코드 분리와 특화 실리콘의 부상
라이언스는 추론 워크로드가 프리필(prefill)과 디코드(decode) 단계로 쪼개지고 있는 이유를 시장에서 손꼽히게 명쾌한 기술적 언어로 설명했습니다. 전체 프롬프트를 읽고 문맥을 파악하는 병렬 처리 과정인 프리필은 연산 집약적이면서도 메모리는 적게 소모하여, 고가의 HBM 자원이 충분히 활용되지 못하는 한계를 지닙니다. 반면 토큰을 하나씩 순차적으로 생성해 내는 디코드는 그 정반대로 메모리 바운드(memory-bound) 성향을 띠며 연산은 적게 듭니다. 엔비디아 스스로의 다이나모 소프트웨어가 맨 먼저 다룬 이러한 미스매치는, LLM과 무관한 이유로 일찍이 SRAM 중심 아키텍처에 베팅했다가 디코드 중심 수요가 폭발하자마자 최적의 위치를 선점하게 된 그록(Groq)이나 세레바스 같은 가속기 스타트업들에게 문을 열어주었습니다.
라이언스는 이러한 파편화 현상이 향후 다수의 벤더가 얽힌 패치워크 상태로 남기보다는, 궁극적으로 단일 실리콘 벤더들 내부로 통합될 것으로 내다봤습니다. 과거 산업이 소수의 지배적인 CPU 및 GPU 공급사 체제로 수렴했던 것과 비슷한 이치입니다. 엔비디아의 그록 인수는 그 초기 신호탄입니다. 그렇다고 해서 그는 신규 진입자들이 동일한 분리(disaggregation) 현상을 역이용해 틈새를 파고들 가능성을 배제하지 않았으며, 잠재적으로는 네오클라우드들이 AI ASIC 스타트업들을 흡수하여 워크로드 맞춤형 실리콘을 서비스 형태로 제공하는 양상도 충분히 가능하다고 보았습니다.
순환 출자 우려: 과장되었으나 혼란스러운 것은 당연하다
엔비디아가 네오클라우드에 지분 투자를 하고, 네오클라우드가 그 돈으로 엔비디아의 GPU를 사들이며, 그 매출이 다시 엔비디아로 흘러들어간다는 소위 '순환 출자' 우려에 대해 직접 질문을 받자, 라이언스는 자신 역시 처음에는 회의적인 시각을 가졌음을 솔직히 인정했습니다. "저 역시 처음에는 '이건 좀 색다른데, 뭔가 낌새가 이상한데'라고 생각했던 사람이 맞습니다." 그러나 사안을 깊이 파고든 후 그의 결론은, 이 구조가 인위적인 수요 창출이라기보다는 실질적인 자본비용(cost of capital) 병목 현상을 반영한 결과라는 점으로 귀결되었습니다. 컴퓨팅 수요는 진실이며, 에이전틱 코딩 툴의 등장으로 소프트웨어 개발 비용이 폭락한 점을 감안하면 지금 시점에서도 오히려 수요가 과소평가되어 있다는 것이 그의 판단입니다. 진정한 제약 요인은 수십억 달러 규모의 데이터센터 구축을 자금 조달할 수 있는 재무제표를 지닌 주체가 누구인가 하는 점입니다. 은행들은 여전히 신생 네오클라우드 운영사들에 대한 직접 대출을 꺼리고 있으며, 이에 따라 하이퍼스케러의 오프테이크(offtake) 계약과 엔비디아의 신용 보강이 자금 조달의 빗장을 여는 역할을 하고 있습니다. 라이언스는 직설적으로 잘라 말했습니다. "이것이 자본주의입니다. 이득이 없다면 그들이 움직일 리가 없습니다." 엔비디아가 이 구조를 통해 이익을 얻는다는 사실 자체를 그는 부정하지 않으나, 그 메커니즘이 닷컴 버블 시대의 벤더 파이낸싱 거품과 유사하다는 시각에는 선을 그었습니다.
전통적 투자자들이 과소평가하고 있는 네오클라우드
라이언스는 상위 3대 네오클라우드가 창출한 공개 주식 시장 가치가 약 1,250억 달러에 달하며, 이는 대다수 칩 스타트업들을 합친 것보다 큼에도 불구하고 투자자들이 이 기회를 대거 놓쳤다고 지적했습니다. 그 자신의 초기 망설임 역시 하이퍼스케러 고객 집중도로 인해 이들 비즈니스가 취약할 것이라는 가정에서 비롯되었습니다. 돌이켜보면 그러한 회의론은 번지수가 틀렸다고 그는 평가합니다. 고객 집중도는 엔비디아 자신을 포함해 반도체 공급망 전반에 걸쳐 내재된 특성이기 때문입니다. 하이퍼스케러들이 이 가치를 직접 포착해 내지 못한 배경에 대해 그는 자본 규율, 혁신가의 딜레마, 마진 민감성이 복합적으로 작용한 결과라고 분석했습니다. 일부 클라우드 제공업체들은 저마진의 베어메탈 GPU 임대 사업을 우선순위에서 밀어내야 할 범용화된 비즈니스로 여기는 반면, 네오클라우드들은 동일한 매출을 자사 모델의 핵심으로 취급한다는 것입니다.
차세대 1조 달러 반도체 기업을 위한 4가지 조건
다음 주도주가 될 실리콘 기업을 식별하기 위한 라이언스의 프레임워크는 네 가지 기준으로 요약됩니다. 1조 개 이상의 파라미터 모델 구동 능력, 랙 단위 시스템 공급 역량, 특정 성능 지표에서 기존 선두 주자를 압도하는 경쟁력, 그리고 프론티어 모델 연구소를 앵커 고객으로 확보하는 것입니다. 그중에서도 프론티어 고객의 확보가 가장 중요하다고 그는 강조합니다. "막대한 부가가치가 바로 그곳에 집중되기 때문"입니다. 최전선에서 모델을 구축하는 개발자들은 의미 있게 빠른 토큰 생성 속도를 위해서라면 상당한 프리미엄을 지불할 용의가 있으며, 월 수천 달러의 비용도 감수할 수 있는 반면, 작고 오래된 모델을 사용하는 워크로드는 훨씬 더 치열한 가격 경쟁과 범용화된 공급난에 직면하게 된다는 설명입니다.
여기에 더해, 추적해야 할 핵심 성과지표(KPI)는 단순한 원시 속도가 아니라 전력 소모량을 정규화한 상태에서의 '고정 상호작용성(fixed interactivity) 기준 토큰 처리량'이라고 그는 덧붙였습니다. 네오클라우드들이 자본뿐만 아니라 메가와트(MW) 단위의 전력 제약에 묶여 있는 상황에서, 계산의 핵심은 고정된 전력 할당량 안에서 얼마나 많은 수익 창출형 처리량을 뽑아낼 수 있는가로 귀결되며, 이는 범용적 유연성보다는 상호작용 곡선의 특정 지점에 최적화된 칩에 유리하게 작용합니다.
기업용 AI 도입의 병목은 인프라가 아니라 인재다
인터넷 시대의 대다수 워크로드가 결국 클라우드 외부에서 구동되었던 패턴을 반영하여, 기업용 온프레미스 배치가 장기적으로 더 큰 시장을 형성할 것인지 묻는 질문에 라이언스는 기업용 도입 규모가 상당할 것임에는 동의하면서도, 인프라 가용성과는 다른 차원의 제약 요소를 강조했습니다. 기업들은 방어력 있는 AI 기반 차별점을 구축하기 위해 자체 데이터와 파인튜닝(미세조정) 과정을 사내에 두고 싶어 하지만, 현재로서는 모델을 내부적으로 파인튜닝하는 데 필요한 인재를 보유한 기업이 드물다는 것입니다. 그는 현재의 국면을 기업용 소프트웨어 도입 초기 시절, 도메인 전문가들에게 사내 엔지니어링 인력이 부족했던 시기에 비유하며 유사한 인재 육성 사이클이 전개될 것이라고 예측했습니다. 다만, 인터뷰어의 지적에 따라 더 즉각적인 병목은 기업들이 별도의 전문 머신러닝 인력을 채용하지 않고도 생성형 AI를 배치할 수 있도록 돕는 툴링의 부재일 수 있음을 시도했습니다.
AI 보조 칩 설계가 커스텀 실리콘의 진입 장벽을 낮춘다
라이언스는 AI 가속 칩 설계 툴이 커스텀 실리콘의 비용과 개발 타임라인을 모두 획기적으로 압축하고 있다고 봅니다. 3년 걸리던 개발 주기를 1년으로 단축하고, BOM(자재명세서) 비용을 낮춰 과거에는 경제성이 없다고 판단되어 무산되었던 프로젝트들을 실현 가능하게 만들고 있다는 것입니다. 전력 제약과 실시간 지연 시간 요구사항 때문에 기성 칩이 맞지 않아 자율주행 워크용 커스텀 실리콘으로 전환한 리비안(Rivian)의 사례를 언급하며, 앞으로 더 많은 기업이 이러한 결정을 정당화할 수 있게 될 것이라고 평가했습니다. 다만 그는 이 툴이 칩 스타트업들에게는 양날의 검이 될 수 있음을 경고했습니다. 기존 상용 실리콘 벤더들의 숙련된 엔지니어링 팀 역시 동일한 생산성 향상 효과를 활용해 자체 제품 라인업을 확장하고 더 특화된 워크로드를 공략할 수 있기 때문입니다.