엔비디아 없이 AI 칩 가능한가? GPU·TPU·xPU 경쟁 속 진짜 셈법 분석
Quick Summary
엔비디아 없이도 일부 AI 연산은 자체 칩으로 처리할 수 있지만, GPU·TPU·xPU 경쟁의 진짜 셈법은 반복 작업의 경제성과 소프트웨어·연결·메모리를 포함한 전체 시스템에 있다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
엔비디아 없이도 일부 AI 연산은 자체 칩으로 처리할 수 있지만, GPU·TPU·xPU 경쟁의 진짜 셈법은 반복 작업의 경제성과 소프트웨어·연결·메모리를 포함한 전체 시스템에 있다.
📌 핵심 요점
- GPU와 AI 전용 칩의 차이는 단순한 범용·전용 구분으로 설명되지 않는다. 엔비디아 GPU도 Tensor Core와 Transformer Engine으로 행렬 연산과 저정밀 계산을 가속한다.
- 자체 칩은 기업이 잘 아는 연산을 대규모로 반복할 때 유리하다. 모델이 빠르게 바뀌는 연구 단계에서는 소프트웨어와 라이브러리로 대응할 수 있는 GPU의 유연성이 강점이다.
- 학습과 추론은 병목이 다르다. 학습은 많은 칩의 지속적인 연산과 연결이 중요하고, 추론은 KV 캐시 접근, 토큰 생성, MoE의 칩 간 데이터 이동에 따른 대기 시간을 줄이는 일이 중요하다.
- 자체 칩의 경쟁력은 칩 성능만으로 완성되지 않는다. 충분한 내부 작업량, 모델을 실행할 컴파일러와 커널, 네트워크 운영 능력이 필요하며, 추론 비용 절감은 에이전트가 같은 가격에 더 많은 단계를 수행할 여지를 만든다.
- 자체 xPU 확대가 엔비디아 기술이나 HBM 수요의 소멸을 뜻하지는 않는다. 영상은 엔비디아가 NVLink와 NVHBM으로 자체 칩 주변의 연결·메모리 영역까지 관여하려는 전략을 설명한다.
🧩 배경과 문제 정의
영상은 앞선 강의에서 다룬 GPU의 AI 연산 적합성, HBM·패키징의 중요성, CUDA·NVLink·네트워크·서버로 이어지는 엔비디아 시스템을 출발점으로 삼는다. 자본과 데이터센터를 가진 빅테크가 자체 AI 칩을 만들면 엔비디아를 대체할 수 있는지가 이번 질문이다.
구글이 자체 TPU를 개발하면서도 엔비디아 시스템을 함께 제공한다는 사례를 통해, 비교 기준을 칩 성능에서 작업의 성격과 시스템 운영 조건으로 옮긴다. 자체 칩이 유리한 작업, 모델 변화와 소프트웨어의 부담, 엔비디아의 대응, HBM 공급망의 의미를 연결해 설명한다.
🕒 시간순 섹션별 상세정리
1. 자체 AI 칩이 있어도 GPU를 함께 쓰는 이유
- 앞선 강의는 GPU의 연산 적합성뿐 아니라 HBM·패키징과 CUDA·NVLink·네트워크·서버가 결합된 시스템의 중요성을 다뤘다. [00:26]
- 영상은 구글이 자체 TPU를 개발하면서도 Google Cloud에 엔비디아 Blackwell·Rubin 시스템을 제공하려는 사례로 대체 가능성에 의문을 제기한다. [00:58]
- 이번 비교의 기준은 단순 성능 수치가 아니라 자체 칩으로 옮길 수 있는 작업, 개발의 어려움, 엔비디아의 대응이다. [01:15]
2. GPU의 AI 전용 회로와 TPU의 연산 특화
- 엔비디아 GPU도 Transformer의 행렬 연산을 Tensor Core로 가속하며, GPU 내부에 AI 전용 처리 장치를 갖추고 있다. [02:01]
- 낮은 정밀도는 메모리 사용과 데이터 이동을 줄이지만 정확도 문제가 생길 수 있다. Transformer Engine은 계산별 정밀도를 조절하고, 영상은 Blackwell의 더 낮은 정밀도 지원도 언급한다. [02:40]
- TPU의 시스톨릭 어레이는 인접 처리 장치가 데이터를 재사용하도록 한다. 구글·메타처럼 자사 모델의 반복 연산을 아는 기업은 자주 쓰는 기능에 칩 면적을 집중할 수 있다. [03:29]
3. 학습과 추론의 병목에 맞춘 설계
- 대규모 학습에서는 수천 개 칩이 연산을 지속하도록 하는 일이 중요하다. 추론은 토큰을 순차 생성하며 KV 캐시를 읽고, MoE에서는 선택된 전문가의 위치에 따라 칩 간 데이터 이동도 발생한다. [04:26]
- 영상은 학습용 TPUv5p의 행렬·벡터·희소 데이터 처리 장치와 최대 9,600개 칩을 연결하는 슈퍼팟 구성을 보여준다. [04:57]
- 이후 추론용 칩을 TPUv5i로 부르며 384MB SRAM, 계산 결과 집계 장치, ICI와 보드 간 연결을 보여준다. 핵심 목적은 답변 생성 중 칩의 대기 시간을 줄이는 것이다. [05:30]
4. 모델 변화의 위험과 자체 칩의 경제성
- 칩 설계·검증·데이터센터 배치에는 시간이 걸리므로, 그 사이 Attention·MoE·저정밀 연산 방식이 바뀌면 기존 전용 회로의 효용이 줄어들 수 있다. [05:56]
- GPU는 소프트웨어와 라이브러리 업데이트로 새 계산 방식에 대응하기 쉬워 연구 단계에 강점이 있다. 자체 칩은 모델과 서비스 방식이 정해진 뒤 반복 작업이 커질 때 유리하다. [06:23]
- 영상은 메타 MTIA, 마이크로소프트 Maia, AWS Trainium과 Anthropic의 사용 사례를 보여준다. 비교의 핵심은 TFLOPS보다 만든 칩을 계속 가동할 충분한 작업량이다. [07:04]
5. Jalapeno와 에이전트 추론 비용
- 영상은 OpenAI가 Broadcom과 만드는 자체 추론 칩 Jalapeno를 소개하며, ChatGPT·Codex 운영에서 관찰한 연산·메모리·네트워크 특성에 맞춘 설계라고 보여준다. [07:29]
- 코드 작성·실행·검증·수정을 수행하는 에이전트는 한 요청에도 모델을 여러 번 실행한다. 추론 비용을 낮추면 같은 가격으로 더 많은 단계를 수행하고 더 오래 작업할 수 있다는 논리다. [08:16]
- 영상에 따르면 OpenAI는 아키텍처, Broadcom은 반도체 구현과 네트워킹, Celestica는 보드·랙을 맡는다. 공개 정보는 엔지니어링 샘플과 초기 시험 수준이며 최종 성능 측정과 기술 보고서는 남아 있다. [08:40]
6. 소프트웨어 호환성과 GPU·TPU의 병행
- 자체 칩을 만들더라도 기존 모델이 제대로 실행되어야 한다. 엔비디아는 PyTorch 코드와 CUDA 라이브러리를 활용한 이전이 강점이며, 자체 칩 기업도 실행 소프트웨어를 준비해야 한다. [09:04]
- 구글 XLA는 모델 코드를 칩이 실행할 형태로 바꾸고, 가능한 연산을 결합하는 fusion으로 중간 결과의 HBM 저장·재접근을 줄인다. [09:51]
- 새 모델 시험과 CUDA 프로그램에는 GPU가 편리하고, 구글이 모델과 데이터센터를 통제하며 반복 실행하는 Gemini 같은 작업에는 TPU의 이점이 크다. 두 칩은 서로 다른 필요를 충족한다. [10:20]
7. 엔비디아의 연결·메모리 전략
- 빅테크의 반복 내부 작업이 자체 칩으로 옮겨가면 GPU 수요 일부가 줄 수 있다. 영상은 NVLink Switch를 통해 자체 xPU·CPU까지 연결하는 엔비디아의 대응을 보여준다. [11:10]
- AWS는 Trainium 개발과 엔비디아 협력을 병행한다. 영상은 Trainium 4부터 자체 칩과 엔비디아 GPU를 공통 랙 구조에서 연결하려는 계획을 보여준다. [11:27]
- NVHBM은 메모리 제어 기능을 HBM 아래 베이스 다이로 옮기는 구조로 드러난다. 면적·대역폭·전력 개선 수치는 미래 목표이며, 전략의 초점은 자체 xPU에도 엔비디아의 연결·메모리 기술을 사용하게 하는 데 있다. [12:31]
8. 독자 시스템의 조건과 HBM 공급망
- 구글은 TPU뿐 아니라 ICI, 데이터센터 네트워크, XLA도 구축한다. 자체 칩으로 엔비디아 의존도를 크게 낮추려면 이런 시스템 역량이 필요하다는 설명이다. [13:08]
- 모델 변화에 따른 컴파일러·커널 업데이트, 수천 개 칩의 연결, 시스템을 계속 가동할 내부 수요가 필요하다. GPU 가격이 비싸다는 이유만으로 일반 기업이 ASIC 개발에 진입하기는 어렵다. [13:36]
- 자체 가속기도 HBM을 사용하며, 고객 xPU에 맞춘 베이스 다이 설계와 공동 검증이 중요해질 수 있다. 다만 영상은 개별 메모리 기업의 계약·물량이 알려지지 않아 특정 기업의 직접 수혜를 단정할 단계가 아니라고 보여준다. [14:30]
9. 대체 여부에서 작업과 시스템의 분담으로
- 영상의 최종 답은 GPU의 갑작스러운 소멸보다 반복적이고 예측 가능한 작업부터 자체 칩으로 점차 이전된다는 것이다. [14:57]
- 중앙 연산 칩이 바뀌어도 네트워크·HBM·랙·소프트웨어는 필요하다. 어떤 GPU 작업이 자체 xPU로 이동하고 누가 주변 시스템을 담당하는지가 시장을 읽는 핵심이다. [15:19]
- AI 컴퓨팅 시스템이 여러 칩으로 역할을 나누기 시작했다는 결론으로 설명을 마무리한다. [15:31]
🧾 결론
- 자체 칩의 대체 가능성은 기업 전체가 엔비디아를 떠나는지보다 어떤 GPU 작업을 이전할 수 있는지로 판단해야 한다.
- 반복적이고 예측 가능한 내부 작업은 자체 칩으로 옮겨갈 수 있지만, 새로운 모델 실험과 CUDA 기반 프로그램에는 GPU 수요가 남을 수 있다.
- 칩 설계부터 소프트웨어·네트워크·서비스 운영까지 통제하고 충분한 연산 수요를 확보한 기업일수록 자체 칩 투자의 조건을 갖추기 쉽다.
- AI 반도체 경쟁은 단일 칩의 속도 경쟁에서 연산·메모리·연결·랙·소프트웨어의 역할과 수익을 나누는 경쟁으로 확장되고 있다.
📈 투자·시사 포인트
- 엔비디아를 평가할 때 자체 칩으로 이전되는 작업과 연결·메모리 기술로 유지할 수 있는 사업 기회를 함께 살펴볼 필요가 있다.
- 빅테크 자체 칩의 경제성은 TFLOPS뿐 아니라 지속적인 작업량, 실제 가동 수준, 소프트웨어 유지 부담, 서비스 비용 절감으로 판단해야 한다.
- TPU·Trainium·Maia 같은 자체 가속기도 HBM을 사용한다는 점에서 GPU 점유율 변화와 HBM 수요 변화를 동일하게 볼 수 없다.
- 메모리 기업에는 고객 xPU에 맞춘 베이스 다이 설계와 공동 검증 능력이 중요해질 수 있다. 다만 영상에 제시된 정보만으로 특정 기업의 계약·공급량·직접 수혜를 확정할 수는 없다.
⚠️ 불확실하거나 확인이 필요한 부분
- TPU 세대와 제품명이 일관되지 않는다. 영상은 ‘8세대’를 언급하면서 v5p·v5e를 소개하고, 이후 추론용 칩을 v5i로 부른다. 각 제품의 세대와 제원 연결은 확인이 필요하다.
- 영상이 소개하는 OpenAI의 Jalapeno는 엔지니어링 샘플과 초기 시험 단계다. 최종 성능, 서비스 비용 절감 효과, 실제 배치 규모를 확정된 결과로 읽어서는 안 된다.
- NVHBM의 연산 다이 면적 최대 25% 확보, 대역폭 최대 30% 증가, HBM 전력 최대 15% 감소는 영상에서 엔비디아의 미래 기술 목표로 제시된다. 출시 제품의 실측 결과와 구분해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 검토 대상 AI 작업을 새로운 모델 실험, 대규모 학습, 반복 추론으로 나누고 연산·메모리·통신 중 주요 병목을 정리한다.
- 자체 칩의 경제성을 비교할 때 칩 성능과 함께 지속적인 작업량, 소프트웨어 이전·유지 부담, 서비스 비용을 확인한다.
- TPU 세대·제품명과 NVHBM 관련 표기의 혼선을 확인하고, 검증 전에는 서로 다른 설명을 하나의 확정 제원으로 합치지 않는다.
- Jalapeno의 후속 기술 보고서와 최종 성능 측정 결과가 공개되는지 확인한다.
❓ 열린 질문
- 반복 작업이 자체 칩으로 이전되는 규모와 새로운 모델 연구·서비스 확대에 따른 GPU 수요는 어떤 균형을 이룰까?
- 자체 칩의 비용 절감 효과는 컴파일러·커널 업데이트와 네트워크 운영 부담까지 포함해도 유지될까?
- 자체 xPU 주변에서 엔비디아의 연결·메모리 기술을 채택하는 기업과 독자 시스템을 구축하는 기업은 어떻게 나뉠까?