Frontier Chips for Frontier AI Labs, with Walter Goodwin, Founder/CEO of Fractile
Quick Summary
Fractile의 Walter Goodwin은 최전선 AI 연구소를 위한 칩 경쟁의 핵심을 메모리 대역폭·용량·비용과 빠른 설계·배포 능력에서 찾는다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Fractile의 Walter Goodwin은 최전선 AI 연구소를 위한 칩 경쟁의 핵심을 메모리 대역폭·용량·비용과 빠른 설계·배포 능력에서 찾는다.
📌 핵심 요점
- 추론 속도는 모델의 실질적인 역량과 연결된다. Fractile은 거대한 모델에 추론 시점 연산을 더 투입하려면 빠른 실행이 필요하다고 본다. 특히 장시간 작업하는 에이전트에서는 속도 개선이 같은 시간에 수행할 수 있는 추론의 양을 늘릴 수 있다.
- 빠른 메모리만으로는 대형 모델과 긴 컨텍스트를 감당하기 어렵다. 초기 SRAM 기반 접근은 높은 대역폭을 제공했지만 용량과 확장성 문제가 드러났다. Fractile은 DRAM의 용량·비용 이점에 높은 대역폭을 결합하는 방향으로 전환했으며, 칩당 HBM 기반 칩 대비 25배 대역폭이라는 특성을 제시한다.
- 추론 경제성은 속도와 메모리 비용을 함께 봐야 한다. 추론 비용은 모델을 사용할 때마다 반복해서 발생한다. 수천 사용자를 지원하려면 가중치와 상태에 빠르게 접근하면서도 충분한 메모리를 경제적으로 확보해야 하며, 응답 속도와 처리량·비용 효율 사이의 절충도 고려해야 한다.
- 설계 통합과 자동화는 개발을 앞당기지만 제조·배포 시간을 없애지는 못한다. Fractile은 약 150명 조직에 논리 설계부터 물리 구현·첨단 패키징까지 역량을 갖춰 피드백을 단축하려 한다. Goodwin은 제조에 3~5개월, 생산 확대에 12~18개월, 투자비 회수에 3~5년이 필요하다고 설명하며, 빠른 설계와 장기간 유효한 아키텍처 선택을 함께 강조한다.
- 연구소의 공급 다변화는 독립 칩 공급사의 기회가 된다. 자체 칩과 대체 공급사는 공급량·통제력·가격 협상력을 높일 수 있다. 동시에 특정 칩에 전적으로 의존하면 다른 플랫폼에서 등장한 효율 개선에 대응하기 어려워진다는 것이 Goodwin의 판단이다.
🧩 배경과 문제 정의
- Fractile은 대형 AI 모델의 추론 속도를 높이면서 모델 규모와 긴 컨텍스트에도 대응하려는 칩 회사다. 추론 시점에 더 많은 연산을 투입해 모델의 능력을 높이는 방향에 초기부터 베팅했다.
- AI 가속기는 다양해졌지만 HBM, 행렬곱 연산 회로, 첨단 패키징 등 핵심 구성은 상당 부분 비슷하다. 설계부터 물리 구현까지 직접 통합해 새로운 기능을 만드는 기업은 상대적으로 적다는 것이 Goodwin의 진단이다.
- 빠른 추론에는 높은 메모리 대역폭이 필요하지만, 긴 컨텍스트와 다수 사용자 서비스를 지원하려면 메모리 용량과 비용도 중요하다. 빠르게 변하는 모델에 대응하는 설계 속도와 칩의 생산·설치·투자 회수 기간을 함께 고려해야 한다.
🕒 시간순 섹션별 상세정리
1. 추론 속도와 확장성을 함께 겨냥한 창업 방향
- Fractile은 2022년 여름 창업 때부터 세계 최대 규모 모델을 위한 빠른 추론 칩을 목표로 삼았다. 인터넷으로 학습한 범용 기반 모델의 등장과 추론 시점 연산 확대 가능성이 출발점이었다. [01:24]
- 유능한 신경망에 추가 연산을 투입해 능력을 높이는 접근을 언어 모델에도 적용하려면, 거대한 모델을 훨씬 빠르게 실행할 하드웨어가 필요하다. [01:47]
2. 다양한 AI 가속기 뒤에 있는 공통 기술과 공급 구조
- 하이퍼스케일러의 자체 칩은 여러 종류지만, 실제 개발과 공급은 소수 ASIC 구현 업체와의 협력에 의존한다. Google TPU, Meta MTIA, Microsoft Maia, OpenAI Jalapeno가 이 구조의 사례로 거론된다. [03:03]
- Nvidia·AMD GPU와 여러 ASIC은 HBM 메모리, 행렬곱용 텐서 코어, TSMC 첨단 패키징이라는 공통 기반을 사용한다. 제품의 다양성이 근본적인 기술 차이를 그대로 뜻하지는 않는다. [03:49]
3. 논리 설계와 실제 제조용 배치 사이의 역할 분담
- 칩 아키텍트는 목표 워크로드를 이해하고 이에 맞는 회로를 구상한다. 텐서 코어는 모델 연산량의 대부분을 차지하는 행렬곱에 특화한 회로라는 사례다. [05:19]
- 프런트엔드 설계는 칩의 동작과 논리를 코드로 표현한다. 이후 RTL 합성과 배치를 거쳐 금속층과 개별 트랜지스터 위치를 담은 제조용 GDS2 파일로 변환된다. [05:54]
4. 약 150명 규모의 풀스택 조직으로 설계 피드백을 단축
- Fractile은 현재 워크로드를 이해하는 데서 더 나아가, 자사 하드웨어에 잘 맞는 모델 아키텍처와 기술 방향을 탐색한다. 이는 고객에게 제안할 내용과 1~2년 뒤 대량 공급할 칩의 설계 선택을 함께 뒷받침한다. [07:52]
- 약 150명 조직 안에 프런트엔드 설계, 물리 설계, 백엔드 구현, 첨단 패키징 역량을 갖췄다. 각 분야의 인원은 적지만 내부에서 빠르게 피드백을 주고받을 수 있다. [08:30]
5. 추론 비용을 반복적으로 발생하는 핵심 비용으로 판단
- Fractile의 초기 선택은 AI가 모델 배포 중심의 시대로 이동하고, 추론 속도가 중요해질 것이라는 전망이었다. Goodwin은 창업 이후 약 2년 동안에도 추론의 의미를 설명해야 했다고 회고한다. [09:54]
- 추론의 한계비용은 작다는 의미가 아니라 모델을 사용할 때마다 반복해서 지불하는 비용이다. 배포가 확대될수록 이 비용과 실행 속도를 개선하는 하드웨어의 중요성이 커진다. [10:18]
6. SRAM의 속도 이점에서 대용량 DRAM의 대역폭 확대로 전환
- 초기 약 2년은 Groq·Cerebras처럼 SRAM 기반 칩을 개발했다. SRAM은 연산 회로와 같은 실리콘에 있어 가중치와 KV 캐시에 매우 높은 대역폭으로 접근할 수 있고, 초당 수천 토큰의 실행 속도를 가능하게 한다. [10:47]
- 2023년 말부터 2024년에 걸쳐 모델 파라미터와 컨텍스트 길이 증가가 이 접근의 확장성 문제로 떠올랐다. 특히 긴 컨텍스트의 비중이 커지는 점이 우려를 키웠다. [11:25]
7. 빠른 추론의 핵심 가치는 장시간 에이전트와 메모리 경제성
- 더 빠른 챗봇보다 중요한 기회는 장시간 실행되는 에이전트를 크게 가속하는 데 있다는 판단이다. 수조 개 파라미터 모델을 초당 수천 토큰으로 실행하는 능력이 AI의 실질적인 역량을 높일 수 있다고 본다. [12:56]
- 기존 고속 추론 칩은 높은 대역폭에 비해 메모리 용량이 작다. Goodwin은 긴 컨텍스트의 어텐션을 처리할 때 GPU로 돌아가야 하는 배치 사례를 지적하며, 속도 수요와 실제 지원 기능 사이의 불일치를 보여준다. [13:44]
8. 모델 변화 속에서도 유지되는 대역폭 요구와 아키텍처 불확실성
- 현재 워크로드에 정확히 맞는 칩을 대량 확보하더라도 6개월 뒤에는 요구가 달라질 수 있다. 모델 출시와 변화가 빠르므로 여러 모델에 공통으로 필요한 기능을 찾아야 한다. [15:56]
- 자기회귀 언어 모델은 텍스트 생성 시 낮은 배치 크기로 실행되며, 처리량·비용 효율과 응답 속도 사이에 상충관계가 있다. 더 빠른 실행을 위한 메모리 대역폭 요구는 여러 모델에 공통적이다. [16:23]
9. AI 설계 자동화에도 남는 제조 시간과 투자 회수 조건
- Fractile은 설계 전 과정을 직접 통제하는 구조가 AI를 활용한 작업 방식 재설계를 가능하게 한다고 본다. 프런트엔드만 빨라져도 다음 조직의 작업이 기존 속도로 진행되면 전체 일정 단축은 제한된다. [17:49]
- 파운드리 제조에는 공통적인 물리적 지연이 있다. 칩을 제조에 넘긴 뒤 돌려받기까지는 매우 높은 우선순위로 처리하더라도 3~5개월이 걸린다. [18:49]
10. 설계 주기 단축의 목적은 더 많은 후보와 정확한 양산 선택
- 설계 주기를 줄이면 더 많은 기술적 선택을 시험할 수 있지만, 최종 칩에는 3년 이상의 유용한 수명이 여전히 필요하다. 빠른 개발이 장기적인 설계 판단을 대체하지는 않는다. [19:29]
- 여러 후보 중 주력 플랫폼을 선택한 뒤에는 12~18개월에 걸쳐 생산량을 확대하고 지속적인 고객 가치를 기대한다. 몇 주마다 근본적으로 새로운 칩을 출하하는 미래에는 회의적이다. [20:01]
11. 여러 칩 프로그램과 3~6개월의 구조적 선행 우위
- Fractile은 현재 단일 칩을 개발하지만, Nvidia 시스템에는 Nvidia가 만든 맞춤형 칩 6~9개가 결합된다. AI로 개발 생산성이 높아지면 Fractile도 더 많은 구성 요소를 직접 개발할 가능성이 생긴다. [21:48]
- 유망한 설계 후보들을 지속적으로 준비하고 적절한 순간에 생산 확대를 시작할 수 있는 체계가 경쟁우위의 핵심이라는 판단이다. 생산성 향상을 더 많은 개발 프로그램으로 연결하려는 방향이다. [22:05]
12. 설계 의도에서 GDS2까지의 자동화 전망과 계산 병목
- 설계 책임자의 의도를 바로 사용 가능한 GDS2로 바꾸는 데 10년이 걸린다는 다른 반도체 CEO의 전망에 대해, Goodwin은 더 짧은 기간을 예상한다. 향후 몇 년 안에 전 과정을 연결하는 프로토타이핑이 가능해질 것으로 본다. [23:02]
- 현재 배치·배선 도구는 어려운 최적화 문제를 전통적인 알고리즘으로 처리하며 며칠씩 실행된다. 설계 판단을 자동화해도 이러한 계산 과정이 전체 속도를 제한할 수 있다. [23:59]
13. 근사 모델로 반복을 가속하되 최종 검증은 유지
- 유한요소 해석과 열 추정 같은 시뮬레이션에 근사 모델을 적용하면 설계 반복을 줄일 수 있다. 판단 단계가 빨라질수록 각 시험을 수행하는 속도의 중요성이 커진다. [25:36]
- 최종 승인 절차는 상당 기간 유지될 것으로 예상한다. Cadence와 Synopsys가 파운드리와 오랫동안 구축한 DRC·LVS 검증은 제조 규칙을 충족하는지 확인하는 데 큰 가치가 있다. [26:15]
14. 비싼 실험 전후에 더 많은 추론을 투입하는 워크로드
- 실험을 설계하는 지능이 높아지고 실험 수행이 병목이 되면, 각 실험 전에 더 깊게 생각하는 편이 중요해진다. Fractile은 이러한 어려운 문제 해결 과정의 추론 수요에 베팅한다. [26:57]
- 비싼 실험 전후에 각각 인간 기준 100년 분량의 사고를 투입하자는 다른 대화의 제안을 예로 든다. 이는 실제 소요 시간의 예측이 아니라, 제한된 실험 기회를 충분한 추론으로 활용하자는 취지다. [27:42]
15. 기존 모델 가속과 대역폭 중심의 새로운 스케일링 탐색
- Fractile은 HBM 기반 GPU나 다른 가속기에서 학습된 모델을 잘 실행해야 한다. 메모리 대역폭을 높여 현재의 자기회귀 트랜스포머를 더 빠르고 효율적으로 처리하는 것이 기본 목표다. [28:30]
- 동시에 새로운 하드웨어 기능이 모델 설계의 방향을 바꿀 가능성도 탐색한다. 칩당 HBM 기반 칩보다 25배 많은 대역폭이라는 특성을 바탕으로, 연산량뿐 아니라 대역폭에도 스케일링 법칙이 있는지 연구한다. [29:05]
16. 메모리 대역폭 확대가 모델의 연산 효율을 높인다
- 희소성이 큰 모델을 현재 GPU·XPU에서 효율적으로 실행하기는 어렵다. 메모리 대역폭 병목 때문에 실제 연산 활용률이 매우 낮아지는 경우가 많다 [30:07]
- 어텐션 방식에도 대역폭과 연산량 사이의 절충이 있다. 같은 지능 수준에서 대역폭을 덜 요구하는 방식은 연산량을 더 요구하는 경향이 있으며, 지난 20년간 연산 성능은 약 100만 배 증가했지만 메모리 대역폭은 약 40배 증가하는 데 그쳤다 [30:36]
17. 공급 다변화와 실행 속도가 칩 시장의 경쟁을 이끈다
- 대규모 AI 배포 기업들은 가능한 한 여러 플랫폼을 확보하려는 모습을 보인다. 컴퓨팅 자원이 기업의 존립에 중요해질수록 공급원을 다양하게 유지할 필요도 계속될 것이라는 전망이다 [31:48]
- 자체 칩 개발과 AMD 등 대체 공급사 활용에는 엔비디아와의 가격 협상력을 높이는 목적이 일부 있을 수 있다. 기존 칩과 구조가 유사한 자체 개발 노력은 새로운 능력을 확보하기보다 총공급량과 통제력을 늘리는 성격도 갖는다 [32:13]
18. 특정 자체 칩에 대한 전면 의존은 경쟁 대응을 어렵게 만든다
- Fractile은 최첨단 연구소의 요구와 워크로드를 깊이 이해하는 방향으로 조직을 구성한다. 독립적인 최첨단 칩 공급사가 수십 년간 존속할 수 있다는 판단의 근거는 연구소들이 특정 하드웨어에 전부를 걸었을 때 부담하는 큰 위험에 있다 [33:41]
- 한 연구소가 독자 칩에 전적으로 의존하는 동안 경쟁사가 다른 칩에서만 가능한 계산 효율 개선을 발견할 수 있다. 동일한 지능 수준에서 효율이 5배 높아지는 상황을 가정하면, 해당 칩을 충분히 배포하기까지 걸리는 9개월 동안 뒤처진 연구소의 생존 자체가 위협받을 수 있다 [34:25]
🧾 결론
- Fractile의 전략은 대형 모델과 긴 컨텍스트를 빠르게 실행할 수 있도록 메모리 대역폭, 용량, 비용을 함께 개선하는 데 있다.
- 높은 대역폭은 기존 모델 가속뿐 아니라 희소성이나 어텐션 설계의 선택지를 넓힐 가능성이 있다. 다만 같은 지능 수준에서 연산량을 얼마나 줄일 수 있는지는 검증이 필요하다.
- AI 설계 자동화의 가치는 더 많은 후보를 시험하고 적절한 양산 선택을 앞당기는 데 있다. 최종 제조 검증과 물리적인 생산 시간은 계속 중요하다.
- 최전선 연구소의 칩 경쟁력은 모델의 우수성과 함께 추론 속도, 배포 시점, 새로운 플랫폼에 대응할 수 있는 선택지에 달려 있다는 관점이다.
📈 투자·시사 포인트
- AI 칩을 평가할 때 연산 성능과 토큰 생성 속도뿐 아니라 지원 모델 규모, 컨텍스트 길이, 메모리 용량·비용, 실제 사용자 부하를 함께 확인필요가 있다.
- 추론은 사용량에 따라 반복되는 비용이므로, 배포 확대 과정에서 속도와 비용을 동시에 개선하는 하드웨어의 경제적 가치가 커질 수 있다.
- 개발 속도는 양산·설치·투자 회수까지 연결되어야 경쟁우위가 된다. Goodwin이 제시한 3~6개월 선행 우위는 실제 고객 배포와 수주로 이어지는지 확인해야 한다.
- 자체 칩 확대에는 공급 확보와 협상력 강화라는 동기가 있다. 새로운 실행 능력을 제공하는 독립 공급사의 기회도 함께 살펴볼 필요가 있다.
⚠️ 불확실하거나 확인이 필요한 부분
- HBM 기반 칩 대비 25배 대역폭은 인터뷰에서 제시된 특성이다. 비교 대상, 측정 조건, 실제 모델의 속도·처리량·전력·비용 효과는 제공 자료만으로 확인할 수 없다.
- 생산 확대 계획은 인터뷰 시점 기준 ‘다음 해 하반기’로 표현되어 있다. 인터뷰 날짜와 후속 진행 상황이 없어 현재 양산 상태를 판단하기 어렵다.
- 대역폭 중심 스케일링과 높은 희소성의 효율 개선은 탐색 중인 방향이다. MoE의 구체적인 비율 비교는 해당 설명 구간에서 완결되지 않아 확정 수치로 인용하기 어렵다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- Fractile의 대역폭 주장에 대해 비교 칩, 메모리 용량, 모델 규모, 컨텍스트 길이, 배치 크기가 명시된 성능 자료를 확인한다.
- 긴 컨텍스트와 다수 사용자 환경에서 응답 속도·처리량·메모리 비용을 함께 비교하고, 일부 연산을 GPU로 넘겨야 하는지도 점검한다.
- 인터뷰 날짜를 확인한 뒤 생산 확대 계획, 실제 공급 시점, 고객 배포 진행 상황을 대조한다.
- 칩의 유효 수명과 투자 회수 기간을 검토할 때 모델 변화, 생산 확대, 데이터센터 전력과 설치 시간을 함께 반영한다.
❓ 열린 질문
- DRAM의 용량·비용 이점과 높은 대역폭을 결합한 설계가 대형 모델·긴 컨텍스트·다수 사용자 환경에서 어느 정도의 실질적인 효율 개선을 제공할까?
- 메모리 대역폭 확대는 같은 지능 수준에 필요한 연산량을 얼마나 줄일 수 있으며, 그 효과는 어떤 모델 구조에서 가장 클까?
- 빠르게 바뀌는 모델 요구에 대응하면서도 3년 이상 유용한 칩 아키텍처를 선택하려면 어떤 공통 기능을 우선해야 할까?