How Many Will Actually Get Built & Is Energy AI''s BIGGEST Bottleneck?
Quick Summary
Positron AI 공동창업자는 데이터센터 완공 비율을 제시하지는 않지만 입지 이동으로 증설이 이어질 것으로 보며, 향후 몇 년간 AI 확장의 핵심 제약은 에너지 자체보다 건설 자금과 경제성이라고 판단한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Positron AI 공동창업자는 데이터센터 완공 비율을 제시하지는 않지만 입지 이동으로 증설이 이어질 것으로 보며, 향후 몇 년간 AI 확장의 핵심 제약은 에너지 자체보다 건설 자금과 경제성이라고 판단한다.
📌 핵심 요점
- 데이터센터 증설은 전력·입지·자금의 결합 문제다. 소마스는 지역 반대가 대형 사업자의 계획 취소보다 입지 이동을 유도할 것으로 예상한다. 장기적으로 에너지가 제약이더라도, 단기에는 발전·인프라 건설에 투입할 부채와 사업성이 더 중요하다는 입장이다.
- 추론에서는 연산 성능만큼 메모리 접근이 중요하다. 토큰 생성에는 모델 가중치를 읽는 과정이 필요하고, 긴 문맥과 다수 사용자의 KV 캐시는 저장 부담을 키운다. 계층형 저장, 양자화, 어텐션 효율화는 이를 완화하지만 관리 복잡성과 품질 손실을 함께 평가해야 한다.
- 캐시 경제성과 학습 지출을 분리해야 AI 기업의 수익성이 보인다. 소마스는 캐시 재사용의 낮은 처리 비용을 높은 추론 마진의 근거로 들며, 학습 지출이 회사 전체의 현금 소진을 크게 좌우한다고 주장한다. 이는 현재 기업 전체가 흑자라는 의미가 아니며, 캐시 원가와 마진 수치도 추정·보도에 의존한다.
- 효율 개선과 로컬 모델 확산은 총수요를 늘릴 수 있다. 같은 작업을 더 적은 전력으로 처리해도 확보한 전력으로 더 많은 토큰을 생산할 수 있다는 전망이다. 기기 내 모델 역시 어려운 작업을 클라우드에 자율적으로 요청하면 대형 모델의 사용량을 확대할 수 있다.
- 기술 발전의 효과는 실제 활용 능력과 사회적 합의에 달려 있다. 긴 컨텍스트는 최대 입력 길이보다 정보 회수 능력이 중요하고, 에이전트의 칩 설계 사례도 구현 결과와 완전한 자동화를 구분해야 한다. 규제·입지·에너지 생산에서는 이해관계와 경제적 유인을 조정하는 일이 확장의 조건으로 제시된다.
🧩 배경과 문제 정의
- 생성형 AI 인프라는 모델을 학습시키는 연산 성능뿐 아니라, 실제 서비스에서 토큰을 생성하는 추론의 메모리 병목까지 해결해야 한다. Positron AI는 추론용 칩부터 소프트웨어·랙 규모 시스템까지 개발한다.
- 캐시 토큰의 처리 비용과 판매 가격, 학습 투자와 추론 서비스의 수익성을 구분해야 AI 기업의 경제성을 판단할 수 있다.
- 최첨단 AI 개발의 속도 조절은 안전뿐 아니라 기술 접근권, 기업·정부로의 권력 집중, 중국과의 경쟁에 영향을 준다.
- 데이터센터 증설에는 지역 반대, 토지 이용 규제, 발전 용량과 전력망 연결 문제가 얽혀 있다. 소마스의 물 사용량·전력 가격 관련 주장과 중국에 대한 해석은 검증된 사실과 구분필요가 있다.
🕒 시간순 섹션별 상세정리
1. 추론 인프라는 연산량보다 메모리 접근이 중요하다
- Positron AI는 생성형 AI 추론을 위한 반도체 기업으로, 칩과 하드웨어에 직접 연결되는 소프트웨어부터 전체 시스템과 랙 규모 배치까지 개발한다 [01:13]
- 학습은 기본적으로 연산 성능에 제약받는 작업이다. 소마스는 지난 10년의 스케일링 법칙을 모델의 매개변수와 학습에 투입하는 부동소수점 연산량이 늘수록 성능이 좋아지는 관계로 보여준다 [01:56]
2. GPU 연산 성능과 메모리 대역폭의 격차가 커졌다
- 메모리 월은 AI 유행 이전부터 존재한 문제다. 반도체 집적도 상승이 연산 성능 향상으로 이어지는 동안 메모리 기술은 같은 속도로 개선되지 못했다 [04:28]
- 소마스가 제시한 2014~2024년 비교에서 단일 엔비디아 GPU의 연산 성능은 약 120배, 메모리 대역폭은 약 17배 향상됐다. 이 격차 때문에 연산량을 늘려도 해결되지 않는 작업은 메모리의 제약을 더 크게 받게 됐다 [05:05]
3. SRAM의 기술적 한계와 트랜스포머 전환이 맞물렸다
- 칩 내부 SRAM은 여섯 개 트랜지스터를 사용하는 셀 구조이며, 소마스에 따르면 지난 약 15년간 다른 연산용 회로만큼 빠르게 작아지지 못했다. 기본 구조도 30~40년 동안 크게 달라지지 않아 연산부보다 개선 여지가 제한적이었다 [06:12]
- 2010년대의 AlexNet·ResNet 같은 합성곱 신경망은 연산 성능을 늘리는 효과가 컸고, 상대적으로 큰 메모리 용량이나 대역폭을 요구하지 않았다. 당시에는 메모리 개선에 집중할 동기도 부족했다 [07:21]
4. 캐시 토큰의 낮은 처리 비용이 높은 마진을 만든다
- 캐시된 토큰과 캐시되지 않은 토큰의 가격 구분은 늘었지만, 소마스는 동일 요금을 받는 경우뿐 아니라 할인된 캐시 요금에도 매우 높은 마진이 포함돼 있다고 평가한다 [08:49]
- 캐시 토큰 처리는 다시 계산해 생성하는 것보다 비용이 대략 1,000분의 1 수준이라는 설명이다. 이는 정밀한 원가 수치가 아니라 비용 규모의 차이를 강조한 추정이다 [09:25]
5. 학습 투자 부담과 추론 서비스의 수익성은 구분해야 한다
- 소마스는 약 80%의 매출총이익률을 높이 평가하면서도 경쟁이 심해지면 마진이 낮아질 것으로 예상한다. 공급자의 마진 축소가 자신의 고객 경제성에 영향을 주더라도 장기적으로 건강한 생태계가 더 중요하다는 입장이다 [10:36]
- OpenAI와 Anthropic이 현금을 소진하다 결국 무너질 것이라는 비관론에 반대하며, 학습을 중단하면 곧바로 상당한 이익을 낼 수 있다고 주장한다. 이는 현재 회사 전체가 이미 흑자라는 주장과는 구분된다 [11:03]
6. AI 개발 감속은 전면 중단과 기술 독점으로 이어질 위험이 있다
- 소마스는 안전 문제에 복합적인 감정을 갖고 있지만, AI가 인류의 여러 영역을 긍정적으로 바꿀 가능성에 더 큰 무게를 둔다. 우려의 대상은 실제 시행 방안이 확정된 정책보다 현재 논의되는 감속 방향이다 [12:18]
- 첫 번째 위험은 일시 정지 요구가 기술 발전 자체를 완전히 막으려는 세력에 명분을 제공하는 것이다. 그는 이를 인류가 얻을 수 있는 편익을 훼손할 위험으로 본다 [12:50]
7. 안전 규제의 전략적 이익과 통제권 상실 위험이 공존한다
- 진행자는 규제 준수와 IPO, 경쟁자의 추격 시간 확보 등 기업별 이해관계가 감속론에 작용할 가능성을 제기한다. 소마스는 대체로 동의하면서도 Dario와 Anthropic 구성원 다수는 기술의 가능성과 위험을 진지하게 믿는다고 평가한다 [14:47]
- 외부 감사는 경영진의 법적 책임을 일부 줄일 전략적 수단이 될 수 있다. 그러나 소마스는 규제를 요구하는 기업 지도자들이 이후에도 자신들이 통제권을 유지할 수 있다고 과신할 수 있다고 본다 [15:31]
8. 서구만 감속하면 중국과의 경쟁과 기술 접근권이 달라질 수 있다
- 서구가 감속하는 동안 중국이 계속 발전하는 경우, 소마스는 중국 공산당이 통제하는 초지능 AI가 일부 사람에게 자신이 우려하는 기술 종속보다 더 나쁜 결과를 낼 수 있다고 본다. 한편 터미네이터식 파국의 가능성은 매우 낮게 평가한다 [17:15]
- 중국의 현재 오픈소스 확산 전략이 영구적인 개방을 의미하지는 않는다는 해석이다. 선두에 오른 뒤 접근을 제한할 것으로 예상하지만, 해외 이용자에게 어느 정도 접근을 허용할지는 모른다고 인정한다 [18:14]
9. 수출 통제로 우위를 유지하는 전략에는 한계가 있다
- 소마스는 서구가 현재의 우위를 과신한다고 본다. 미국이 기존 전쟁에 맞춘 군사력을 갖췄더라도 새로운 드론 공격에 대응하기 어려울 수 있다는 가정을 들어, 과거의 강점이 미래의 우위를 보장하지 않는다고 주장한다 [19:10]
- 수출 통제로 경쟁자를 일정 거리 뒤에 묶어둔 채 미국만 개발 속도를 줄이는 구상은 장기적인 해법이 되기 어렵다는 입장이다 [20:06]
10. 데이터센터 반대가 좌우를 가로지르는 정치 쟁점이 됐다
- 소마스는 현재의 프런티어 감속 방향에 전반적으로 반대한다. 다만 찬반과 별개로 기술을 이해하는 업계 인사의 논의를 중시하며, 각 발언자의 이해관계도 함께 따져야 한다고 본다 [21:44]
- 좌우 모두에서 데이터센터 반대가 공통 의제로 떠오르는 상황을 우려하며, 이를 거의 전적으로 중국의 심리전이라고 주장한다. 제공된 구간에는 그 배후를 입증하는 구체적인 근거가 제시되지 않는다 [22:33]
11. 물 사용량 논쟁과 중국의 건설 속도를 연결한다
- 소마스는 데이터센터의 물·전력 사용에 관한 초기 정보에 오류가 많다고 주장한다. 단일 In-N-Out 매장이 미국 최대 데이터센터보다 물을 더 쓰고 골프장은 훨씬 더 쓴다는 비교와 폐쇄 순환식 액체 냉각을 근거로 들지만, 이 구간에는 해당 비교의 자료나 적용 범위가 없다 [23:48]
- 중국은 개발을 감속하지 않고 기가와트 단위의 발전 용량과 대형 데이터센터를 늘리고 있으며, 신규 발전의 대부분은 오염이 큰 방식이라는 주장이다. 주민 이주와 주택 철거, 순환 정전까지 감수할 수 있는 중국의 방식과 서구의 여론·반대 절차 사이에 전략적 비대칭이 있다고 본다 [24:22]
12. 미국의 넓은 토지와 에너지 자원도 규제에 묶일 수 있다
- 소마스는 미국의 장점으로 넓은 땅과 상대적으로 규제가 덜한 지역이 남아 있다는 점을 든다. 연방 토지의 90% 이상이 서부의 빈 사막이라는 취지의 수치를 언급하지만 정확한 비율은 모른다고 명시한다 [25:47]
- 인구 밀집 지역에서 멀리 떨어진 토지관리국 관할 토지에 데이터센터를 짓는 규제를 비판한다. 네바다의 지열·태양광 자원과 사막 지역의 원자력 건설 가능성을 개발 여력의 사례로 든다 [26:23]
13. 신규 발전과 전력망 연결이 전기요금을 낮출 수 있다는 주장
- 소마스는 발전 용량을 늘리면 공급 증가를 통해 가격을 낮출 수 있다고 본다. 전력회사의 예비 공급 여력이 비용에 반영돼 있으며, 데이터센터가 주택 등에 이미 배정된 전력을 가져가는 일은 불가능하다고 단정한다 [27:19]
- 현재 건설되는 데이터센터는 자체 수요 이상의 발전 용량을 동반하지만 전력망 연결이 제한돼 소비자 가격을 낮출 기회를 놓치고 있다는 주장이다. 이 구간에는 이를 모든 건설 사업에 적용할 수 있는 근거가 제시되지 않는다 [27:56]
14. 지역 반대는 대형 사업자의 증설 취소보다 입지 이동을 유도할 전망이다
- 계획된 데이터센터 중 얼마나 완공될지에 대해 소마스는 구체적인 비율을 제시하지 않는다. 주요 사업자는 지역사회가 시설을 막으면 다른 장소로 옮겨 계획한 용량을 확보할 것으로 예상한다 [28:25]
- 주요 건설·운영사는 1년 전에는 정치적 장애물을 충분히 예상하지 못했지만, 지금은 지역사회 설명과 교육에 더 많은 노력을 들이고 있다는 평가다. 이 노력이 여론을 일부 바꿀 것으로 기대한다 [28:45]
15. 우주 데이터센터의 가능성은 열어두되 단기 경제성은 유보한다
- 우주가 실질적인 대안인지 기업가치를 정당화하는 구상인지에 대해, 소마스는 처음의 성격과 이후의 결과가 달라질 수 있다고 답한다. 일론 머스크의 성공 가능성을 낮게 보지 않으며 자신은 주로 그에게 투자하는 쪽이라고 드러낸다 [29:26]
- 다만 1년 전에 물었다면 지상 건설이 더 저렴하고 쉬워 단기적으로 우주에 지을 타당한 이유를 찾지 못했을 것이라고 드러낸다. 다른 유망한 대체 기술도 있다고 언급하지만, 제공된 구간에서는 구체적인 기술이나 현재의 경제성 판단까지 설명하지 않는다 [29:47]
16. 해상 데이터센터와 우주 인프라의 서로 다른 가능성
- 협력사 Panthalasa는 해상 데이터센터를 개발하며, 바다 한가운데의 양수발전 해법을 활용한다. 우주로 나가지 않고도 데이터센터의 입지와 에너지 문제에 접근하는 대안이다 [30:01]
- 우주 데이터센터에 대한 장기적 지지는 당장의 비용 우위보다 인류의 잠재력을 실현하려면 우주 경제가 필요하다는 관점에 기반한다 [30:15]
17. 전력 효율 개선 이후에도 남는 투자와 경제성의 제약
- Positron의 목표는 전력당 연산 능력을 높이는 것이다. 엔비디아 장비로 500MW가 필요한 작업을 100MW로 처리할 수 있더라도, 시설을 100MW로 축소하기보다 확보 가능한 전력을 계속 사용해 더 많은 토큰을 생산할 것으로 예상한다 [30:47]
- 장기적으로 에너지는 발전의 제약이지만, 에너지가 존재해도 경제성이 없으면 활용되지 않는다. 발전 기술의 부족보다 향후 몇 년간 에너지와 인프라 건설에 얼마나 많은 부채를 투입할 수 있는지가 더 큰 제한이라는 판단이다 [31:25]
18. AI 기업의 부채보다 국가부채의 파급 위험을 우려하는 시각
- 국가부채와 통화 발행은 인플레이션 및 금융시스템의 연쇄 위험과 연결된다. 국채처럼 무위험으로 여겨졌던 자산의 위험 인식이 커지면 금융시스템 전반으로 영향이 번질 수 있다는 우려다 [32:41]
- Oracle의 사업모델과 실행력을 미국 정부보다 더 신뢰한다는 개인적 평가와 함께, 가장 큰 위험으로 국가부채 누적에 따른 통화가치 하락과 구체적인 위기의 발생 가능성을 꼽는다 [33:23]
19. 토큰과 시퀀스가 추론의 입력과 문맥을 구성하는 방식
- 토큰은 대규모 텍스트에서 자주 재사용되는 단위를 효율적으로 표현하도록 정한 조각이다. 접두사·접미사나 단어 일부가 하나의 토큰이 될 수 있으며, 영어 자료에서는 평균적으로 단어의 절반에서 약 75%에 해당한다고 보여준다 [35:19]
- 시퀀스는 토큰이 순서대로 모인 것으로, 모델의 문맥을 구성한다. 질문이 토큰으로 변환돼 입력되고 답변이 생성되면서 전체 시퀀스가 계속된다 [36:45]
20. KV 캐시는 반복 계산을 줄이는 대신 메모리를 요구한다
- 이미 처리한 입력과 생성된 토큰의 계산을 반복하지 않도록 키와 값 행렬을 저장하는 것이 KV 캐시의 핵심이다. 계산 결과를 재사용하는 대신 해당 데이터를 메모리에 보관해야 한다 [37:23]
- 긴 시퀀스에서 어텐션 계산 부담이 크게 증가하는 데 비해 K·V 저장량은 선형으로 증가한다는 점이 캐싱의 이점으로 드러난다. 다만 사용자별로 고유한 캐시가 필요해 보존 기간과 대규모 저장 관리가 별도의 문제가 된다 [38:32]
21. 양자화의 저장 절감 효과와 품질 손실
- 가중치·KV 캐시·활성값을 표현하는 정밀도는 FP32에서 FP16·BF16, FP8, FP4로 낮아져 왔다. 더 적은 비트로 같은 정보를 표현하면 저장 및 계산 비용이 줄지만 정보 손실이 발생한다 [39:41]
- 16비트 값을 단순히 4비트로 줄이면 해당 값들의 저장량은 75% 감소하지만, 일부 벤치마크 점수가 20~30% 나빠질 수 있다. 저장 공간 절감만으로 모델의 실용성을 판단할 수 없는 이유다 [41:02]
22. 에이전트 코딩 작업의 높은 캐시 재사용률
- KV 캐시 없이도 추론 서비스를 운영할 수 있지만 경제성과 성능은 크게 나빠진다. 특히 현재 가치가 높은 작업 중에는 이전 토큰을 반복적으로 활용하기 쉬운 작업이 많다 [43:17]
- SemiAnalysis의 AgentX 벤치마크는 여러 차례의 대화와 하위 에이전트를 포함한 Claude Code 세션을 활용한다. 해당 실제 작업 추적 자료에서는 전체 토큰의 약 96%가 캐시됐으며, 이런 작업에서는 캐시를 효율적으로 회수하는 능력이 중요해진다 [43:39]
23. 사용자 문맥이 모델 가중치보다 커질 때의 메모리 배분
- 유출 정보상 GPT-4가 1.8조 파라미터라는 전제에서 4비트 양자화를 적용하면 가중치 용량은 약 900GB가 된다. Claude Fable에 대한 10조 파라미터 예상치를 적용한 약 5TB 역시 확정 사양이 아닌 가정에 따른 예시다 [44:34]
- 대형 모델의 긴 문맥에서는 개별 세션이 약 100GB에 이를 수 있다는 예시를 든다. 이 경우 사용자 약 50명 수준의 문맥만으로도 모델 가중치에 맞먹거나 이를 넘어서는 저장 부담이 생긴다는 취지다 [45:04]
24. 계층형 저장 구조가 캐시 용량과 비용을 조정한다
- 일반적인 운영 구조에서는 가속기 메모리에 가중치와 현재 처리 중인 세션을 두고, 최근 사용했지만 활성 요청이 없는 세션은 호스트 메모리로 옮긴다. 호스트 메모리 용량은 가속기 메모리의 약 4~10배 수준이라는 예시다 [46:52]
- 더 오래 비활성 상태인 세션은 NVMe나 네트워크 연결 저장장치처럼 느리지만 용량이 큰 계층으로 이동할 수 있다. 계층화는 비싼 메모리 사용을 줄이지만, 많은 사용자의 데이터를 언제 어디에 둘지 결정하는 복잡성을 만든다 [47:41]
25. 에이전트의 업무 범위를 제한하는 문맥 용량
- 모델 크기와 사용자 수, 문맥 길이가 모두 크게 늘어날 것으로 예상한다. 문맥 길이는 2~3년 전의 8천~6만 4천 토큰 수준에서 확대돼, 이제 모델이 지원하는 범위에서는 100만 토큰이 일반적이라는 설명이다 [48:31]
- 100만 토큰도 회사 내부의 큰 코드 저장소에서는 일부만 담을 수 있다. 프로그래머 팀의 역할을 수행하는 에이전트에는 모델 자체의 능력뿐 아니라 판단에 필요한 데이터를 얼마나 문맥에 넣을 수 있는지가 핵심 제약이라는 견해다 [49:01]
26. 프런티어 모델의 성장과 기업용 소형 모델의 공존
- 프런티어 모델은 계속 커지고 개선될 여지가 있다고 본다. Positron의 내부 활용에서는 결과물의 가치가 10배가 된다면 토큰당 비용도 기꺼이 10배 지불할 수 있다는 입장이다 [49:53]
- 기업이 소형 모델을 자체 운영하려는 이유에는 비용 절감과 독점 데이터의 통제권이 있다. 대형 모델의 현장 운영은 어렵고, 대부분의 기업은 프런티어 개발에 필요한 자원을 갖추지 못한다 [50:45]
27. 기기 내 소형 모델이 클라우드 수요를 늘릴 수 있는 이유
- 휴대전화나 노트북, 기업 내부에서 실행되는 모델은 들어오는 데이터를 지속적으로 분석하고, 자체 처리할 요청과 더 뛰어난 외부 모델에 보낼 요청을 구분할 수 있다. 이런 구조에서는 로컬 처리가 클라우드 사용을 확대할 수 있다는 전망이다 [51:58]
- 사람이 직접 질문하는 빈도에는 한계가 있지만, 로컬 모델이 이메일·일정·메시지를 계속 확인하며 클라우드 모델을 호출하면 개인당 토큰 사용량이 크게 늘어날 수 있다. 기기 내 모델의 확산이 클라우드 토큰 수요를 줄인다는 예상에 대한 반론이다 [53:00]
28. 모델 확대에 대한 낙관론은 관찰된 스케일링에 기반한다
- 모델 규모가 1억에서 10억·100억·1천억·1조 파라미터로 커지는 동안 능력이 크게 향상됐고, 더 큰 규모에서도 개선이 이어진다는 관찰을 모델 확대의 근거로 삼는다 [54:05]
- 이러한 스케일링이 계속된다는 수학적 증명은 없다고 인정한다. 50조·100조 파라미터 이후에도 개선될 것이라는 낙관론은 현재까지 중단의 징후를 보지 못했다는 경험적 판단이다 [54:44]
29. Astra의 AGI 여부를 둘러싼 서로 다른 체감
- Astra를 처음 사용한 24시간의 경험을 2022년 GPT-3.5 기반 ChatGPT를 처음 접했을 때에 비견한다. 당시 수 시간 동안 질문을 이어갔던 경험과 Sora 2의 영상 품질에 대한 놀라움이 개인적 평가의 기준이 된다 [55:21]
- 공동창업자는 Astra를 AGI라고 생각하지만 이후의 발전에 대한 예측은 자신의 추측도 다른 사람과 비슷한 수준이라고 인정한다. 반면 진행자는 직접 사용해 봐도 이전 모델과 비슷하게 느꼈다며 돌파구라는 평가에 이견을 보인다 [56:51]
30. 코딩 문제 해결과 범용 도구 사용에서 체감한 개선
- 다른 모델이 해결하지 못하거나 부자연스러운 해법을 반복했던 어려운 코딩 문제 일부를 Astra가 한 번에 해결했다는 경험이다. 코드베이스에서 몰랐던 성능 개선 지점과 버그도 찾아 수정했지만, 이 영역의 개선 자체를 압도적인 수준으로 보지는 않는다 [57:19]
- 더 큰 변화로 평가하는 영역은 범용 도구를 활용하는 컴퓨터 작업이다. Blender 애니메이션의 재현 품질과 몇 장의 사진을 바탕으로 한 집 내부 디자인에서 이전 모델보다 큰 능력 차이를 체감했다 [58:19]
31. 칩 설계 전 과정 자동화의 과제와 EDA 도구의 장벽
- Positron에서 반복적으로 시험해 온 과제는 암호화 블록의 기능 명세를 Verilog로 구현하고, RTL부터 GDS까지 설계 흐름을 진행해 이론적으로 테이프아웃할 수 있는 결과에 도달하는 것이다 [59:00]
- 기존 LLM은 일부 단계나 스크립트 작성은 수행했지만 중간 과정에서 자주 실패했다. 오래된 EDA 도구의 비직관적인 사용 방식이 주요 장애물로 지적되며, 제공된 구간에서는 Astra가 이 과정을 끝까지 완수했는지 확인되지 않는다 [59:39]
32. AI가 칩 구현과 최적화에 걸리는 시간을 단축한다
- GPT6가 컴퓨터 사용과 스크립트 작성 능력을 결합해 TSMC N3 PDK를 사용하는 설계를 GDS까지 구현한 사례에서, 소요 시간은 50여 시간이었고 1GHz 이상의 타이밍을 충족했다는 설명이다. 해당 작업에 익숙하지 않은 사람이 수행한다면 기본 흐름을 구축하는 데 약 1주, 비슷한 수준으로 최적화하는 데 추가로 1~2주가 필요하다는 비교다 [1:00:12]
- 이 사례는 약 2~3주의 작업을 이틀 남짓으로 압축한 것으로 평가된다. 공개 학습 자료만으로 예상하기 어려운 수행 능력이며, OpenAI 내부의 칩 개발과 관련된 역량이 공개 모델에도 반영되는 점을 긍정적으로 본다 [1:01:05]
33. 자체 칩 개발의 확산은 비용 경쟁과 설계 다양성을 넓힌다
- 여러 기업의 자체 칩 개발은 소비자 관점에서 비용을 낮추고 성능을 높여 더 많은 사람이 기술을 이용하게 할 것으로 기대된다. 주요 기술 기업들이 반도체까지 수직 통합하는 변화도 이러한 흐름의 일부다 [1:01:34]
- 기업들의 큰 목표는 비슷하지만 구현 방식과 아키텍처는 서로 다르다. 업계의 공개 정보 공유는 5~6년 전보다 줄었어도 여전히 이어지고 있으며, Positron을 포함한 기업들이 서로 다른 설계 방향에 투자하고 시장에서 가치를 검증받을 여지가 남아 있다는 판단이다 [1:02:35]
34. 컨텍스트 확대는 장치당 메모리 용량의 제약에 부딪힌다
- 기존 어텐션 방식으로 컨텍스트를 계속 늘리면 하드웨어가 제공할 수 있는 자원이 한계가 된다. Positron은 차세대 제품의 장치당 메모리 용량을 엔비디아의 최대 메모리 제품 대비 8배로 늘릴 계획이며, 엔비디아는 메모리 시장 여건에 따라 장치당 용량을 줄이고 있다는 설명이다 [1:04:24]
- 현재 약 100만 토큰인 컨텍스트를 1,000만 토큰 이상으로 확장하는 일은 메모리 비용의 제곱 증가 때문에 매우 어렵다는 견해다. 선형·희소 어텐션은 컨텍스트 처리에 필요한 저장 공간과 연산량을 줄이는 대안으로 주목받는다 [1:04:54]
35. 어텐션 효율화는 자원 제약을 완화하지만 대가도 따른다
- 중국 모델 연구소들은 고용량 메모리와 높은 연산 성능을 가진 칩에 대한 수출 통제 속에서, 해당 자원을 덜 필요로 하는 방식으로 혁신했다는 해석이다. DeepSeek V3의 MLA는 연산을 더 수행하는 대신 KV 캐시 크기를 크게 줄이는 사례로 드러난다 [1:05:22]
- Gated DeltaNet과 파생 방식은 어텐션 부분에 쓰이는 전체 시간을 약 75% 줄일 수 있는 사례로 평가된다. 이는 어텐션 처리 시간에 관한 수치이며, 전체 모델 비용 감소와 동일한 의미는 아니다 [1:06:06]
36. 긴 컨텍스트의 가치는 실제 정보 회수 능력에 달려 있다
- 1,000만 토큰의 컨텍스트가 있다면 여러 대형 코드베이스를 함께 담아 코딩 에이전트가 서로의 정보를 연결하는 데 도움이 될 것으로 기대한다. 다만 과거 일부 모델은 100만 토큰을 지원한다고 해도 약 6만 4,000토큰을 넘으면 정보 회수 능력이 크게 떨어졌다는 경험을 들어, 최대 입력 길이와 실질적인 활용 능력을 구분한다 [1:07:34]
- RULER와 같은 장문 평가에서는 방대한 텍스트 사이에 숨긴 특정 값을 정확히 찾아내는 능력이 중요하다. 제시된 비교에서 GPT 5.6의 성공률은 약 70%, GPT6 Astra는 95% 이상이며, 긴 컨텍스트를 제대로 사용하는 능력에도 상당한 개선 여지가 있다는 근거로 쓰인다 [1:08:20]
37. 토큰 가격 하락과 모델 능력 향상을 함께 평가해야 한다
- 질문의 전제는 Silicon Data 토큰 가격 지수가 5년 전 100만 토큰당 60달러에서 최근 1달러 미만으로 낮아졌다는 것이다. 이에 대한 핵심 반론은 과거의 비싼 토큰보다 현재의 저렴한 토큰이 훨씬 유용하므로, 가격 하락만으로 경제성 변화를 설명할 수 없다는 점이다 [1:09:17]
- 가치 증가의 근거는 토큰 사용 효율보다 모델 자체의 능력 향상에 있다. 개인의 생활과 기업의 생산성에 기여하는 토큰당 가치는 과거 대비 100~1,000배 높아졌을 수 있다는 추정이며, 지능의 가치 대비 비용 개선을 단순한 60배 가격 하락보다 훨씬 크게 평가한다 [1:10:17]
38. 토큰 과금은 유지되면서 에이전트 정액제가 등장할 수 있다
- 유용한 결과당 과금으로 이동하려는 구상이 거론되지만, 결과의 가치를 일관되게 가격으로 매기기는 어렵다는 견해다. 반면 토큰 과금은 생성 원가와 마진을 계산하고 다수 고객에게 판매하기 쉬워 상당 부분 유지될 것으로 예상한다 [1:12:14]
- 미래 모델이 뛰어난 직원처럼 업무를 수행할 수 있다면, 공급자가 연간 고정 요금으로 가상 에이전트의 무제한 사용을 제공할 가능성도 있다. 연간 100만 달러는 이러한 사업 모델을 설명하기 위한 임의의 예시이며 실제 가격 전망은 아니다 [1:13:01]
39. 로컬 모델의 발전은 대형 모델의 수요를 늘릴 수 있다
- 오픈웨이트 모델로의 이동이 OpenAI와 Anthropic의 성장에 균열을 낼 가능성은 인정하지만, 오픈소스·로컬 모델의 발전이 오히려 대형 공급자의 토큰 사용량을 늘릴 가능성을 더 높게 본다 [1:13:50]
- 더 유능한 휴대전화 비서는 백그라운드에서 업무를 처리하면서, 스스로 해결하기 어려운 작업을 더 강력한 모델에 요청할 수 있다. 현재 많은 AI 애플리케이션에서는 사람이 직접 판단하고 요청을 시작해야 한다는 점이 병목이라는 분석이다 [1:14:55]
40. 데이터 서비스 기업에는 프런티어 연구소의 수직 통합이 위험 요인이다
- 데이터 서비스 기업의 장기 성장에 대한 주요 의문은 프런티어 연구소가 관련 업무를 내부화할 가능성이다. 지금까지 외부 기업을 활용한 이유는 OpenAI와 Anthropic이 자본과 인력을 투입할 더 중요한 일이 있었기 때문이라는 해석이다 [1:16:56]
- 이러한 분업이 영구적으로 유지된다고 보지는 않는다. 향후 GPT7이나 GPT8이 대규모 기업을 관리할 만큼 유능해진다는 가정 아래에서는, 연구소가 에이전트를 통해 외부 데이터 서비스 기업의 업무를 직접 수행할 가능성이 제기된다 [1:17:25]
41. AI 발전의 조건은 인간 사회의 이해관계와 경제적 유인을 맞추는 일이다
- AI 정렬 문제의 중요한 일부는 인간 사회가 좋은 결과를 위해 스스로의 목표와 유인을 맞추는 일이다. AI가 바람직한 결과를 실현하도록 하려면 기술적 정렬과 함께 사회적 협력이 필요하다는 관점이다 [1:17:48]
- 규제 체계, 에너지 생산, 데이터센터 입지에 대한 인간 사회의 합의가 부족하면 AI 정렬 연구의 성과도 제약받을 수 있다. 이러한 문제를 사람들이 분석하고 해결할 수 있는 기술적 문제처럼 다루면 더 많은 참여를 이끌 수 있을 것으로 기대한다 [1:18:33]
🧾 결론
- 제목의 두 질문에 대한 답은 조건부다. 데이터센터 완공률은 제시되지 않았고, 에너지가 단기 최대 병목이라는 진단보다 자금 조달과 경제성의 제약이 강조됐다.
- AI 인프라의 성과는 연산량뿐 아니라 메모리 용량·대역폭, 캐시 회수, 전력당 토큰 생산, 실제 작업 품질을 함께 봐야 판단할 수 있다.
- 소마스의 성장 낙관론은 모델 능력 향상과 사용량 확대에 대한 관찰·예상에 기반한다. 미래 스케일링이나 투자 회수를 보장하는 증명으로 제시되지는 않는다.
📈 투자·시사 포인트
- 데이터센터 투자에서는 발표된 용량과 실제 가동 가능 용량을 구분하고, 입지 허가·전력망 연결·발전 설비·자금 조달 조건을 함께 점검필요가 있다.
- 추론 반도체의 경쟁력은 최고 연산 성능 외에도 메모리 비용, 긴 문맥 처리, 캐시 유지 비용, 전력당 유용한 결과로 비교할 수 있다. Positron의 제품 계획은 실측 성능과 구분해야 한다.
- AI 서비스의 경제성은 토큰 가격 하락만으로 설명하기 어렵다. 캐시 비중과 할인율, 경쟁에 따른 마진 변화, 모델 능력 향상으로 늘어난 작업 가치를 함께 봐야 한다.
- 로컬 모델이 클라우드 호출을 늘릴 가능성과 프런티어 연구소가 데이터 서비스를 내부화할 가능성이 동시에 제기된다. 사용량 성장과 외부 서비스 기업의 수익 확보는 별도로 평가할 사안이다.
⚠️ 불확실하거나 확인이 필요한 부분
- 데이터센터의 실제 완공 비율과 입지 이동에 따른 지연·추가 비용은 제시되지 않았다. 지역 반대가 전체 증설을 크게 위협하지 않는다는 평가는 전망이다.
- 데이터센터 반대를 중국 심리전으로 돌리는 주장, 음식점과 데이터센터의 물 사용량 비교, 신규 시설이 자체 수요 이상의 발전 용량을 동반한다는 주장에는 제공된 구간에서 충분한 근거가 제시되지 않는다. 전기요금 하락 효과도 사업별 검증이 필요하다.
- 캐시 처리 비용이 재계산의 약 1,000분의 1이라는 설명은 규모 차이를 강조한 추정이다. Anthropic의 약 80% 매출총이익률은 인용된 보도이며, AgentX의 약 96% 캐시 비중은 해당 작업 추적 자료의 결과다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 관심 데이터센터 사업별로 발표 용량, 허가 상태, 전력망 연결 일정, 발전 계획, 자금 조달 조건을 나눠 확인한다.
- AI 기업의 추론 매출·원가와 학습 지출을 분리하고, 캐시 사용 비중과 가격 인하가 마진에 미치는 영향을 비교한다.
- 추론 하드웨어를 같은 모델·품질·지연시간 조건에서 비교하고, 메모리 용량과 전력당 토큰 생산량을 함께 기록한다.
- 긴 컨텍스트와 양자화는 실제 업무 데이터로 정보 회수 정확도, 결과 품질, 비용을 함께 평가한다.
❓ 열린 질문
- 입지 이동으로 확보할 수 있는 용량은 얼마나 되며, 추가 비용과 지연을 감수해도 사업성이 유지될까?
- 전력 효율 개선으로 늘어난 토큰 생산이 실제 유료 수요와 투자 회수로 얼마나 연결될까?
- 긴 문맥의 실질적 활용 능력은 메모리 비용과 저장 관리 부담보다 빠르게 개선될까?