천재 개발자의 경고 메모리 1만배 필요합니다 (엑시나 김진영 대표) (1부)
Quick Summary
엑시나 김진영 대표의 ‘메모리 1만 배’ 경고는 AI 수요의 네 요인이 각각 10배 커지는 조건부 시나리오로, 메모리 확장·공유와 데이터 이동 절감의 필요성을 강조한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
엑시나 김진영 대표의 ‘메모리 1만 배’ 경고는 AI 수요의 네 요인이 각각 10배 커지는 조건부 시나리오로, 메모리 확장·공유와 데이터 이동 절감의 필요성을 강조한다.
📌 핵심 요점
- 메모리 수요는 여러 요인이 함께 키운다. 모델 크기·사용자 수·컨텍스트 길이·에이전트 수가 곱하기로 작용한다는 설명이다. 각각 10배 증가하면 데이터 규모가 1만 배가 된다는 예시이며, 증가 시점이나 확정 수요를 제시한 것은 아니다.
- KV 캐시는 연산을 줄이는 대신 메모리를 요구한다. 계산 결과를 보관해 GPU의 반복 연산을 줄이지만, 긴 대화와 캐시 재사용이 늘수록 저장 용량도 커진다. 공간·발열·수율 제약이 있는 HBM만으로 이를 감당하기 어려워 메모리 계층화가 중요해진다.
- CXL은 메모리를 확장하고 함께 쓰려는 접근이다. 서버마다 데이터를 복사하고 여유 용량을 확보하는 방식에서 벗어나, 공용 메모리 풀을 필요에 따라 활용하는 구조를 지향한다. 메모리 부족 때문에 GPU 서버 전체를 증설하는 비용도 줄일 수 있다는 설명이다.
- 엑시나는 용량 확장에 메모리 근처 연산을 결합한다. 카드당 최대 2TB 메모리와 수천 개의 소형 RISC-V 코어를 구성하고, 단순·대량 작업을 메모리 근처에서 처리해 전송량을 줄이려 한다. SSD 용량을 메모리처럼 제공하는 ‘인피닛 메모리’도 차별점으로 제시한다.
- 기술적 가능성과 실제 성과는 구분해야 한다. 칩 제작과 공동 검증이 진행 중이라는 설명은 있지만, 서버 열 대의 일을 한 대로 처리하는 약 10배 효율은 목표다. 활용률 개선과 자원 절감 효과도 응용별 실제 배포에서 확인해야 한다.
🧩 배경과 문제 정의
- AI는 축적된 데이터에서 가치를 찾아내는 동시에 새로운 데이터와 중간 계산 결과를 만든다. 모델·사용자·입력 길이·에이전트 수가 함께 늘면서 메모리 수요가 급증한다.
- GPU 연산을 줄이기 위해 계산 결과를 저장하면 메모리 용량이 더 필요해진다. HBM은 높은 대역폭을 제공하지만 공간·발열·수율 때문에 용량 확장에 제약이 있다.
- 서버 사이에서 데이터를 복사하는 기존 확장 방식은 전송 지연과 중복 저장을 낳는다. CXL의 핵심 과제는 메모리를 유연하게 확장하고 공유해 이러한 비효율을 줄이는 것이다.
- 메모리 효율이 개선되더라도 수요와 공급의 격차가 커서 메모리의 중요성이 쉽게 줄어들지는 않을 것이라는 전망이 전제된다.
🕒 시간순 섹션별 상세정리
1. SSD 개발 경험에서 발견한 CXL의 사업 기회
- 김진영 대표는 컴퓨터공학을 전공하고 삼성에서 메모리 솔루션과 엔터프라이즈 SSD 개발을 경험했다. 새로운 저장 기술이 빠르게 확산되는 과정에서 메모리 분야의 새로운 사업 가능성을 발견했다 [01:29]
- 차세대 아키텍처를 담당하면서 CXL을 접했고, SSD 이상의 기회가 될 수 있다고 판단해 창업을 결심했다 [02:18]
2. 빅데이터의 수익화가 메모리 투자를 확대한다
- 클라우드 시대에는 데이터 축적이 확대됐지만, 빅데이터를 어떻게 수익으로 연결할지가 과제로 남았다. AI는 축적된 데이터에서 가치와 수익 기회를 찾아내는 도구로 자리 잡았다 [04:22]
- 데이터로 돈을 벌 수 있다는 기대는 더 많은 저장과 연산을 유도한다. GPU뿐 아니라 기존 데이터와 새롭게 생성되는 데이터를 담을 메모리의 중요성도 커진다 [05:09]
3. 네 가지 수요 요인이 곱해지는 메모리 증가
- 모델 크기와 사용자 수가 증가하는 가운데 책 전체나 프로젝트 코드처럼 큰 자료를 입력하는 사용 방식이 확산되면서 컨텍스트 길이도 커지고 있다 [06:34]
- 에이전틱 AI는 여러 모델과 에이전트를 활용해 더 정교한 결과를 얻으려 한다. 모델 크기·사용자 수·컨텍스트 길이·에이전트 수가 동시에 데이터 수요를 키운다 [07:34]
4. AI 수요 증가를 따라가기 어려운 반도체 발전 속도
- 과거에는 무어의 법칙에 따라 컴퓨터 성능이 대략 18개월에서 2년마다 두 배씩 발전했다. 기존 CPU가 개선되기를 기다리는 것만으로도 상당한 성능 향상을 얻을 수 있었다 [08:53]
- AI 데이터가 매년 10배씩 증가한다고 가정하면 기존 반도체 발전 속도로 이를 따라잡기 어렵다. 이러한 수급 격차가 메모리 가격 급등의 배경이라는 판단이다 [09:24]
5. KV 캐시는 GPU 재계산을 메모리 저장으로 바꾼다
- KV 캐시는 GPU가 한 번 계산한 결과를 저장해 같은 계산을 반복하지 않도록 한다. 다음 토큰을 처리할 때 이전 토큰과 관련된 계산 결과를 참조하는 방식이다 [11:13]
- 비싼 GPU로 다시 연산하는 대신 메모리에 저장한 결과를 가져오면 연산 비용과 시간을 줄일 수 있다. 재사용할 결과를 많이 보관할수록 필요한 메모리 용량도 커진다 [12:00]
6. 계산 결과를 오래 보관할수록 커지는 추론 메모리 수요
- 긴 대화에서 이전 내용을 활용하는 사례처럼, 저장된 계산 결과를 참조하면 응답에 필요한 반복 작업을 줄일 수 있다 [12:36]
- 몇 초나 몇 분 전뿐 아니라 하루 전 계산도 다시 하지 않고 활용할 수 있다면 인프라 효율을 높일 수 있다. 추론 서비스가 확대될수록 캐시를 보관할 메모리가 중요해지는 이유다 [13:13]
7. HBM의 높은 대역폭과 용량 확장의 물리적 한계
- HBM은 GPU 가까이에서 높은 대역폭으로 데이터를 주고받는 메모리다. 최근 GPU 발전에서 HBM의 대역폭과 용량 확대가 중요한 역할을 한다 [14:08]
- GPU와 같은 패키지 안에 들어가므로 공간이 제한되며, 적층을 늘리는 데에도 발열과 수율 문제가 따른다. 결함이 생기면 GPU까지 폐기해야 하는 상황이 발생할 수 있다는 설명이다 [14:47]
8. HBM·일반 메모리·SSD를 나누어 쓰는 계층화
- HBM의 용량 한계 때문에 GPU는 외부 메모리와 다른 서버의 메모리까지 활용한다. 연결 방식에는 네트워크를 통한 복사와 CXL을 통한 연결 등이 있다 [16:15]
- 급하고 자주 쓰는 데이터는 HBM에, 덜 자주 쓰는 데이터는 외부 메모리에, 더 드물게 쓰는 데이터는 SSD에 두는 계층화가 중요해진다. 대규모 인프라 기업들은 이러한 배치를 정교하게 만드는 데 집중하고 있다 [16:49]
9. 네트워크 기반 공유가 만드는 복사와 전송 병목
- 기존 네트워크 기반 확장은 한 서버의 데이터를 다른 서버로 복사해 전달하는 방식이다. 공유라고 부르지만 같은 데이터의 사본이 여러 서버에 존재하게 된다 [18:41]
- 데이터를 옮기는 데 시간이 들고, 같은 내용을 두 벌이나 세 벌씩 저장해야 할 수 있다. 원래 서버도 데이터를 다시 쓸 수 있어 전송 후 무조건 삭제하기도 어렵다 [19:46]
10. CXL 메모리 풀로 확장성과 공동 활용을 높인다
- CXL의 첫 번째 가치는 메모리를 더 많이 연결해 유연하게 확장할 수 있도록 하는 것이다 [20:25]
- 큰 메모리 풀을 구성하면 여러 서버가 서버 간 사본을 주고받는 대신 필요한 데이터를 해당 풀에서 읽을 수 있다. 각 시스템이 공유 메모리를 자기 메모리처럼 바라보는 구조다 [20:45]
11. 공유 메모리를 가능하게 하는 일관성과 접근 제어
- 여러 서버가 메모리를 공유하려면 데이터가 바뀌었을 때 그 변경을 함께 파악할 수 있어야 한다. 물리적으로 분리된 서버와 메모리 사이에서 이를 처리하는 데 기반 기술이 필요하다 [21:54]
- CXL은 코히어런스, 즉 데이터 일관성을 위한 기반 기술을 바탕으로 여러 서버의 메모리 공유를 지원한다는 설명이다 [22:25]
12. 메모리 부족 때문에 GPU 서버까지 늘리는 비용을 줄인다
- 네트워크로 먼 서버의 데이터를 가져오는 동안 GPU에 대기가 발생할 수 있다. 서버마다 캐시 사본을 유지해야 하는 부담도 남는다 [23:34]
- 사용자가 늘면 실제로는 메모리만 추가하면 되는 경우에도 GPU 서버 전체를 증설해야 할 수 있다. 이처럼 연산 자원과 메모리가 묶인 구조가 비용 증가 요인이 된다 [24:06]
13. 스토리지 공유보다 까다로운 메모리 연결 조건
- 스토리지에는 원래 공유 개념이 있었지만, 메모리는 CPU 옆에 있어야 한다는 제약이 강했다. CXL은 이러한 제약을 넘으려는 오랜 기술적 노력의 결과로 드러난다 [25:12]
- 스토리지는 더 느린 계층이며 비교적 큰 데이터 단위로 공유할 수 있다. 메모리는 훨씬 작은 단위의 접근과 공유를 지원해야 하므로 연결 표준에 요구되는 조건이 다르다 [26:29]
14. 표준 발표와 본격적인 제품 상용화 사이의 시간차
- CXL 표준은 2019년에 처음 나왔고, 초기 지원 제품은 2023~2024년쯤 등장했다. 초기 제품은 거의 시제품 수준이었다는 평가다 [27:25]
- 본격적인 상용화 수준의 CXL 3점대 지원 제품은 영상 시점의 올해 말과 내년 초부터 나올 것으로 전망한다. 표준이 실제 제품으로 이어지는 데 시간이 필요했던 점이 낮은 대중적 인지도의 배경이다 [27:42]
15. 클라우드의 과잉 확보와 유휴 메모리 문제
- 클라우드 사업자는 고객이 메모리를 얼마나 빌릴지 정확히 알기 어려워 서버에 거의 최대 용량을 장착한다. 예상 수요에 대비해 자원을 넉넉히 확보하는 오버프로비저닝이다 [29:04]
- 예시에서는 고객이 서버 메모리의 약 70%를 빌리고 나머지 30%가 유휴 용량으로 남는다. 추가 임대 가능성에 대비해야 하므로 이 여유분을 없애기도 어렵다 [29:38]
16. 여유분 확보로 낮아진 메모리 활용률과 동적 공유
- 고객은 불확실한 수요에 대비해 필요한 양의 약 두 배를 빌리며, 조사 결과로는 빌린 메모리의 절반이 사용 기간 내내 한 번도 접근되지 않는다. 전체 메모리의 70%가 임대되고 그중 절반만 사용된다는 계산에서는 실제 활용률이 35%에 그친다 [30:36]
- 공유 메모리는 서버별 필요량에 따라 몇 시간 단위로 할당량을 줄이거나 늘릴 수 있다. 공용 용량을 활용하고 부족할 때 메모리를 추가하면 서버마다 여유분을 따로 확보하는 비효율을 줄일 수 있다 [31:16]
17. 오래된 D램 재사용과 활용률 개선의 경제성
- 메모리는 CPU 등 다른 부품보다 수명이 길어, 5~7년 뒤 폐기하는 서버에서도 재사용 여지가 있다. 기존 시스템에 직접 장착하기 어려운 구형 D램을 CXL로 활용하는 시장은 이미 수백만 대 규모로 쓰이고 있거나 앞으로 쓰일 것이라는 추정이다 [32:15]
- CXL 공유로 활용률을 35%에서 70~80% 이상으로 높일 수 있다는 전망이다. 이 수준을 달성한다면 메모리 관점에서는 같은 수요를 감당하는 설비 투자를 절반 정도로 줄일 가능성이 있다 [32:53]
18. 데이터 한 벌을 여러 서버가 참조하는 공유 구조
- 여러 서버가 접근할 수 있는 공통 공간에 KV 캐시를 두면, 다섯 서버가 각각 복사본을 보유하는 대신 한 벌의 데이터를 함께 참조할 수 있다. 서버 간 데이터 공유에 필요한 중복 복사를 줄이는 구조다 [34:40]
- 공유 공간에서 서로 다른 작업의 데이터가 뒤섞이지 않도록 관리하는 메커니즘이 필요하다. 소프트웨어와 일부 하드웨어 지원으로 충돌을 방지하며, 여러 서버가 같은 공간에 접근하도록 만드는 것 자체도 핵심 기술 난제다 [35:51]
19. 데이터 이동 비용이 바꾸는 컴퓨팅의 중심
- 여러 클라우드를 연결해 하나의 서비스를 구성하면 클라우드 사이에서 데이터를 계속 복사해야 한다. 데이터가 커질수록 복사 비용이 증가하므로, 데이터를 한곳에 모으고 서비스를 그 주변에 배치하는 ‘데이터 그래비티’가 강해진다 [37:06]
- 하드웨어에서도 간단한 연산이나 일부 결과를 얻으려고 거대한 데이터를 CPU·GPU로 모두 보내는 방식에 한계가 생긴다. 데이터와 메모리를 중심에 두고 연산 자원을 가까이 배치하면 이동량을 줄이고 인프라 효율을 높일 수 있다 [38:54]
20. 필요한 데이터만 보내는 니어 데이터 프로세싱
- 단순한 CXL 메모리 확장은 데이터를 CPU·GPU로 옮긴 뒤 처리한다. 니어 데이터 프로세싱은 메모리 근처에서 필요한 데이터를 먼저 걸러내고 결과를 보내므로 전송량 자체를 줄인다 [39:40]
- HBM의 넓은 대역폭이 필요한 이유도 많은 데이터를 보내야 하기 때문이다. 메모리 쪽에서 CPU가 하던 일의 일부를 처리하고 필요한 것만 전송하면 데이터 이동 부담을 낮출 수 있다 [40:17]
21. 단순·대량 연산을 메모리 근처로 옮기는 효과
- 소비 상위 10% 사용자의 금요일 저녁 강남 소비 패턴을 분석하는 예에서는 전체 신용카드 거래 데이터를 옮길 필요가 없다. 소비 수준과 지역 등으로 대상을 추리는 작업은 비교적 간단한 비교 연산으로 처리할 수 있다 [41:08]
- 이런 단순 작업을 비싼 CPU·GPU에서 처리하면 연산 자원의 대부분이 놀 수 있다. 메모리 근처에서 먼저 처리한 결과만 보내면 CPU·GPU가 더 가치 있는 연산에 집중할 수 있다 [41:41]
22. 칩 제작과 검증 단계에 들어간 CXL 제품
- 엑시나의 CXL 메모리 확장 칩은 이미 제작됐으며, 촬영 시점 기준 올해 초부터 CPU·GPU 업체들과 공동 검증을 진행 중이다. 일부 미국 하이퍼스케일러와도 협업하고 있지만 구체적인 업체명은 공개되지 않았다 [43:54]
- 제품은 중앙의 칩과 D램 장착부로 구성되며, D램을 최대 여덟 개까지 장착하도록 설계됐다. 삼성·SK하이닉스·마이크론의 메모리를 장착하고 서버와 CXL로 연결하는 구조다 [44:45]
23. 카드당 2TB 확장과 수천 개 코어의 결합
- 카드 하나에 최대 2TB의 메모리를 장착할 수 있으며, 직접 설계한 소형 RISC-V 코어 수천 개를 통합해 메모리 근처에서 연산하도록 했다 [45:24]
- 서버에 카드를 여러 개 장착하면 더 큰 메모리 풀을 구성할 수 있다. 메모리 용량 확장과 데이터 처리 기능을 함께 늘리는 방식이다 [45:44]
24. SSD 용량을 메모리처럼 제공하는 인피닛 메모리
- 디바이스 뒤에 SSD를 연결하고 그 용량을 CPU·GPU에 메모리처럼 보여주는 기능을 ‘인피닛 메모리’라고 부른다. SSD가 D램보다 수백~천 배 규모의 용량을 제공한다는 설명을 바탕으로 확장성을 강조한다 [46:12]
- D램과 SSD의 데이터를 정교하게 관리해야 하는 부담을 하드웨어와 소프트웨어의 결합으로 처리한다. 이 구조로 고객이 훨씬 큰 KV 캐시를 확보할 수 있다는 점이 메모리 근처 연산과 함께 주요 차별점이다 [47:00]
25. 서버 열 대의 일을 한 대로 처리하려는 목표와 검증 과제
- CXL을 통한 메모리 활용률 개선과 구형 D램 재사용에 더해, 메모리 풀 내부에서 연산까지 처리하면 별도의 연산 장치 수요를 줄일 수 있다. 전통적인 서버 열 대가 하던 일을 한 대로 수행하게 만드는 것이 목표다 [48:13]
- SSD로 확대한 데이터 공간에서 수천 개 코어가 단순·대량 처리를 맡고, CPU·GPU는 더 가치 있는 작업에 집중하는 분업을 지향한다. 여러 효과를 합친 약 열 배 효율은 달성 실적이 아니라 목표이며, 응용에 따라 두세 배 수준일 수도 있다 [49:43]
26. 경쟁사와 구분되는 다수 코어·SSD 확장 전략
- 대표적인 CXL 메모리 확장 경쟁사는 마벨과 아스테라랩스다. 엑시나는 폭넓은 제품군보다 메모리 솔루션에 집중하며, 메모리 근처 연산과 SSD 용량의 메모리화를 차별점으로 삼는다 [51:33]
- 가장 유사한 경쟁사로 꼽은 마벨은 공개된 정보상 ARM 코어 16개를 사용한다. 엑시나는 개별 코어의 복잡한 처리 능력보다 수천 개 코어로 단순 작업을 병렬 처리하는 구성이 메모리 근처에서 유리하다고 판단한다 [52:29]
27. 소프트웨어 최적화와 광통신의 역할
- 소프트웨어 중심 접근은 유연성이 장점이지만, 성능·지연시간·확장성의 효율을 높이기 어렵다는 판단이다. 엑시나는 하드웨어와 소프트웨어를 함께 설계해 순수 소프트웨어 방식보다 높은 효율과 확장성을 확보하려 한다 [54:17]
- 광통신은 더 먼 거리에서 높은 대역폭으로 접근하기 위한 기술이며, 해결할 과제가 남아 있어 시간이 더 필요하다는 전망이다. CXL과 엑시나의 기술도 광통신 연결 너머에 배치할 수 있어 서로 결합 가능한 관계다 [54:56]
28. 기존 서버 인프라를 활용하는 도입 경로
- 기존 인프라를 활용할 수 있어 촬영 시점 기준 내년부터 새로 투자되는 서버에도 적용할 수 있다는 설명이다. 실제 대규모 고객의 도입은 구매 후 평가를 거쳐 배포하는 단계로 진행된다 [55:53]
- 서버에서는 카드를 장착하는 자연스러운 확장 방식으로 사용할 수 있다는 점을 강조한다. 이 기술의 위치는 먼 미래의 구상보다 현재 적용 가능한 메모리 확장·공유 기술에 가깝다 [56:08]
🧾 결론
- AI 인프라에서는 연산 성능과 함께 계산 결과를 얼마나 저장하고 재사용할 수 있는지가 중요해진다.
- HBM·일반 메모리·SSD를 사용 빈도에 맞춰 배치하고, CXL로 확장·공유하는 구조가 용량과 비용 문제에 대한 해법으로 제시된다.
- 엑시나의 전략은 메모리 용량 확대와 데이터 이동 절감을 함께 추구하는 것이며, 최종 경쟁력은 고객 환경의 성능·지연시간·비용으로 검증해야 한다.
📈 투자·시사 포인트
- AI 메모리의 활용 범위는 HBM뿐 아니라 DDR·SSD와 연결·관리 기술까지 넓어질 수 있다. 다만 활용 확대가 곧바로 개별 기업의 수익 증가를 뜻하지는 않는다.
- CXL 관련 사업은 표준 지원 제품의 출시, 고객 평가, 실제 배포를 구분해 살펴볼 필요가 있다. 영상의 상용화 일정은 촬영 시점에 상대적인 전망이다.
- 메모리 활용률 개선은 동일 수요를 처리하는 설비 부담을 낮출 가능성이 있다. 수요 증가가 효율 개선을 상쇄할 것이라는 주장은 영상의 전망으로 구분해야 한다.
- 엑시나의 차별화 주장을 평가할 때는 다수 코어와 SSD 확장이 실제 작업에서 줄이는 데이터 이동량·서버 수·총비용을 확인하는 것이 핵심이다.
⚠️ 불확실하거나 확인이 필요한 부분
- ‘1만 배’는 네 수요 요인이 각각 10배 증가한다는 조건부 계산이다. AI 데이터의 연간 10배 증가 역시 가정이며, 확정된 시장 전망치로 읽어서는 안 된다.
- 활용률 35%는 임대율 70%와 임대 용량의 절반 사용을 결합한 계산이다. 관련 조사 출처·대상·측정 조건은 제공된 자료에서 확인되지 않으며, 70~80% 이상으로의 개선도 전망이다.
- 약 10배 효율은 달성 실적이 아닌 목표다. 약 두 배 효율이나 절반 수준의 자원 절감 가능성도 응용별 차이와 배포 검증이 전제된다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 메모리 1만 배, 활용률 35%, 약 10배 효율을 각각 조건부 예시·계산·목표로 구분해 기록한다.
- 영상 촬영 시점을 확인하고 CXL 지원 제품의 출시, 공동 검증, 고객 배포 현황을 각각 확인한다.
- 실제 작업 기준으로 처리량·응답 지연·GPU 대기·메모리 사용량·서버 수·총비용을 비교한 자료를 확인한다.
- HBM·DDR·SSD의 데이터 배치와 KV 캐시 재사용 조건을 확인해, 어떤 작업에서 확장과 공유가 유리한지 구분한다.
❓ 열린 질문
- 모델·사용자·컨텍스트·에이전트의 증가와 메모리 효율 개선이 함께 진행될 때, 실제 메모리 수요는 얼마나 빠르게 늘어날까?
- CXL 공유와 SSD 확장이 어떤 응용에서 지연시간 부담보다 큰 비용 절감 효과를 낼까?
- 수천 개 코어를 활용한 메모리 근처 연산이 가장 효과적인 작업은 무엇이며, 실제 고객 배포에서 어느 정도 성과를 보일까?