YouTube안될공학 - IT 테크 신기술·2026년 8월 11일·1

AI 때문에 아이폰 용량 더 커진다? 애플, DRAM 아닌 NAND를 활용한 접근 분석

Quick Summary

AFM3는 대형 AI 모델을 NAND에 저장하고 필요한 가중치만 DRAM으로 불러오는 방식으로, 온디바이스 AI 성능을 확보하는 동시에 아이폰 용량 확대와 새로운 메모리 계층화를 촉진할 가능성이 있다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

AI 때문에 아이폰 용량 더 커진다? 애플, DRAM 아닌 NAND를 활용한 접근 분석 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

AI 때문에 아이폰 용량 더 커진다? 애플, DRAM 아닌 NAND를 활용한 접근 분석의 핵심 내용을 4단계로 요약한 인포그래픽
AI 때문에 아이폰 용량 더 커진다? 애플, DRAM 아닌 NAND를 활용한 접근 분석 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

AFM3는 대형 AI 모델을 NAND에 저장하고 필요한 가중치만 DRAM으로 불러오는 방식으로, 온디바이스 AI 성능을 확보하는 동시에 아이폰 용량 확대와 새로운 메모리 계층화를 촉진할 가능성이 있다.

📌 핵심 요점

  1. AI 데이터센터가 DRAM과 NAND를 대규모로 확보하면서 모바일 메모리 가격과 스마트폰 제조 원가도 압박받고 있다. 영상은 모바일용 LPDDR5X 가격이 올해 2분기에 전분기 대비 약 78~83% 상승했다고 설명한다.
  2. AFM3 Core Advanced는 전체 약 200억 파라미터를 항상 DRAM에 올리지 않고, 요청에 따라 약 10억~40억 파라미터만 활성화한다. 전체 모델은 NAND에 보관하고 현재 필요한 전문가 가중치만 DRAM으로 옮기는 구조다.
  3. IFP는 질문을 먼저 분석해 필요한 가중치를 한 번 불러온 뒤 생성 중에는 DRAM에 유지한다. 영상에 소개된 실험에서는 약 90억 파라미터 중 질문별로 약 30억 개를 선택한 모델이 일반적인 30억 밀집 모델과 비슷한 첫 토큰 지연시간을 유지하면서 수학·코딩 성능은 5~8포인트 높았다.
  4. 저비트 양자화는 NAND와 DRAM의 용량 부담을 낮춘다. 30억 파라미터 가중치는 16비트에서 약 6GB지만 2비트에서는 이론적으로 약 0.75GB까지 줄일 수 있으며, AFM3는 QAT를 활용해 낮은 비트에서도 품질을 유지하는 방향을 취한다.
  5. 온디바이스 AI가 언어·음성·이미지 모델과 처리 캐시를 로컬에 저장하면 스마트폰의 기본 저장 용량도 커질 수 있다. 이 과정에서 DRAM·HBM은 활성 가중치와 KV 캐시를 빠르게 처리하고, NAND·HBF·zNAND-O는 전체 모델과 대용량 데이터를 보관·공급하는 계층으로 역할이 나뉜다.

🧩 배경과 문제 정의

  • AI 데이터센터가 DRAM과 NAND 수요를 끌어올리는 가운데, 스마트폰도 온디바이스 AI를 위해 더 많은 메모리와 저장 공간을 필요로 한다.
  • 애플 AFM3는 전체 AI 모델을 DRAM에 상주시킬 수 없는 한계를 해결하기 위해 NAND에 모델을 보관하고 필요한 가중치만 DRAM으로 불러온다.
  • 이 구조는 아이폰의 기본 저장 용량과 원가뿐 아니라, DRAM·NAND·HBM·HBF가 역할을 분담하는 AI 메모리 계층의 변화와 연결된다.

🕒 시간순 섹션별 상세정리

  1. AI 수요가 모바일 메모리 원가를 압박
  • AI 데이터센터의 대규모 DRAM·NAND 확보로 모바일용 LPDDR5X 가격이 올해 2분기에 전분기 대비 약 78~83% 올랐고, 애플도 메모리와 저장장치의 원가 상승을 전부 흡수하기 어려운 상황에 놓였다. [00:26]
  • 애플이 중국 내 생산을 위해 세계 DRAM 점유율 약 7%까지 성장한 CXMT와 조달을 논의한다는 보도도 나오면서 공급망 다변화의 필요성이 커졌다. [00:42]
  • AFM3 Core는 약 30억 파라미터의 밀집 모델이고, AFM3 Core Advanced는 전체 200억 파라미터 가운데 요청별로 약 10억~40억 파라미터만 활성화한다. [01:16]
  • 스마트폰에는 수십 GB의 DRAM을 무작정 탑재하기 어려워, 200억 파라미터 전체는 NAND에 보관하고 현재 선택된 전문가 가중치만 DRAM으로 옮긴다. [02:45]
  1. IFP로 NAND와 DRAM 사이의 이동을 축소
  • NAND에서 토큰마다 새로운 전문가 가중치를 읽으면 계산보다 데이터 대기가 병목이 되므로, IFP는 질문을 먼저 분석해 필요한 부분을 한 번 불러오고 생성 중에는 DRAM에 유지해 재사용한다. [03:15]
  • 90억 파라미터 모델에서 질문별로 약 30억 개만 선택한 실험은 일반적인 30억 밀집 모델보다 수학·코딩 성능이 5~8포인트 높았고, 첫 토큰 지연시간은 30억 모델과 비슷한 수준을 유지했다. [03:46]
  • AI 가중치는 한 번 기록한 뒤 반복해서 읽는 데이터라 NAND와 잘 맞지만, 같은 영역을 지나치게 많이 읽으면 주변 셀의 문턱전압이 변해 읽기 교란 오류가 커질 수 있다. [04:36]
  • IFP의 직접적인 목적은 느린 NAND와 DRAM 사이의 데이터 이동을 줄이는 것이며, 불러온 가중치를 DRAM에 유지하는 방식은 반복적인 NAND 읽기도 함께 줄이는 방향으로 작용한다. [04:59]
  1. 온디바이스 AI가 스마트폰 저장 용량을 확대
  • 현재 애플 인텔리전스가 공식적으로 요구하는 저장 공간은 약 7GB이며, 기능을 켜면 온디바이스 모델이 내려받아지고 끄면 해당 모델이 기기에서 제거된다. [07:04]
  • 2026년 플래그십 스마트폰에서는 언어·음성·이미지 모델과 처리 캐시를 포함한 로컬 AI 데이터가 약 40~60GB의 시스템 저장 공간을 사용할 수 있다는 추산이 나온다. [07:19]
  1. 기기당 작은 증설이 거대한 NAND 수요로 전환
  • 연간 약 2억 4천만 대 규모의 아이폰에서 기기당 평균 NAND 탑재량이 64GB만 늘어나도 추가 수요는 약 15.4엑사바이트에 달해, 한 단계의 용량 상향이 NAND 시장 전체에 큰 영향을 준다. [08:54]
  • PC에서도 온디바이스 모델뿐 아니라 마이크로소프트 리콜처럼 사용자가 본 화면을 로컬에 저장하는 기능이 등장하면서, AI 저장 수요가 모델 파일에서 지속적으로 축적되는 사용자 데이터까지 넓어진다. [09:20]
  1. DRAM과 NAND가 분업하는 AI 메모리 계층
  • HBF는 HBM의 고성능과 SSD의 대용량 사이를 메우며, 기존 NAND보다 높은 대역폭으로 AI 추론용 모델과 데이터를 공급하는 새로운 메모리 계층을 목표로 한다. [11:00]
  • 데이터센터의 HBF·zNAND-O와 스마트폰의 AFM3는 대용량 모델을 NAND 계층에 두고 필요한 부분만 빠른 메모리로 올린다는 공통 방향을 가지며, 엣지 기기에서도 NAND가 모델 실행 과정에 직접 참여하기 시작했다. [11:59]
  1. 계산 중인 데이터와 전체 지능의 저장 위치
  • AFM3에서 주목할 핵심은 200억 개라는 파라미터 수 자체보다, AI가 커질수록 DRAM과 NAND의 역할을 어떻게 나눌지가 중요해진다는 점이다. [12:31]
  • 당장 계산하는 가중치와 KV 캐시는 빠른 읽기·쓰기가 필요하므로 스마트폰·PC에서는 DRAM, AI 서버에서는 HBM 같은 고대역폭 메모리가 필요하다. [12:43]
  • 수십억·수백억 파라미터의 모델 전체를 값비싼 DRAM에 계속 올려둘 수 없고, 현재 계산하지 않는 부분까지 보관할 대용량 공간이 필요하다. [12:58]
  1. 계산 능력과 함께 봐야 할 기억의 용량
  • 앞으로 AI 메모리를 평가할 때는 계산 속도뿐 아니라 지능 전체를 어디에 보관할지도 함께 살펴봐야 한다. [13:28]
  • 생각하는 순간의 데이터를 빠르게 붙잡는 DRAM과 거대한 모델·데이터를 계속 기억하는 NAND가 모두 필요하며, 더 많은 지능에는 더 큰 계산 능력과 저장 공간이 함께 요구된다. [13:42]
  • 이 관점에서 다음 아이폰이 출시되면 저장 용량이 어떻게 달라지는지를 먼저 확인해 보겠다는 말로 결론을 맺는다. [13:57]

🧾 결론

  • AFM3의 핵심은 NAND를 단순한 파일 저장소가 아니라 AI 모델 실행에 직접 참여하는 메모리 계층으로 활용하는 데 있다.
  • IFP와 저비트 양자화를 결합하면 제한된 모바일 DRAM 안에서도 더 큰 모델을 구동할 수 있지만, NAND 대역폭과 지연시간은 여전히 중요한 제약이다.
  • 온디바이스 AI가 확대될수록 스마트폰 저장 공간은 사진·영상 보관뿐 아니라 모델 가중치와 처리 캐시를 위한 자원으로도 사용된다.
  • 따라서 아이폰의 기본 용량 상향 가능성은 단순한 제품 사양 변화가 아니라 AI 모델 구조, 메모리 원가, NAND 생산 경제성이 함께 작용한 결과로 해석할 수 있다.
  • 다만 2026년 플래그십의 AI 데이터가 40~60GB를 차지한다는 수치는 영상에서 소개한 추산이며, 실제 제품별 모델 구성과 운영체제 정책에 따라 달라질 수 있다.

📈 투자·시사 포인트

  • 스마트폰 한 대의 NAND 탑재량이 소폭 증가해도 전체 출하량과 결합하면 큰 수요가 된다. 영상은 연간 약 2억 4천만 대의 아이폰에서 평균 탑재량이 64GB 늘어날 경우 추가 NAND 수요가 약 15.4엑사바이트에 이를 수 있다고 설명한다.
  • 256GB 기본 용량 전환이 확산되면 NAND 총수요뿐 아니라 고용량 제품 비중과 스마트폰 원가 구조도 달라질 수 있다.
  • NAND가 AI 추론 과정에 직접 참여하기 시작하면 용량 외에도 읽기 대역폭, 지연시간, 전력 효율, 읽기 교란 관리가 제품 경쟁력의 주요 기준이 될 수 있다.
  • HBF와 zNAND-O는 HBM과 일반 SSD 사이의 성능·용량 간극을 메우려는 방향으로 제시된다. 관련 업체를 평가할 때는 발표된 개념뿐 아니라 양산 일정, 고객 채택, 실제 대역폭과 원가를 함께 확인해야 한다.
  • AFM3가 NAND 활용을 확대하더라도 DRAM 수요가 사라지는 것은 아니다. 활성 가중치와 KV 캐시는 계속 빠른 메모리를 필요로 하므로 DRAM·HBM과 NAND의 보완 관계가 강화될 가능성이 있다.
  • 검증 필요: LPDDR5X의 분기 가격 상승률, CXMT와 애플의 조달 논의, 2026년 로컬 AI 저장 공간 40~60GB 추산, HBF·zNAND-O의 상용화 수준은 영상 외의 시장조사 자료와 기업 공식 발표를 통해 별도로 확인해야 한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 모바일용 LPDDR5X 가격이 2026년 2분기에 전분기 대비 약 78~83% 상승했다는 수치는 조사 기관, 계약 가격 기준, 제품 규격과 집계 범위를 원문 자료에서 확인해야 한다. [00:26]
  • CXMT의 세계 DRAM 점유율 약 7%와 애플의 조달 논의는 보도에 기반한 내용이므로, 실제 공급 계약이 체결됐다고 단정할 수 없다. [00:42]
  • AFM3 Core Advanced의 전체 200억 파라미터, 요청별 10억~40억 활성화, NAND 보관 방식이 실제 출시 아이폰에 적용된 구조인지 연구·제안 단계의 구조인지 구분해서 확인필요가 있다. [01:16] [02:45]
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • LPDDR5X 가격 상승률과 CXMT 점유율의 원출처를 찾아 조사 시점, 제품 범위, 가격 기준을 확인한다.
  • 애플 공식 자료나 AFM3 관련 논문에서 전체·활성 파라미터 수, IFP 동작 방식, 양자화 비트 수를 교차 검증한다.
  • AFM3의 NAND 활용이 상용 아이폰에 이미 구현된 기능인지 향후 적용 가능성을 설명한 연구 결과인지 구분한다.
  • 90억 희소 모델과 30억 밀집 모델의 성능 비교에서 사용된 벤치마크, 하드웨어, 첫 토큰 지연시간 측정 조건을 확인한다.

❓ 열린 질문

  • AFM3의 IFP는 현재 판매되는 아이폰에서 실제로 작동하는 기술인가, 아니면 차세대 온디바이스 AI를 위한 연구 구조인가?
  • NAND에서 필요한 가중치를 불러올 때 발생하는 지연시간과 전력 소비는 DRAM 증설 비용보다 충분히 낮은가?
  • 여러 요청이 연속되거나 서로 다른 전문가 가중치를 요구할 때 DRAM 캐시는 어떤 기준으로 유지·교체되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.