YouTubeY Combinator·2026년 10월 2일·0

What If We Stopped Using GPUs?

Quick Summary

What If We Stopped Using GPUs를 중심으로, GPU와 모델은 함께 발전했다. 트랜스포머의 메모리 용량·대역폭 요구와 에너지 효율 개선의 정체가 대안 탐색의 배경이며, 연산 효를 핵심 판단 포인트로 압축 정리한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

What If We Stopped Using GPUs? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

What If We Stopped Using GPUs?의 핵심 내용을 4단계로 요약한 인포그래픽
What If We Stopped Using GPUs? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

What If We Stopped Using GPUs를 중심으로, GPU와 모델은 함께 발전했다. 트랜스포머의 메모리 용량·대역폭 요구와 에너지 효율 개선의 정체가 대안 탐색의 배경이며, 연산 효를 핵심 판단 포인트로 압축 정리한다.

📌 핵심 요점

  1. GPU와 모델은 함께 발전했다. 트랜스포머의 메모리 용량·대역폭 요구와 에너지 효율 개선의 정체가 대안 탐색의 배경이며, 연산 효율만 높여서는 저장과 데이터 이동의 병목을 해결하기 어렵다.
  2. SPSA는 무작위 섭동을 더하고 뺀 두 순방향 평가의 차이로 갱신 방향을 추정한다. SOMA는 작은 전문가를 독립적으로 학습한 뒤 추론에서 결합해 모델 크기에 따른 추정 잡음을 제한하지만, 현재 GPU에서는 반복 평가 비용 때문에 역전파보다 불리할 수 있다.
  3. 광학 연산은 병렬 처리와 유리한 에너지 확장성을 기대할 수 있다. 확산 모델의 반복 추론을 고정 가중치 광학 장치에 맡기는 연구가 이를 보여주지만, 결과는 작은 데이터셋에 한정되며 수동 장치의 에너지 가정과 재프로그래밍 가능한 시제품을 구분해야 한다.
  4. 뉴로모픽의 핵심은 뇌의 조직 원리를 활용하는 것이다. 메모리·연산 결합, 스파이크와 이벤트 처리, 적응 능력이 주요 방향이며, 순수 디지털 메모리·연산 결합은 가까운 상용화 후보로 평가된다.
  5. 배양 뇌세포의 Doom 수행은 세포와 실리콘 학습계가 함께 만드는 결과다. PPO로 자극 인코더와 행동 디코더를 학습하며, 큰 디코더가 세포의 기여를 가릴 수 있어 작은 디코더와 제거 실험으로 스파이크 정보의 필요성을 확인했다.

🧩 배경과 문제 정의

  • GPU와 딥러닝 모델·최적화 방식은 서로의 특성에 맞춰 발전해 왔다. 트랜스포머의 메모리 용량·대역폭 요구가 커지면서, 연산 효율만 높이는 접근으로는 해결하기 어려운 문제가 생겼다.
  • 최근 연산당 에너지 효율 개선이 정체됐다는 문제의식과 약 20와트로 작동하는 인간 뇌의 사례가 대안 컴퓨팅의 출발점이다. 광학·생물학적 신경망·뉴로모픽 회로는 서로 다른 연산 비용과 저장 제약을 가진다.
  • 대안 하드웨어의 장점을 활용하려면 기존 GPU용 모델과 역전파를 그대로 옮기는 것만으로는 부족하다. 저장·비선형 연산·입출력 변환 비용에 맞춰 학습 방식과 알고리즘도 함께 설계해야 한다.

🕒 시간순 섹션별 상세정리

1. CNN에서 트랜스포머로 바뀌며 GPU의 우선순위도 이동했다

  • 2012년 AlexNet 이후 CNN이 대략 2019~2020년까지 중심을 이뤘다는 구분에서는, CNN의 메모리·대역폭 병목이 상대적으로 작아 줄당 연산량을 높이는 것이 주요 과제였다. 당시 엔비디아의 사업적 관심이 AI보다 암호화폐에 더 쏠렸다는 부분은 발표자의 해석이다. [01:12]
  • GPT-2나 GPT-3가 전환점이었을 것이라는 추정과 함께, 트랜스포머의 큰 메모리 용량·대역폭 요구가 Ampere 이후 하드웨어의 우선순위를 바꿨다는 관점이 나온다. 어텐션의 제곱 규모 연산 특성이 그 배경으로 연결된다. [02:19]

2. 에너지 효율의 정체가 새로운 연산 방식의 필요성을 키운다

  • 줄당 기가플롭 기준으로 최근 2년간 개선이 크지 않았다는 판단이 대안 탐색의 근거다. 향후 10년 안에 역전파 사용을 중단할 수 있다는 전망도 나오지만, 이는 발표자의 예측이다. [03:14]
  • 인간 수준의 능력을 구현하려면 기가플롭당 비용을 크게 낮춰야 한다는 전제 아래, 약 20와트로 작동하는 인간 뇌가 비교 기준이 된다. [03:52]

3. 뇌의 학습 구조는 역전파와 다른 설계의 단서를 제공한다

  • 뇌를 주로 순방향으로 작동하는 시스템으로 보는 관점에서는, 순방향 활동을 멈추고 역방향으로 신호를 보내 가중치를 갱신하는 방식이 적절한 설명이 되기 어렵다. [04:36]
  • 별도의 순방향·역방향 시냅스 쌍에 동일한 가중치를 요구하면 가중치 전달 문제가 생긴다. 두 경로가 같은 신호를 받는 순환 구조가 일부 문제를 완화할 수 있어도, 이를 활성값 저장이 필요한 역전파와 동일시하지는 않는다. [05:01]

4. 광학·신경·뉴로모픽 연산은 서로 다른 비용 구조를 가진다

  • 데이터센터에서는 빛으로 전달한 정보를 전자로 바꿔 처리하고 다시 빛으로 보내는 변환이 반복된다. 전체 처리를 빛으로 수행하면 이 비용을 크게 줄일 수 있다는 구상이지만, 즉각적이고 무전력인 연산이라는 표현은 이상적인 가능성에 대한 주장이다. [06:40]
  • 생물학적 신경망을 활용하는 연산과 뇌의 작동을 아날로그 회로로 모방하는 뉴로모픽 연산도 대안이다. 그러나 이러한 기판에 역전파를 그대로 적용할 수 있는지는 별개의 문제이며, 특히 빛으로 비트를 저장하기는 어렵고 비싸다. [07:16]

5. SPSA는 두 순방향 평가의 차이로 갱신 방향을 구한다

  • 비기울기 기반 방법들을 비교한 연구의 과제는 10억 파라미터 LSTM의 다음 토큰 예측이었다. 여러 영차 최적화 방법을 구현한 실험에서 SPSA가 가장 좋은 결과를 냈다는 것이 발표자의 연구 결과다. [08:27]
  • SPSA는 파라미터를 무작위 방향으로 작은 반경만큼 더하거나 빼 두 번 평가하고, 그 유한차분으로 해당 방향의 갱신 크기를 정한다. 평가값 차이가 작으면 갱신도 작고, 차이가 크면 갱신도 커진다. [09:12]

6. 독립적으로 학습한 작은 모델을 추론 때 결합한다

  • LSTM은 기울기가 흐르도록 설계됐고, 트랜스포머의 학습 병렬성도 역전파와 GPU에 잘 맞는다. 순방향 평가만 사용하는 학습에서는 이 구조들을 그대로 유지해야 할 이유를 다시 검토할 수 있다. [10:24]
  • SOMA는 피질 기둥의 독립 학습에서 착안한 ‘분할 최적화와 신경 집합의 혼합’ 구상이다. Common Crawl 데이터를 텍스트 특징과 SVD 등을 이용해 군집화하고, 군집별 파일을 여러 GPU에 보내 약 4만 1천 파라미터의 작은 LSTM 전문가를 각각 학습시킨다. [11:13]

7. 모델 분할은 영차 추정의 잡음을 제한하지만 연산 비용은 남는다

  • SPSA의 기울기 추정 오차는 모델 크기가 커질수록 선형적으로 악화된다는 설명이다. 100억 파라미터 모델에서는 필요한 섭동 횟수가 매우 커져, 순방향·역방향 계산을 한 번씩 수행하는 방식보다 연산량이 비효율적일 수 있다. [12:01]
  • 작은 전문가로 분할하면 추정 잡음이 각 전문가의 크기에 의해 제한돼, 단계당 약 64회 또는 그보다 적은 섭동으로도 학습할 수 있다는 결과가 나온다. 섭동 횟수·배치 크기뿐 아니라 분할 정도를 늘리는 것도 성능 개선의 축으로 드러난다. [12:37]

8. 광통신과 저정밀 AI 연산 사이에 접점이 생긴다

  • AI 데이터센터의 랙 간 전송은 거의 모두 광섬유를 사용하며, 대륙 간 데이터 전송의 99%도 광학 방식이라는 수치가 나온다. 광자의 전자 대비 약 1만 배 낮은 손실과 약 1만 배 큰 대역폭이 이러한 활용의 근거다. [15:42]
  • 전자 프로세서는 전통적으로 32비트·64비트 표현으로 계산하고, 광통신에서는 이를 두 수준이나 네 수준의 신호로 바꿔 전송했다. 최근에는 AI 계산의 요구 정밀도가 낮아지고 광통신의 지원 비트 깊이는 높아지면서 두 영역의 접점이 형성된다. [16:40]

9. 광학 행렬 연산은 병렬성과 유리한 에너지 확장성을 노린다

  • 광자끼리 상호작용하지 않는 특성 때문에 여러 광선이 같은 공간에 공존할 수 있다. 신호마다 별도의 경로가 필요한 전기 회로와 비교하면 대규모 병렬 처리에 유리한 성질이다. [17:43]
  • 전자식 행렬·벡터 곱셈은 배선을 충전하고 트랜지스터로 조작한 뒤 방전하는 단계마다 에너지를 쓴다. 입력과 출력이 각각 n차원인 경우 에너지 소비가 대체로 n²에 비례한다는 비교다. [18:12]

10. 광학 연산의 이점은 변환·제어·비선형 처리 비용에 제한된다

  • Lightmatter의 광전자 PCIe 보드는 GPU와 비교할 만한 연산 성능과 전력 효율을 보이지만, 전체 에너지 예산에서 광학 연산 자체가 차지하는 비중은 작다. 시스템의 다른 구성 요소가 주요 비용이 된다는 사례다. [19:27]
  • 디지털 전자 메모리의 데이터를 아날로그·광학 영역으로 옮기고 결과를 다시 디지털로 바꾸는 데 큰 비용이 든다. 장치를 프로그래밍하고 보정해 정밀도를 유지하는 제어에도 지속적인 에너지가 필요하다. [20:15]

11. 확산 모델의 반복 계산을 수동 광학 장치로 옮긴다

  • 광학 연산의 실질적인 이점을 얻으려면 용도와 알고리즘을 신중하게 골라야 한다. EPFL과 Google의 공동 연구는 빛의 전파를 확산 모델의 잡음 제거·이미지 생성 추론에 활용하는 접근이다. [21:41]
  • 확산 생성 모델은 무작위 분포에 학습된 신경망을 반복 적용해 목표 데이터 분포로 점진적으로 이동한다. 이미지에서는 무작위 픽셀을 여러 단계에 걸쳐 정돈해 현실적인 이미지를 만든다. [22:23]

12. 위상 조절층과 고정 가중치 장치로 잡음 제거를 구현한다

  • 물리 모델과 조작 가능한 요소를 이용해 목표 함수를 수행하도록 광학 시스템을 설계한다. 현재 설계에는 여전히 역전파를 사용하며, 잡음이 있는 입력에서 잡음 항을 예측해 반복적으로 빼는 방식으로 깨끗한 이미지를 얻는다. [23:54]
  • 각 층은 빛의 위상을 바꾸는 투명한 요소로 구성된다. 광선이 여러 층을 통과하며 회절하도록 설계해 원하는 출력 정보가 남게 한다. [24:46]

13. 작은 데이터셋에서 생성 품질과 파라미터 확장성을 확인했다

  • 파라미터 수의 제약 때문에 현재 결과는 MNIST 숫자와 Fashion-MNIST 같은 작은 데이터셋에 한정된다. 무작위 입력에서 원본 데이터와 유사한 이미지를 점진적으로 생성하며, FID 감소가 생성 품질과 다양성 개선의 근거다. [26:01]
  • 회절층 수나 각 층의 픽셀 수를 늘리면 디지털 신경망과 유사한 멱법칙 형태의 성능 개선이 나타난다. 이는 더 많은 파라미터를 추가했을 때도 비슷하게 확장될 수 있다는 기대를 뒷받침하지만, 대규모 모델 검증을 대신하지는 않는다. [26:34]

14. 에너지 우위는 수동 가중치 가정과 실제 시제품을 구분해야 한다

  • 비슷한 생성 성능의 디지털 모델을 상용 GPU에서 실행한 경우와 비교하면, 작은 광학 모델은 이미지당 에너지에서 상당한 이점을 보였다. 다만 이 비교는 학습된 가중치층을 미세 제작해 고정하고 수동적으로 사용한다는 가정에 의존한다. [27:22]
  • 실제 시제품은 공간 광변조기와 거울을 결합해 단일 장치에서 깊은 네트워크를 구현했다. 카메라 영상과 입력 레이저 분포를 이용해 현장에서 역전파로 가중치를 갱신할 수 있어, 매번 미세 제작을 반복하지 않고 설계를 시험할 수 있었다. [27:59]

15. 다음 검증 과제는 대규모 전체 시스템에서도 이점을 유지하는 것이다

  • 빛의 전파를 확산 기반 이미지 생성이라는 특정 AI 작업에 맞춰 설계할 수 있다는 것이 이번 연구의 성과다. 같은 가중치를 반복 사용하는 생성 알고리즘과 광학 하드웨어를 함께 설계한 점이 광학의 강점을 활용하는 핵심이다. [28:47]
  • 다음 단계는 전체 과정을 포함하는 시스템을 구현하고, 10억 파라미터 같은 큰 규모에서도 에너지·지연시간 이점이 유지되는지 확인하는 것이다. 파라미터 증가에 따른 성능 개선의 초기 근거는 있지만, 대규모 시스템에서의 이점은 아직 검증 과제로 남는다. [29:25]

16. 광학 연산의 정확도와 데이터 전송 부담이 적용 범위를 제한한다

  • Lightmatter 개발 참여자의 설명에 따르면, ADC·DAC의 해상도와 정확도가 실제 운용 중 예측 정확도에 영향을 주는 문제가 관측됐다. 참여자는 이를 광학 연산 연구에서 HBM 인터커넥트로 방향을 전환한 배경과 연결한다. [30:03]
  • 광학 시스템으로 전송해야 하는 파라미터나 데이터가 많아지면 단점이 이점을 압도할 수 있다. 초기 활용에는 범용 CPU보다 비트 깊이, 정밀도, 데이터 전송률을 줄일 수 있는 특정 응용 전용 설계가 적합하다는 판단이다. [30:59]

17. 디지털 역전파가 병목이며 광학 내부 반복이 개선 가능성을 만든다

  • 현재 구현은 보정된 디지털 트윈을 사용하며 역전파를 디지털 전자 장치에서 수행한다. 이 디지털 역전파가 현재 가장 큰 병목으로 꼽힌다. [31:54]
  • 확산 모델을 매 단계 교사 강제를 사용하는 RNN으로 보고, 단계별 손실 계산과 읽기를 줄이는 접근이 제안된다. 이 방식은 아직 시험하지 않았으며 향후 연구 방향으로 남아 있다. [32:06]

18. 대규모 광학 모델에는 제조보다 깊은 층의 비선형 처리가 어려운 과제다

  • 광학 장치는 전자 장치와 유사한 식각·증착 기술로 제조할 수 있다. 빛의 파장 때문에 단위 소자가 더 커지지만, 이 문제는 해결 가능한 과제로 평가된다. [33:26]
  • 파라미터 수를 늘리는 깊은 신경망에는 층마다 비선형 처리가 필요하다. 현재 방식은 신호를 변조기로 되돌리므로, 저렴한 비선형 처리 방법을 개발하거나 대규모 연산을 효과적으로 활용하는 모델을 찾아야 한다. [33:50]

19. 파장 다중화가 광학 소자의 큰 면적을 보완할 수 있다

  • 광학 소자는 마이크로미터 규모로, 나노미터 규모의 전자 트랜지스터보다 크다. 광학 주파수 빗을 활용해 수백 개의 파장에 서로 다른 가중치를 인코딩하면 공간 대신 파장 차원에서 연산을 다중화할 수 있다. [34:43]
  • 파장 다중화로 공간 활용도를 높일 수는 있지만, 가시광선과 상호작용하는 소자의 구조 크기가 더 커야 한다는 제약은 남는다. [35:28]

20. 빠르고 저렴한 광학 메모리가 부족해 고정 가중치를 택한다

  • CD·DVD처럼 광학 매체는 장기 보관에 적합하지만, 연산용 메모리에는 빠르고 저렴한 읽기·쓰기가 필요하다. 홀로그래픽 메모리와 광굴절 물질을 활용한 시도도 전자 메모리만큼 저렴하고 쉽게 이용할 수 있는 수준에 이르지는 못했다. [36:03]
  • 광학 영역에서 가중치를 유지하거나 다시 쓰는 비용이 높아 응용 전용·고정 가중치 방식이 선택됐다. 상변화 물질도 해결 후보지만, NAND 등 전자 메모리만큼 널리 쓰이고 다루기 쉬운 대안은 아직 없다. [36:54]

21. 편광은 비선형 처리 후보지만 여러 층으로 확장할 방법이 불명확하다

  • 빛의 세기와 위상 외에 편광도 활용 가능한 자유도다. 편광 조작은 센서가 검출하는 진폭 영역에서 비선형 응답으로 나타날 수 있어, 편광 필터를 이용한 연산이 연구 후보가 된다. [37:53]
  • 깊은 신경망에서는 각 층에 비선형 처리를 반복 적용해야 한다. 한 번 편광을 필터링한 뒤 비선형성을 계속 만들어낼 방법은 불확실하며, 관련 대규모 연구의 존재도 확답하지 못한다. [38:18]

22. 뇌의 지속 학습과 낮은 전력 소비가 뉴로모픽 연구의 출발점이다

  • 뇌는 언어·추론·창의성을 함께 수행하고, 시각·청각·신체 행동을 실시간으로 통합한다. 평생 학습하며 자동차나 컴퓨터처럼 진화 과정에서 직접 대비하지 못한 대상에도 적응한다. [40:13]
  • 16세 청소년에게 정지 표지판을 한두 번 보여주는 사례와 자율주행차에 다양한 이미지가 필요한 사례를 대비해 적은 예시로 배우는 능력을 강조한다. 뇌의 소비 전력은 약 20와트로 드러난다. [41:07]

23. 뇌의 핵심 설계 원리는 기억·연산 결합, 이벤트 처리, 가소성이다

  • 뉴로모픽 컴퓨팅은 뇌의 조직 원리를 회로와 칩 설계에 빌리는 접근이며, 구체적인 정의는 연구 목적에 따라 달라진다. 뇌의 연결은 가중치와 기억을 가지면서 연산에도 참여한다. [42:33]
  • 뇌는 감각 입력으로 생성되는 스파이크를 전파하며 연속적으로 작동한다. 스파이크 기반 처리는 디지털과 아날로그 성격이 섞여 있어 기존 계산 방식과 완전히 대응하지 않는다. [43:41]

24. 스파이킹 뉴런은 입력을 누적하고 임계값을 넘으면 발화한다

  • 단순화한 뉴런은 누설이 있는 커패시터처럼 입력 펄스의 전하를 누적한다. 전하는 시간이 지나면 줄어들지만, 입력이 충분히 가까운 시점에 들어와 임계값을 넘으면 스파이크를 출력한다. [45:26]
  • 입력이 부족하면 누적 상태가 줄어들고 초기화된다. 누설과 감쇠는 아날로그적이고 발화는 이산적이며, 스파이크 사이의 시간 관계와 진폭도 중요하게 작용한다. [46:20]

25. 현대 AI의 성과는 뇌의 원리와 디지털 하드웨어 특성을 함께 활용한 결과다

  • 현대 신경망은 연결된 뉴런, 학습에 따른 연결 강도 변화, 여러 뉴런의 패턴에 정보를 저장하는 개념을 생물학에서 가져왔다. [47:22]
  • 역전파, 트랜스포머 어텐션, 디지털 하드웨어에서의 대규모 학습은 뇌의 작동과 직접 대응하지 않는다. 실제 혁신은 디지털 실리콘의 제조·확장·병렬 처리 능력에 맞춰 신경망을 발전시키는 과정에서 일어났다는 평가다. [48:01]

26. 에너지 효율 연구는 메모리와 연산을 가까이 결합한다

  • 2026년 시점의 뉴로모픽 분야는 여전히 연구개발 단계라는 평가다. 뇌에서 얻은 원리와 적절한 물리적 구현을 연결해 유용한 효과를 찾는 문제가 남아 있다. [49:35]
  • 뇌의 약 20와트 소비 전력을 단서로 AI의 에너지 효율을 높이려는 연구에는 메모리·연산 결합과 아날로그 학습·추론이 포함된다. [50:30]

27. 엣지 장치는 스파이크와 이벤트 기반 처리로 실시간 적응을 탐색한다

  • 드론처럼 감지하고 즉시 반응해야 하는 장치에서는 뇌의 연속적인 감각 처리가 설계 단서가 된다. 스파이크 기반 신경망 학습, 장치 내부 학습, 관측에 따른 자기 개선, 이벤트 기반 연산이 연구 대상이다. [51:33]
  • 인텔은 이 방향에서 많은 연구를 수행한 사례로 꼽히며, 연구개발 칩을 활용해 스스로 비행하는 드론을 구현했다는 사례가 드러난다. [52:15]

28. 새로운 소자의 물리적 특성에 맞춘 모델 설계는 아직 열린 연구다

  • 광자 소자, 저항성 메모리, 멤리스터, 결합 발진기에는 아날로그 특성과 비선형성 등 독특한 물리적 성질이 있다. 이런 소자의 구체적인 동작에 맞춰 모델을 공동 설계하면 새로운 성능이나 기능을 얻을 가능성이 있다. [52:29]
  • 실용 시스템에서 뇌를 닮은 컴퓨터를 사용하게 될지는 여전히 열린 질문이다. 신경망도 유용해지기까지 오랜 시간이 걸렸다는 점에서, 이 분야는 매력적인 연구 방향이지만 시간과 운이 필요하다는 평가다. [53:19]

29. 가까운 상용화 후보는 디지털 메모리·연산 결합이다

  • 뇌를 강하게 모방하는 기술은 아직 초기 단계이며, 당장 유망한 방향으로는 순수 디지털 메모리·연산 결합이 꼽힌다. d-Matrix는 작동과 제조가 가능하고 시장 도입까지 이어질 수 있는 사례로 평가된다. [54:37]
  • 더 야심 찬 방향에는 순수 CMOS로 결합 발진기를 구현하려는 스타트업이 있다. 대규모 제조 가능성을 제약 조건으로 유지하면서 새로운 동역학을 활용한다는 점은 흥미롭지만, 추진에는 충분한 자금이 필요하다. [55:26]

30. 패키징과 데이터 이동의 에너지 문제에는 광학 연결이 후보가 된다

  • SRAM을 연산 가까이에 배치해 디코딩 병목을 완화하면 패키징 면적이 커져 같은 데이터센터 공간에 배치할 서버 수가 줄어들 수 있다는 우려가 제기된다. [56:02]
  • 인터커넥트의 정전용량은 트랜지스터 게이트보다 훨씬 커서, 에너지의 상당 부분이 개별 비트 전환보다 배선을 따라 비트를 이동시키는 데 쓰인다. 광학 기술이 이 문제를 해결할 것이라는 개인적 전망이 드러난다. [56:46]

31. 실제 뉴런을 쓰더라도 속도·기억·규모 확장의 제약을 검토해야 한다

  • 뇌를 모방하려면 실제 뇌나 뉴런을 쓰는 것이 더 적합하지 않느냐는 질문에 대해, 컴퓨터가 뇌보다 유리한 능력도 있다는 반론이 나온다. 컴퓨터의 클록 속도와 저장 용량의 확장 가능성이 예로 드러난다. [57:29]
  • 생물학적 시스템에는 기억과 저장의 제약이 있으며, 실제 뉴런을 계산에 활용할 수 있더라도 규모를 확장할 수 있는지는 별개의 문제다. 가능성은 열려 있지만 충분히 탐색되지 않은 연구 방향으로 평가된다. [58:18]

32. 모델과 하드웨어의 설계 순서는 출발점의 물리적 강점에 달려 있다

  • 개발 주기가 짧아지는 상황에서 소프트웨어 모델을 먼저 정하고 하드웨어를 고를지, 하드웨어를 먼저 확보하고 모델을 맞출지가 핵심 선택으로 제기된다. 답은 상황에 따라 달라진다는 입장이다. [59:01]
  • 특정 시스템의 물리적 성질에 대한 통찰에서 출발하고 광학 컴퓨터의 제약과 강점을 깊이 이해하고 있다면, 기존 모델 구조를 무작정 적용할 수 없다. 하드웨어가 가진 이점을 어떻게 활용할지가 설계 판단의 조건이 된다. [59:40]

33. 아키텍처와 구현 재료는 서로의 특성에 맞춰 선택해야 한다

  • 시스템의 강점과 약점을 출발점으로 설계할 수도 있고, 독특한 아키텍처를 먼저 구상한 뒤 이를 구현할 적절한 물리적 형태를 선택할 수도 있다. 설계 방향은 어느 쪽에서 출발하느냐에 달려 있다 [1:00:23]
  • 실리콘은 전자회로 계산을 구현하는 데 축적된 역량이 큰 재료다. 칩에 쓰이는 재료는 점점 다양해지고 있으며 다이아몬드 기판 연구도 있지만, 뇌가 탄소 기반이라는 이유만으로 실리콘과 탄소의 차이에 과도한 의미를 둘 필요는 없다는 관점이다 [1:01:35]

34. 잡음을 계산에 활용하려면 유용한 변동과 재현성 문제를 구분해야 한다

  • 디지털 계산도 부동소수점 정밀도의 한계에서 결정론 문제가 생긴다. 열역학적 컴퓨팅은 볼츠만 머신과 연결되는 아이디어를 아날로그 회로에서 탐색하며, 잡음을 유용하게 활용하려 하지만 필요한 잡음과 시스템 자체가 추가하는 잡음을 구분하기 어렵다 [1:03:14]
  • SPSA와 같은 접근에서는 동일한 시드로 잡음을 재현할 수 있다면 학습에 활용할 수 있다는 주장이 나온다. 전방 차분은 두 번, 중앙 차분은 세 번의 재현 가능한 실행을 활용할 수 있지만, 생물학적 시스템에서 같은 시드로 같은 벡터를 두 번 생성하기 어렵다는 점이 영차 최적화의 생물학적 타당성을 의심하게 하는 이유다 [1:04:12]

35. 배양 뇌세포를 자극과 반응으로 계산하는 동적 시스템으로 다룬다

  • Cortical Labs와의 Doom 프로젝트는 뇌세포에 행렬곱 같은 계산을 강제하기보다, 자극을 넣고 계산에 유용한 출력을 얻는 입출력 시스템으로 접근한다 [1:05:03]
  • 탄약·체력·화면 이미지 등의 게임 상태를 다중 전극 배열의 자극 채널, 진폭, 주파수로 인코딩한다. 세포가 생성한 스파이크를 게임 행동으로 디코딩하면서 세포의 반응을 실제 계산에 연결한다 [1:05:59]

36. Doom의 복잡한 행동 공간은 수작업 입출력 설계의 한계를 드러낸다

  • Pong은 공과 패들의 움직임을 다루는 단순한 과제여서, 구분하기 쉬운 출력을 만드는 자극 채널과 패들 이동 규칙을 수작업으로 설계할 수 있었다 [1:06:40]
  • Doom에서는 여러 적과 이동·회전·공격의 조합을 처리해야 한다. 59개 채널로 54가지 행동에 대응하는 출력을 구분하려 하면 비슷한 채널에 놓인 뉴런들의 반응이 결합될 수 있어 수작업 매핑이 매우 어려워진다 [1:07:25]

37. PPO 폐루프는 입력 변환과 변화하는 세포의 반응을 함께 학습한다

  • PPO 기반 폐루프는 게임 관측을 인코더로 자극으로 바꾸고, 배양 세포의 스파이크를 디코더로 행동으로 변환한다. 약 2,000스텝마다 모델을 갱신하며, 크리틱은 세포에 주는 수행 피드백을 안정화하는 데 사용한다 [1:08:38]
  • 인코더는 이미지를 CNN으로 처리하고 스칼라 관측과 결합한 뒤 MLP로 자극의 주파수와 진폭을 정한다. 공개 코드에서는 채널 선택을 하지 않았던 것으로 기억하며, 후속 실험에서는 채널 선택도 학습했다는 설명이다. 5만 개 어휘 같은 큰 입력 공간도 수작업 인코딩보다 이런 학습 방식이 필요할 것으로 예상한다 [1:09:59]

38. 작은 디코더와 제거 실험으로 뇌세포의 실제 기여를 확인한다

  • 처음에는 디코더가 너무 커서 스파이크를 모두 0으로 만들어도 편향만으로 게임을 수행할 수 있었다. 디코더를 크게 줄이고 선형 출력층의 편향을 0으로 설정했으며, 제거 실험으로 스파이크 자체가 게임 수행에 필요한 정보를 담는지 확인했다 [1:11:25]
  • 실리콘 디코더가 과제에 과적합하면 세포는 학습할 필요 없이 확률적인 반응을 유지할 수 있다. 큰 디코더를 학습시킨 성능을 뇌세포의 능력으로 해석하면 기여를 잘못 판단할 수 있으며, 초파리 뇌 관련 사례에도 같은 문제가 있다는 비판이 제기된다 [1:12:24]

39. 피드백은 행동의 좋고 나쁨뿐 아니라 예상과 결과의 차이에 맞춘다

  • 자유에너지 원리에 대한 연구진의 가정에 따라, 피하고 싶은 행동에는 비동기 자극을, 좋은 행동에는 동기 자극을 준다. 뇌가 비동기 자극을 피하려 한다는 해석이 이 피드백 설계의 전제다 [1:13:20]
  • 초기에는 실패가 많고 현재 세포는 장기적인 공로 할당에 충분하지 않아, 단순한 보상만 사용하면 부정적 자극이 계속될 수 있다. 크리틱의 예상과 실제 결과 사이의 차이에 맞춰 피드백을 조절하면, 반복적인 부정적 자극을 줄이면서 세포가 연결을 형성하도록 할 수 있다 [1:14:22]

40. 긍정·부정 피드백은 통증보다 자극의 예측 가능성과 관련된다

  • 긍정·부정이라는 표현은 게임에서 원하는 행동인지에 대한 구분이다. 해당 배양 세포에는 통증 수용체가 없고 유해한 독성 물질도 넣지 않으며, 기분의 좋고 나쁨보다 배양계 내부의 엔트로피를 줄이는 방향으로 작동한다는 해석이다 [1:16:28]
  • 세포가 높은 엔트로피의 비동기 자극을 받는 빈도를 줄이도록 자기 조직화한다는 설명이다. 특정 주파수 자체를 고통이나 부정적 감각과 동일시하는 방식은 이 피드백의 의미와 다르다 [1:16:50]

41. 두 학습 시스템은 고정된 평형보다 계속 변하는 상태를 만든다

  • 세포와 실리콘 학습계는 서로 영향을 주는 두 동적 시스템이어서 평형에 도달하지 않는다는 설명이다. 엔트로피는 두 시스템이 준어트랙터 상태로 향하는 과정을 방해하는 요소로 읽힌다 [1:17:27]
  • 일반적인 강화학습에서는 탐색을 위해 엔트로피 보너스를 쓰지만, 이 실험에서는 세포가 충분한 변동성을 제공한다고 판단해 엔트로피에 벌점을 주었고 도움이 되었다. 다만 이 방식의 샘플 효율은 정밀하게 측정하지 않았다 [1:18:03]

42. 생물학적 기질에서 인간과 다른 지능이 나올 가능성을 본다

  • 실험의 전기 자극은 눈과 귀에서 들어오는 실제 신호와 매우 다르다. 인간은 계산보다 생존과 번식에 맞춰져 있으며, 이 접근은 지능을 담을 수 있는 생물학적 기질을 계산 재료로 활용한다는 관점이다 [1:18:38]
  • 자극 방식이 자연 감각과 비슷해질 가능성도 있지만, 같은 기질 위에서 인간과는 다른 형태의 지능이 나타나는 방향으로 계속 갈라질 것이라는 전망이다 [1:18:57]

43. 최첨단 지능 구현과 수십억 명 대상 서비스는 별도의 확장 과제다

  • 생물학적 컴퓨팅의 확장에는 세포에서 최첨단 수준의 지능을 구현하는 문제와, 그 지능을 전 세계 수십억 명에게 제공하는 문제가 있다. 같은 생물학적 기질에서 인간 지능이 존재한다는 사례는 있지만, 이를 분산 컴퓨팅으로 운영하는 방법은 아직 모른다는 판단이다 [1:20:07]
  • 이 기술이 얼마나 확장 가능한지는 아직 알 수 없다. 연구팀은 확장 방법을 찾고 기술을 실제로 확장하기 위한 단계를 밟고 있다 [1:20:24]

🧾 결론

  • GPU를 대체할 단일 기술의 승자가 제시된 것은 아니다. 각 물리적 기반의 연산·저장·통신 비용에 맞는 작업과 알고리즘을 찾는 것이 공통 과제다.
  • 역전파 없는 학습과 GPU 없는 추론은 구분해야 한다. 소개된 광학 시스템도 설계와 학습에는 여전히 디지털 역전파를 사용하며, 이것이 현재 병목으로 지목된다.
  • 특정 연산의 에너지 이점이 전체 시스템의 우위를 보장하지는 않는다. 입출력 변환, 보정, 비선형 처리, 메모리와 데이터 이동을 포함한 검증이 필요하다.
  • 작은 모델의 성능 개선과 생물학적 기질의 가능성은 초기 근거다. 대규모 모델과 수십억 명 대상 서비스로의 확장은 별도의 검증 과제로 남는다.

📈 투자·시사 포인트

  • 대안 AI 하드웨어를 평가할 때는 연산부의 효율뿐 아니라 변환·제어·메모리·통신을 포함한 전체 에너지와 지연시간을 살펴야 한다.
  • 순수 디지털 메모리·연산 결합은 발표에서 가까운 상용화 후보로 평가됐다. d-Matrix 같은 사례의 작동·제조·시장 도입 근거를 초기 단계의 뇌 모방 기술과 구분해 검토필요가 있다.
  • 광학 연결은 데이터 이동 에너지 문제의 후보로 제시된다. Lightmatter 참여자의 설명은 연산 정확도와 ADC·DAC 부담이 기술의 적용 방향을 바꿀 수 있음을 보여준다.
  • 고정 가중치와 반복 계산을 활용하는 특정 응용은 광학 하드웨어의 강점을 살릴 수 있다. 적용 작업, 요구 정밀도, 가중치 변경 빈도가 사업성을 검토할 기준이 된다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 최근 에너지 효율 개선의 정체와 향후 10년 내 역전파 중단 전망은 발표자의 판단·예측이다. 비교 대상과 측정 조건을 확인해야 한다.
  • 광학 확산 모델의 에너지 우위는 미세 제작한 고정 가중치층을 수동적으로 사용한다는 가정에 의존한다. 실제 시제품의 소비 에너지와 동일한 결과로 읽어서는 안 된다.
  • MNIST·Fashion-MNIST에서의 품질 개선은 대규모 생성 모델의 검증을 대신하지 않는다. 10억 파라미터 규모의 전체 시스템에서도 이점이 유지되는지는 열린 과제다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • SPSA·SOMA 연구에서 모델 크기, 섭동 횟수, 배치 크기와 총 연산량을 확인하고 역전파 비교 조건을 정리한다.
  • 광학 확산 연구의 품질·에너지 비교에서 실제 측정값과 수동 고정 가중치 가정을 구분한다.
  • 대안 하드웨어의 에너지 예산에 ADC·DAC, 메모리, 보정, 비선형 처리와 데이터 이동이 포함됐는지 확인한다.
  • 배양 세포 실험의 디코더 크기, 편향 설정과 스파이크 제거 실험을 검토해 세포의 기여를 판단한다.

❓ 열린 질문

  • 순방향 평가가 얼마나 저렴해져야 SPSA와 작은 전문가 분할이 역전파보다 유리해질까?
  • 광학 시스템은 깊은 층의 비선형 처리와 빠르고 저렴한 메모리를 어떻게 확보할 수 있을까?
  • 광학 확산 모델을 대규모로 확장해도 변환·제어 비용을 포함한 에너지와 지연시간 이점이 유지될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.