Articlehuggingface.co·2026년 7월 15일·0

Welcome Inkling by Thinking Machines

Quick Summary

Inkling은 텍스트·이미지·오디오를 기본 입력으로 처리하고 1M 문맥과 멀티모달 추론을 지원하는 Thinking Machines의 약 1T 규모 공개 MoE 모델이다.

Welcome Inkling by Thinking Machines 관련 대표 이미지

🖼️ 인포그래픽

Welcome Inkling by Thinking Machines 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Welcome Inkling by Thinking Machines 내용을 설명하는 본문 이미지

💡 한 줄 요약

Inkling은 텍스트·이미지·오디오를 기본 입력으로 처리하고 1M 문맥과 멀티모달 추론을 지원하는 Thinking Machines의 약 1T 규모 공개 MoE 모델이다.

📌 핵심 요약

  • Inkling은 텍스트·이미지·오디오·영상으로 구성된 45조 토큰을 학습했으며, 텍스트·이미지·오디오 입력과 1M 문맥 길이를 지원한다.
  • 모델은 디코더 전용 멀티모달 MoE 구조로, 총 975B 매개변수 가운데 한 시점에 41B만 활성화되고 전체 전문가 수는 256개다.
  • 위치 표현에는 RoPE 대신 상대적 어텐션을 사용하며, 전역 어텐션과 슬라이딩 윈도 어텐션을 1대 5로 배치하고 짧은 1차원 합성곱을 함께 적용한다.
  • 이미지는 계층적 MLP 패치화 모듈로 처리하고, 오디오는 100밀리초 단위로 멜 스펙트로그램 구간을 이산화한 뒤 임베딩하여 입력으로 구성한다.
  • 출시 시점부터 Transformers·SGLang·vLLM·llama.cpp를 지원하지만, BF16 체크포인트에는 2TB, NVFP4 버전에는 600GB의 VRAM이 필요하다.

🧩 주요 포인트

  1. 총 975B 규모를 유지하면서 활성 매개변수를 41B로 제한하고 혼합 어텐션과 짧은 합성곱을 결합했다 → 계산 효율을 설계에 반영했지만 실제 자체 배포에는 여전히 대규모 GPU 자원이 필요하다.
  2. 복잡한 별도 모달 인코더 대신 비교적 단순한 이미지·오디오 임베딩 타워를 사용한다 → 동일한 생성 모델과 처리 인터페이스로 여러 입력 형식을 다룰 수 있다.
  3. 범용 라이브러리, 고성능 서버, 로컬 양자화, 원격 추론 제공자를 출시 시점부터 연결했다 → 단일 장비 실험부터 다중 노드 서비스까지 서로 다른 실행 경로가 마련돼 있다.

🧠 상세 정리

1. Inkling의 공개와 모델 지향점

Thinking Machines의 Inkling은 2026년 7월 15일 Hugging Face에 공개된 대규모 멀티모달 언어 모델이다. 이 모델은 약 1T 규모와 1M 문맥 창을 갖추고 텍스트뿐 아니라 이미지와 오디오를 기본 입력으로 받아들이며, 에이전트형 기능도 지원한다고 소개됐다. 학습에는 텍스트·이미지·오디오·영상으로 구성된 45조 토큰이 사용됐고, 서로 다른 모달리티에 걸친 추론과 도메인별 미세조정이 주요 용도로 제시됐다. 배포본은 전체 정밀도의 BF16 체크포인트와 보정된 NVFP4 체크포인트로 제공되며, 더 빠른 추론을 위한 추측형 MTP 계층도 포함한다. 작성진은 직접 데모를 제작하고 구조를 살펴본 결과, Inkling이 새로운 멀티모달 추론 응용 프로그램을 구축하는 데 적합하다고 평가했다.

2. 디코더 전용 멀티모달 MoE 구조

Inkling은 총 975B 매개변수와 41B 활성 매개변수를 가진 디코더 전용 멀티모달 Mixture-of-Experts 모델이다. 디코더 전용이라는 것은 최신 언어 모델에서 일반적인 인과적 자기회귀 생성 방식을 사용한다는 뜻이며, 하나의 생성 구조가 텍스트·이미지·오디오 입력을 함께 처리한다. 각 계층의 피드포워드 네트워크는 희소하게 구성되어 전체 매개변수를 매번 계산하지 않고, 특정 시점에는 41B만 활성화함으로써 추론 속도를 높이도록 설계됐다. 모델에는 총 256개의 전문가가 존재하며, 라우터가 입력에 따라 사용할 전문가를 결정한다. 이러한 구성은 거대한 전체 용량을 유지하면서도 모든 매개변수를 동시에 실행하지 않도록 하는 Inkling의 핵심 계산 구조다.

3. 상대적 어텐션과 혼합 어텐션

Inkling은 트랜스포머의 위치 정보를 표현하는 일반적인 RoPE 대신 상대적 어텐션을 사용한다. 각 어텐션 계층은 위치 관계를 어텐션 로짓에서 직접 학습하며, 키·쿼리·값 투영 외에 토큰별·헤드별 상대 특성 R을 생성하는 네 번째 투영을 둔다. 이 상대 특성에는 키와 쿼리 사이의 거리 정보가 반영된 뒤 어텐션 모듈로 전달된다. 디코더 계층은 전체 문맥을 한 번에 보는 전역 어텐션과 고정된 구간만 이동하며 보는 슬라이딩 윈도 어텐션을 교대로 사용하고, 배치 비율은 전역 계층 하나당 슬라이딩 윈도 계층 다섯 개다. 계산 효율을 확보하면서도 풍부한 최종 표현을 만들 수 있도록 마지막 계층에는 전역 어텐션을 배치했다.

4. 짧은 합성곱과 전문가 라우팅

모델은 은닉 상태에 적용되는 SConv라는 짧은 1차원 합성곱을 별도로 사용한다. SConv는 현재 토큰과 그 이전 W-1개 토큰의 은닉 상태를 읽으며, 여기서 W는 슬라이딩 윈도의 크기다. 이 모듈은 가까운 토큰 사이의 지역적 표현을 담당하여 어텐션과 MoE 모듈이 지역 정보 처리에만 묶이지 않도록 하는 역할로 설명된다. MoE 라우터는 라우팅되는 전문가와 공유 전문가를 모두 점수화하며, 본문은 상위 k 선택에 6개의 전문가가 관여하고 공유 전문가 2개는 항상 활성화된다고 밝힌다. 따라서 Inkling은 어텐션의 전역·국소 분담뿐 아니라 합성곱과 전문가 선택까지 결합해 각 계산 모듈의 역할을 나눈다.

5. 이미지·오디오 입력 처리 방식

이미지 처리는 여러 선형 계층으로 구성된 단순한 계층적 MLP 패치화 모듈이 맡는다. 각 계층은 픽셀을 점진적으로 병합하고 마지막에는 패치마다 하나의 임베딩을 생성하며, 패치 격자를 접은 뒤 인접한 작은 토큰 묶음을 채널 차원에 쌓아 계층적 MLP에 통과시킨다. 오디오는 100밀리초 단위의 청크를 멜 척도로 변환한 다음 정확한 멜 스펙트로그램 구간으로 분류하고, 이 이산 값들을 오디오 임베딩 타워에서 임베딩한 후 합산해 최종 입력을 만든다. 두 멀티모달 타워는 모달리티마다 복잡한 독립 인코더를 두는 방식에 비해 상대적으로 단순하며, 생성된 미디어 임베딩은 본체 모델에 전달된다. 이미지 입력에는 영상 처리를 위한 시간 차원도 포함되지만, 작성진은 기본 상태의 영상 성능을 평가하지 않았으며 이 기능이 후속 미세조정에 유용할 것으로 기대한다고 명시했다.

6. 체크포인트와 하드웨어 요구량

Inkling은 전체 BF16 버전과 양자화된 NVFP4 버전으로 제공되며 두 체크포인트의 하드웨어 대상이 구분돼 있다. Transformers에서 BF16 모델은 Hopper 세대 이후 GPU를, NVFP4 체크포인트는 Blackwell Nvidia GPU를 대상으로 안내한다. 모델 크기가 매우 커서 BF16 체크포인트를 실행하려면 2TB의 VRAM이 필요하고, NVFP4 버전도 600GB의 VRAM을 요구한다. 직접 필요한 장비를 마련하기 어렵다면 Hugging Face의 서버리스 추론 라우터를 통해 모델을 사용할 수 있으며, 로컬 배포에는 llama.cpp와 함께 ggml 양자화본을 활용하는 경로가 제시된다. 즉, 정밀도와 실행 환경에 따라 체크포인트 선택지는 나뉘지만 두 공식 버전 모두 상당한 메모리 자원을 전제로 한다.

7. Transformers 기반 통합 추론

Transformers에서 가장 간단한 실행 방법은 이미지·텍스트·오디오를 다루는 any-to-any 파이프라인이며, 글 작성 시점에 공개된 5.14.0 버전으로 갱신하도록 안내한다. 더 낮은 수준의 제어가 필요하면 모델에는 AutoModelForMultimodalLM, 전처리에는 AutoProcessor를 사용해 체크포인트를 불러올 수 있다. 채팅 템플릿은 reasoning_effort 인자를 받아 none부터 max까지 여러 추론 강도를 선택하도록 구성돼 있으며, 본문은 숫자만 답하도록 한 텍스트 질의 예제를 보여준다. 같은 클래스와 채팅 메시지 구조로 이미지와 질문을 함께 전달해 보충제 성분의 상호작용을 묻거나, 오디오 파일과 전사 요청을 함께 전달하는 것도 가능하다. 생성 결과는 프로세서로 디코딩하고 멀티모달 응답 파서를 적용할 수 있어 입력 모달리티가 달라져도 기본 프로그래밍 인터페이스가 유지된다.

8. SGLang·vLLM·원격 추론 배포

SGLang은 출시 당시 Inkling용 사용자 정의 구현을 포함한 빠른 배포 프레임워크로 소개됐으며, 예시 명령은 모델을 GPU 8개에 분할하고 30000번 포트에 OpenAI 호환 API를 연다. GPU 수에 맞춰 텐서 병렬 크기를 조정하고, KV 캐시를 위한 여유 메모리가 필요하면 정적 메모리 비율을 낮추도록 안내한다. vLLM은 운영 서비스에 적합한 선택지로 제시되며, 단일 서빙 명령으로 Hub에서 가중치를 내려받아 GPU에 분할한 뒤 8000번 포트에서 OpenAI 호환 서버를 시작한다. 실제 대규모 실행에서는 여러 노드와 SLURM 같은 분산 도구가 필요할 수 있고, KV 캐시 한계에 부딪히면 최대 모델 문맥 길이를 제한할 수 있다. 자체 서버 없이 사용할 때는 Hugging Face Inference Providers를 OpenAI 클라이언트와 연결할 수 있으며, 모델 이름의 ‘:auto’ 접미사는 사용자 설정에 등록된 선호 제공자로 요청을 전달한다.

🧾 핵심 주장 / 시사점

  • Inkling은 활성 매개변수를 41B로 제한하고 혼합 어텐션과 SConv를 사용해 계산 효율을 추구하지만, 양자화본조차 600GB VRAM을 요구하므로 아키텍처 효율과 실제 하드웨어 접근성은 별개의 문제로 드러난다.
  • 텍스트·이미지·오디오가 동일한 AutoModelForMultimodalLM·AutoProcessor 및 채팅 메시지 형식을 공유하므로, 입력 형식별로 완전히 다른 추론 코드를 운용할 필요가 줄어든다.
  • 영상용 시간 차원은 구조에 포함돼 있지만 기본 영상 성능은 평가되지 않았으므로, 공개 시점에 확인된 핵심 범위는 텍스트·이미지·오디오이며 영상 활용은 후속 미세조정 영역으로 구분해야 한다.

✅ 액션 아이템

  • Inkling 자체 배포 후보를 BF16 2TB와 NVFP4 600GB VRAM 기준으로 나눠 실행 가능 범위를 먼저 정의한다.
  • Transformers·SGLang·vLLM·llama.cpp 경로를 단일 장비 실험과 다중 노드 서비스 목적별로 비교해 우선순위를 정한다.
  • 텍스트·이미지·오디오 동일 인터페이스를 1M 문맥 멀티모달 작업에 쓸지, 활성 41B·전문가 256개 제약을 기준으로 점검한다.

❓ 열린 질문

  • 975B 총량과 활성 41B 구조에서 실제 지연·처리량 목표를 만족하는 최소 GPU 구성은 무엇인가?
  • 전역·슬라이딩 윈도 1대 5 혼합 어텐션과 짧은 1D 합성곱이 1M 문맥에서 어떤 작업에 이득인가?
  • 계층적 MLP 이미지 패치와 100ms 멜 스펙트로그램 오디오 입력이 같은 생성 경로에서 품질을 어떻게 유지하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.