Up to 3.2x Faster Inference with LFM2.5-DSpark
Quick Summary
Liquid AI는 세 LFM2.5 모델용 약 3억 매개변수 DSpark 초안 모델을 공개해 탐욕 디코딩의 출력 품질을 유지하면서 H100에서 최대 3.18배, M4 Max에서 최대 2.87배의 추론 가속과 LFM2.5 2.6B 함수 호출 지연 평균 57% 감소를 달성했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Liquid AI는 세 LFM2.5 모델용 약 3억 매개변수 DSpark 초안 모델을 공개해 탐욕 디코딩의 출력 품질을 유지하면서 H100에서 최대 3.18배, M4 Max에서 최대 2.87배의 추론 가속과 LFM2.5-2.6B 함수 호출 지연 평균 57% 감소를 달성했다.
📌 핵심 요약
- Liquid AI는 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B용 DSpark 체크포인트를 공개했으며, 소폭의 메모리 증가를 대가로 출력 품질을 바꾸지 않고 디코딩 처리량을 높였다.
- DSpark는 대상 모델의 문맥 특징을 이용하는 병렬 백본, 인접 토큰 의존성을 추가하는 순차 마르코프 헤드, 검증 비용이 이득보다 커질 때 낮은 신뢰도의 접미부를 제거하는 신뢰도 기반 검증기를 결합한다.
- 초안 모델은 SFT·대화·코드·함수 호출 데이터를 대상으로 15에포크 학습됐고, 최저 손실이 아니라 최고 승인율의 에포크가 선택됐으며, 5개 층과 블록 크기 9를 사용하는 295.7M 또는 327.7M 매개변수 구조로 구성됐다.
- 블록 크기 9, 배치 크기 1, 온도 0 조건에서 H100·SGLang은 최대 3.18배, M4 Max·llama.cpp는 최대 2.87배 빨라졌으며, LFM2.5-2.6B의 평균 가속은 각각 2.67배와 2.27배이고 함수 호출 지연은 평균 57% 감소했다.
- LFM2.5-1.2B-Instruct는 데이터셋에 따라 가속 폭이 최대 52% 달라졌고 평균 가속은 H100 2.10배·M4 Max 2.54배였으며, LFM2.5-8B-A1B는 높은 승인율에도 llama.cpp Metal의 현재 MoE 구현과 추가 가중치 트래픽 때문에 M4 Max 평균 가속이 1.18배에 그쳤다.
🧩 주요 포인트
- 탐욕 디코딩에서는 대상 모델이 모든 후보 토큰을 검증하고 거부된 자리를 직접 생성한 토큰으로 대체하므로, DSpark의 처리량 개선에도 기준 모델과 동일한 출력과 벤치마크 정확도가 유지된다.
- LFM2.5-1.2B-Instruct의 데이터 분포별 편차와 LFM2.5-8B-A1B의 M4 Max 결과는 승인율뿐 아니라 모델 구조, 하드웨어 백엔드, 검증 시 발생하는 가중치 이동이 실제 가속 폭을 좌우함을 보여준다.
- llama.cpp와 SGLang의 첫날 지원, 공개된 통합 코드, Safetensors·GGUF 체크포인트는 H100과 M4 Max에서 동일한 DSpark 방식을 실행할 수 있는 배포 경로를 제공한다.
🧠 상세 정리
1. DSpark 체크포인트 공개와 성능 목표
Liquid AI는 2026년 8월 20일 LFM2.5 계열을 위한 DSpark 초안 모델 체크포인트를 공개했다. 대상은 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B의 세 모델이며, 기존 대상 모델에 투기적 디코딩 경로를 추가한다. 이 방식은 소폭의 메모리 증가를 감수하는 대신 탐욕 디코딩의 출력 품질을 바꾸지 않으면서 처리량을 높이는 데 목적이 있다. 측정된 최고 가속은 단일 H100에서 3.18배, M4 Max 기기에서 2.87배였다. LFM2.5-2.6B의 여러 도구 사용 시나리오에서는 함수 호출 지연이 평균 57% 줄었다. llama.cpp와 SGLang용 LFM 호환 DSpark 통합도 공개와 동시에 상위 프로젝트에 오픈소스로 제공됐다.
2. 투기적 디코딩과 DSpark의 작동 방식
대규모 언어 모델의 디코딩 단계는 연산량보다 DRAM에서 SRAM으로 가중치를 반복 전송하는 과정의 영향을 크게 받기 때문에 전통적으로 메모리 대역폭에 제한된다. 투기적 디코딩은 가벼운 초안 모델이 여러 후보 토큰을 먼저 만들고, 대상 모델이 하나의 순전파에서 후보를 함께 검증해 가중치 적재 비용을 여러 토큰에 분산한다. DSpark의 병렬 백본은 대상 모델의 문맥 특징을 조건으로 사용하며 한 번의 순전파에서 모든 초안 토큰의 은닉 상태를 생성한다. 이어지는 경량 순차 헤드는 인접 토큰 사이를 마르코프 연쇄로 모델링해 뒤쪽 위치의 토큰 승인율을 높인다. 마지막으로 신뢰도 기반 검증기는 각 토큰이 살아남을 확률을 예측하고, 검증 비용이 예상 절감량보다 커지는 경우 낮은 신뢰도의 접미부를 제거한다.
3. 학습 구성과 출력 품질 동일성
Liquid AI는 SFT, 대화, 코드, 함수 호출을 포함하는 크고 다양한 데이터 조합으로 DSpark 학습 방식을 적용했다. 첫 초안 모델은 절제 실험 결과를 바탕으로 5개 층과 블록 크기 9를 갖춘 단순화된 어텐션 전용 구조로 설계됐다. 각 모델은 전체 데이터셋에서 15에포크 학습됐으며, 최저 손실이 아니라 가장 높은 토큰 승인율을 기록한 에포크가 최종 선택됐다. 공통 디코더 스택은 241.2M, 은닉 상태 투영부는 21.0M 매개변수이며, 마르코프 헤드는 모델에 따라 33.6M 또는 65.5M이다. 전체 크기는 LFM2.5-1.2B-Instruct용이 295.7M이고 나머지 두 모델용은 각각 327.7M이다. 탐욕 디코딩에서는 후보가 대상 모델의 분포와 일치할 때만 승인되고 거부 시 대상 모델의 토큰이 대신 출력되므로, 생성 결과와 pass@1 또는 정확 일치 점수는 기준 실행과 동일하다.
4. 평가 환경과 LFM2.5-2.6B 결과
기기 내 처리량은 M4 Max MacBook Pro에서 llama.cpp의 실험적 Metal 커널과 FP16 GGUF 가중치를 사용해 최대 256개 출력 토큰으로 측정됐다. GPU 평가는 단일 H100 80GB에서 SGLang과 BF16을 사용했으며, 양쪽 모두 블록 크기 9, 배치 크기 1, 온도 0으로 설정됐다. 평가는 MATH500, HumanEval, MBPP, GSM8K, MT-Bench의 다섯 데이터셋을 대상으로 수행됐다. LFM2.5-2.6B는 H100에서 평균 323토큰/초에서 864토큰/초로 올라 2.67배, M4 Max에서는 평균 61토큰/초에서 139토큰/초로 올라 2.27배의 가속을 기록했다. 개별 최고치는 H100의 MATH500에서 3.06배, M4 Max의 HumanEval에서 2.63배였다. 여러 도구를 사용하는 함수 호출 시나리오에서는 이 모델의 지연 시간이 평균 57% 감소했다.
5. 모델별 가속 차이와 하드웨어 제약
LFM2.5-1.2B-Instruct는 데이터셋별 승인율 편차가 비교적 커서 기반 텍스트 분포에 따라 가속 폭이 최대 52% 달라졌다. 평균적으로는 H100에서 656토큰/초가 1384토큰/초로 증가해 2.10배, M4 Max에서는 138토큰/초가 350토큰/초로 증가해 2.54배 빨라졌다. 이 모델의 M4 Max 최고 결과는 HumanEval의 2.87배였다. LFM2.5-8B-A1B는 평균 승인율이 10개 중 6.95개로 두 밀집 모델보다 높았고, H100에서는 평균 2.54배와 MATH500 기준 최고 3.18배를 기록했다. 그러나 M4 Max 평균 가속은 90토큰/초에서 106토큰/초로 늘어난 1.18배에 머물렀다. 원문은 이를 llama.cpp Metal 백엔드의 현재 MoE 구현과 여러 토큰을 검증할 때 더 많은 전문가가 활성화돼 가중치 트래픽이 증가하는 현상으로 설명한다.
6. SGLang·llama.cpp 실행과 체크포인트 배포
SGLang에서 실행하려면 LFM2 대상 DSpark를 지원하는 PR #31041 기반 빌드가 필요하며, 서버 시작 시 대상 모델과 대응하는 초안 모델을 함께 지정한다. 블록 크기는 초안 모델의 config.json에서 읽히고, 세 가지 투기적 디코딩 관련 옵션을 제거한 동일 명령이 기준 실행으로 사용된다. 서버가 시작되면 http://localhost:30000/v1의 OpenAI 호환 종단점으로 요청할 수 있다. llama.cpp에서는 PR #27383 기반 빌드와 대상 모델·DSpark 초안 모델의 GGUF 파일을 함께 사용하며, 최대 초안 길이는 사이드카 메타데이터의 블록 크기를 넘지 않도록 제한된다. 응답별 측정값은 제안한 토큰 수와 승인된 토큰 수를 각각 draft_n과 draft_n_accepted로 보고한다. 세 모델의 체크포인트는 Hugging Face에서 Safetensors와 GGUF 형식으로 제공되며, 두 실행 경로 모두 대상 모델이 모든 후보를 검증해 탐욕 디코딩 출력을 동일하게 유지한다.
🧾 핵심 주장 / 시사점
- DSpark의 탐욕 디코딩 가속은 출력 정확도를 낮추는 방식이 아니라, 약 3억 매개변수 초안 모델과 추가 메모리를 사용해 대상 모델의 가중치 적재 비용을 여러 후보 토큰에 분산하는 방식이다.
- LFM2.5-8B-A1B가 가장 높은 평균 승인율을 보이면서도 M4 Max에서 평균 1.18배에 머문 결과는 승인율만으로 최종 처리량을 판단할 수 없고 MoE 백엔드와 가중치 트래픽도 함께 봐야 함을 보여준다.
- LFM2.5-2.6B는 H100과 M4 Max 양쪽에서 평균 2배 이상의 가속을 기록하고 함수 호출 지연도 평균 57% 줄여, 일반 생성 처리량과 도구 사용 지연 모두에서 개선이 측정된 모델이다.
✅ 액션 아이템
- LFM2.5-2.6B의 H100·M4 Max 평균 가속과 함수 호출 지연 57% 감소를 실제 실행 조건에서 검증.
- LFM2.5-1.2B-Instruct의 최대 52% 편차와 LFM2.5-8B-A1B의 M4 Max 평균 1.18배 가속을 대상 데이터 분포별로 비교.
- llama.cpp와 SGLang에서 세 LFM2.5 DSpark 체크포인트의 탐욕 디코딩 출력 동일성과 처리량 개선을 확인.
❓ 열린 질문
- LFM2.5-2.6B의 함수 호출 지연 57% 감소가 대상 환경의 실제 호출 흐름에서도 재현되는가?
- LFM2.5-8B-A1B의 M4 Max 평균 1.18배 개선을 제한한 llama.cpp Metal의 MoE 구현과 가중치 트래픽 영향은 어느 정도인가?
- LFM2.5-1.2B-Instruct의 데이터셋별 최대 52% 가속 편차가 배포할 텍스트 분포에서는 어떻게 나타나는가?