YouTubeTonbi''s AI Garage·2026년 8월 14일·0

Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment

Quick Summary

텍스트 전용 DS4 Flash에 Qwen3 VL 4B 비전 사이드카를 MCP 도구로 연결하면 본체를 재학습하거나 교체하지 않고도 이미지 이해 능력을 더할 수 있지만, 컨텍스트 급감과 시각 정보 오인식이라는 대가를 감수해야 한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment의 핵심 내용을 4단계로 요약한 인포그래픽
Adding Vision to a Text-Only LLM: A Local DS4-Flash Experiment 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

텍스트 전용 DS4-Flash에 Qwen3-VL-4B 비전 사이드카를 MCP 도구로 연결하면 본체를 재학습하거나 교체하지 않고도 이미지 이해 능력을 더할 수 있지만, 컨텍스트 급감과 시각 정보 오인식이라는 대가를 감수해야 한다.

📌 핵심 요점

  1. DS4-Flash 체크포인트에는 비전 타워·프로젝터·이미지 프로세서가 없으므로 설정만으로 시각 기능을 활성화할 수 없고, 직접 추가하려면 대규모 재학습이 필요하다.
  2. 실험은 Qwen3-VL-4B가 이미지 설명·OCR·최대 네 장 비교를 수행하고, DS4-Flash가 그 텍스트를 증거로 받아 최종 추론하는 비전 사이드카 구조를 채택했다. 원본 픽셀은 본체에 전달되지 않는다.
  3. 사이드카는 GPU 메모리 약 4%를 사용하는 40억 매개변수 모델로 구성됐으며, temperature 0과 사고 비활성화 설정을 통해 대화형 모델이 아닌 결정론적 추출 서비스로 제한됐다.
  4. 캐릭터의 골판지 질감, 복잡한 클레이메이션 장면, 저해상도 썸네일의 큰 제목과 일부 작은 정보를 인식했지만, Spotify 재생목록을 플러그인 목록으로 오인하는 환각도 발생했다. 픽셀을 볼 수 없는 DS4-Flash는 이런 오류를 자체 교정할 수 없었다.
  5. 단일 DGX Spark에서는 비전 모델을 함께 실행할 때 실제 컨텍스트 창이 24만 토큰에서 6만5천 토큰으로 약 72% 줄고, 메모리 뱅크와 디코딩 방식도 제한됐다. 메모리 감시기가 프로세스를 종료할 정도의 압박도 발생해 비전 기능은 기본적으로 꺼진 선택형 도구가 됐다.

🧩 배경과 문제 정의

  • 로컬 DS4-Flash는 코딩·추론·도구 사용 능력이 뛰어나지만, 비전 타워와 이미지 프로세서가 없는 텍스트 전용 모델이라 이미지 기반 작업을 직접 처리할 수 없다.
  • 모델 전체를 비전 데이터로 재학습하려면 막대한 GPU 자원과 시간이 필요하고, 소형 멀티모달 모델로 교체하면 기존 추론 성능을 포기해야 한다.
  • 소형 비전 모델이 이미지를 텍스트로 변환하고 DS4-Flash가 그 결과를 추론하는 사이드카 구조는 기존 모델을 유지할 수 있지만, 컨텍스트 축소와 시각 정보의 오인식이라는 대가가 따른다.

🕒 시간순 섹션별 상세정리

1. 텍스트 전용 모델이 드러낸 시각 처리 한계

  • 단일 DGX Spark에서 실행 중인 DS4-Flash에 썸네일 URL을 전달했지만, 여러 도구를 시도한 뒤에도 이미지 내용을 식별하지 못했다. 호스트의 비전 도구와 모델 자체가 모두 텍스트 전용이기 때문이다. [00:37]
  • 코딩과 에이전트 작업에는 충분히 강력하지만 이미지가 필요한 작업은 수행할 수 없어, 멀티모달 모델로 교체하지 않고 시각 기능만 보완할 방법이 필요하다. [01:00]

2. 모델 구조의 빈칸과 기존 해법의 한계

  • 로컬 DS4-Flash는 단일 DGX Spark에서도 추론·도구 사용·에이전트 워크플로와 복잡한 코딩 작업을 빠르게 처리하므로, 최종 답변을 맡길 핵심 모델로 유지할 가치가 크다. [03:29]
  • 체크포인트에는 비전 타워·프로젝터·이미지 프로세서가 아예 없으며, 이 구성요소들은 설정으로 활성화할 수 있는 옵션이 아니라 처음부터 구축되지 않은 신경망 구조다. [04:02]

3. 작은 비전 모델을 ‘눈’으로 고용하는 구조

  • 소형 비전 모델이 이미지를 읽어 관찰 내용을 텍스트로 기록하고, 대형 DS4-Flash가 그 텍스트를 바탕으로 추론한다. 시각 능력은 본체의 기능이 아니라 호출 가능한 도구가 된다. [05:04]
  • MCP 서버가 로컬 파일이나 URL을 불러와 큰 이미지를 축소하고 Base64 데이터 URI로 변환한 뒤, 포트 8889에서 실행되는 Qwen3-VL-4B에 전달한다. [05:49]

4. 결정론적 추출 서비스로 제한한 비전 사이드카

  • Qwen3-VL-4B 사이드카는 GPU 메모리의 약 4%를 사용하며, DS4-Flash와 동시에 실행해야 하므로 40억 매개변수의 작은 모델과 temperature 0·사고 비활성화 설정을 사용한다. [07:18]
  • 사이드카는 사용자와 대화하거나 추측하지 않고 이미지 설명·문자 추출·이미지 비교만 수행하는 추출 서비스다. 최종 판단과 답변은 주 모델이 담당한다. [07:52]

5. MCP 브리지와 오류를 줄이는 운영 규칙

  • MCP 브리지는 이미지 설명, 이미지 OCR, 최대 네 장의 이미지 비교라는 세 가지 도구를 제공하며, 로컬 경로와 URL을 Base64로 바꿔 사이드카의 OpenAI 호환 API를 호출한다. [08:31]
  • 이 도구들은 11개 이상의 에이전트 하네스에 자동 등록될 수 있고, Hermes Agent의 DS4-Flash에는 이미지 확인도 셸 명령과 같은 도구 호출로 보인다. [09:08]

6. 컨텍스트 비용과 전달 과정의 오류 위험

  • 비전 모드에서는 DS4-Flash의 KV 캐시가 약 249만 토큰에서 137만 토큰으로 줄어 작업 메모리의 거의 절반을 잃으며, 이 비용 때문에 비전 기능은 기본적으로 꺼져 있다. [10:14]
  • 본체가 픽셀을 검증하지 못하므로 사이드카가 놓친 세부 정보는 추론 단계에서 존재하지 않는 정보가 되고, 부정확한 설명은 그대로 잘못된 답변의 근거가 된다. [10:54]

7. 두 대용 레시피를 단일 DGX Spark에 맞춘 구성

  • 원본 저장소의 두 대 DGX Spark 구성을 그대로 사용할 수 없어, 동일한 Qwen 비전 모델을 단일 Spark의 메모리 조건에 맞게 재구성하고 MCP 도구 검색까지 완료했다. [12:05]
  • 별도 터미널에서 DS4-Flash 본체와 비전 사이드카를 동시에 실행했으며, 이미지 설명·OCR·비교 도구 세 개가 주 모델 세션에 정상 등록됐다. [12:44]

8. 첫 이미지 테스트와 메모리 감시기의 간섭

  • 단순한 애니메이션 캐릭터 이미지를 처음 요청했을 때 사이드카가 중단돼 있었지만, 원인은 비전 구성 자체가 아니라 메모리 사용량이 높아지면 프로세스를 종료하는 로컬 감시기였다. [13:51]
  • 감시기 문제를 해결한 뒤 MCP 호출은 붉은 갈색 머리·큰 눈·의상·포즈와 배경이 거의 없다는 특징까지 세부적으로 판독했다. [14:35]

9. 복잡한 클레이메이션 장면의 인식 결과

  • 공룡과 털매머드가 함께 있는 선사시대 클레이메이션 장면은 피사체와 배경 요소가 많아 첫 이미지보다 복잡한 시각 인식 조건을 만들었다. [15:50]
  • Qwen 비전 모델 자체는 영상을 지원하지만 현재 MCP 서버와 도구는 정지 이미지만 처리하므로, 이번 구성의 입력 범위도 이미지로 제한된다. [16:14]

10. 저해상도 URL 이미지에서 확인된 OCR과 환각

  • 로컬 파일보다 해상도가 낮은 원격 썸네일 URL을 입력해, 작은 글자와 복잡한 패널을 사이드카가 얼마나 읽을 수 있는지 확인했다. [17:27]
  • 큰 제목인 ‘Ultimate Guide to Hermes Desktop Plugins’를 정확히 추출하고, 육안으로 읽기 어려운 작은 영역에서도 주가 차트와 가격 정보를 식별했다. [17:45]

11. 단일 Spark에서 치르는 실제 성능 대가

  • 비전 모델을 함께 실행하면 실제 컨텍스트 창이 24만 토큰에서 6만5천 토큰으로 줄고, 메모리 뱅크도 하나만 사용할 수 있으며 일반 디코딩으로 제한돼 처리 속도까지 느려진다. [20:10]
  • 컨텍스트는 약 72% 감소하고 KV 캐시의 메모리 점유가 커져, 시연 중에는 한계치 접근으로 프로세스를 종료하던 메모리 감시기를 임시로 꺼야 했다. [20:29]

🧾 결론

  • 이 실험은 텍스트 전용 LLM을 네이티브 멀티모달 모델로 바꾸는 대신, 작은 비전 모델을 호출 가능한 ‘눈’으로 붙이는 현실적인 확장 방식을 보여준다.
  • 이미지 설명과 OCR 품질은 실제 에이전트 작업에 활용할 수준이었지만, 사이드카 출력은 정답이 아니라 검증이 필요한 증거로 다뤄야 한다.
  • 단일 DGX Spark 환경에서는 확보되는 시각 능력보다 컨텍스트·속도·안정성 손실이 클 수 있으므로, 현재 구조는 상시 기능보다 필요할 때만 켜는 선택형 기능에 적합하다.
  • 후속 개선의 핵심은 더 큰 모델로 교체하는 것이 아니라 사이드카 크기, 메모리 배치, 호출 조건을 조정해 인식 품질과 자원 비용의 균형을 높이는 데 있다.

📈 투자·시사 포인트

  • 강한 범용 추론 모델과 작은 전문 모델을 결합하는 구조는 AI 제품의 경쟁력이 단일 모델 성능뿐 아니라 모델 라우팅·도구 연결·역할 분리에서도 형성될 수 있음을 시사한다.
  • MCP 도구가 11개 이상의 에이전트 하네스에 등록될 수 있다는 점은 모델별 기능을 공통 인터페이스로 재사용하는 도구 생태계의 중요성을 보여준다.
  • 로컬 AI 인프라를 평가할 때는 모델 실행 여부만 볼 것이 아니라 비전 기능 활성화 후의 실제 컨텍스트, KV 캐시, 메모리 뱅크, 디코딩 속도까지 함께 측정해야 한다.
  • 사이드카의 오인식이 주 모델의 잘못된 답변으로 전파될 수 있으므로, 시각 추출 결과의 검증·관찰 가능성·실패 격리가 멀티모달 에이전트의 핵심 신뢰성 요소가 된다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 실험은 캐릭터 이미지, 클레이메이션 장면, 저해상도 썸네일 등 일부 사례에 한정됐으며, 이미지 유형·해상도별 정확도를 보여주는 정량 벤치마크는 제시되지 않았다.
  • KV 캐시가 약 249만 토큰에서 137만 토큰으로 줄었다는 수치와 실제 컨텍스트 창이 24만 토큰에서 6만5천 토큰으로 줄었다는 수치는 서로 다른 지표로 보이므로, 각각의 정의와 측정 조건을 확인해야 한다.
  • Qwen 비전 모델 자체는 영상을 지원하지만 현재 MCP 서버는 정지 이미지만 처리하므로, 영상 입력의 품질·속도·메모리 비용은 검증되지 않았다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 비전 기능은 기본 비활성화 상태로 유지하고, 이미지 설명·문자 판독·이미지 비교가 실제로 필요한 요청에서만 호출하도록 규칙을 설정한다.
  • 사이드카 반환값을 정답이 아닌 증거로 표시하고, 저해상도 OCR이나 복잡한 패널처럼 오류 위험이 큰 입력에는 재추출 또는 사람의 확인 절차를 둔다.
  • 비전 활성화 전후의 실제 컨텍스트 크기, KV 캐시, 메모리 사용량, 디코딩 속도와 감시기 종료 여부를 동일 조건에서 기록한다.
  • Spotify 재생목록 오인식과 같은 실패 사례를 회귀 테스트에 포함해 이미지 설명·OCR·비교 도구별 오류 양상을 추적한다.

❓ 열린 질문

  • 이미지 종류와 해상도를 확장했을 때 Qwen3-VL-4B 사이드카의 설명·OCR·비교 정확도는 어느 수준으로 유지되는가?
  • 여러 번의 추출이나 부분 영역 재확인이 Spotify 사례와 같은 시각 환각을 실질적으로 줄일 수 있는가?
  • 사이드카와 KV 캐시의 메모리 배치를 최적화하면 줄어든 컨텍스트와 디코딩 속도를 얼마나 회복할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.