Articlehuggingface.co·2026년 10월 8일·0

The model that didn't exist, so you made it yourself

Quick Summary

저자는 HuggingChat의 ML intern으로 전문 분야 모델, 이미지 LoRA, 경량 모델 등 6개 프로젝트를 수행하고, 약 USD 103의 연산 비용으로 평가 결과를 갖춘 공개 모델을 만들었다.

The model that didn't exist, so you made it yourself 관련 대표 이미지

🖼️ 인포그래픽

The model that didn't exist, so you made it yourself 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

The model that didn't exist, so you made it yourself의 핵심 내용을 4단계로 요약한 인포그래픽
The model that didn't exist, so you made it yourself 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

저자는 HuggingChat의 ML-intern으로 전문 분야 모델, 이미지 LoRA, 경량 모델 등 6개 프로젝트를 수행하고, 약 USD 103의 연산 비용으로 평가 결과를 갖춘 공개 모델을 만들었다.

📌 핵심 요약

  • ML-intern은 작업을 계획하고 유료 실행 전에 예산 승인을 요청한 뒤 시험 실행, 학습, 평가, 공개를 수행한다. 저자는 프롬프트에 정확한 데이터셋·기반 모델·학습 스크립트, 학습 전 기준 성능, 스모크 테스트, 비용 상한을 명시했다.
  • Citrus Doctor는 Qwen3.5-2B를 3,017개 주석 이미지로 미세조정해 335개 시험 사진에서 정확도를 14.9%에서 52.8%로 높였으며 연산 비용은 약 USD 1.90이었다. Huggy LoRA는 FLUX.2 klein base 4B와 84개 그림으로 학습했고, 200단계에서 캐릭터가 제대로 구현됐지만 500단계부터 무관한 프롬프트에도 스타일이 번졌다.
  • Qwen-Image 2.1 기반 Viewpoint Orbit LoRA는 1,844개 학습 쌍으로 카메라 각도 변경을 학습했으며 총 연산 비용은 약 USD 16이었다. Doodle-in LoRA는 6,042개 학습 쌍으로 낙서를 지정한 물체로 바꾸도록 학습했고, Viggle turbo LoRA와 결합한 6단계 생성에서 물체 검출률 67.5%, 편집당 4.7초를 기록했으며 비용은 약 USD 24였다.
  • Pocket Rewriter는 약 20 GB 메모리가 필요한 Qwen-Image 2.1의 9B 프롬프트 재작성 모델을 0.8B와 2B 학생 모델로 증류했다. 0.8B 모델은 CPU에서 실행되고 유효한 출력을 99.7% 제공하며 교사 모델의 약 4분의 1에 해당하는 토큰을 사용한다. 전체 연산 비용은 약 USD 16이었다.
  • Agate Preview 002는 260M 매개변수 모델로, 원래 가이던스를 적용한 50단계 생성에 이미지당 100회의 네트워크 실행이 필요했다. ML-intern은 이를 4회 실행으로 줄이고 브라우저용 ONNX로 내보냈다. 두 번째 학습 후 GenEval은 0.509에서 0.536으로 개선됐으며, 50단계 교사의 점수는 0.563이고 두 차례 총 연산 비용은 약 USD 37이었다.

🧩 주요 포인트

  1. 학습 전 기준 성능과 스모크 테스트를 요구하면 개선 여부와 학습 실행의 유효성을 구분할 수 있다. ML-intern의 사전 예산 승인과 비용 상한은 유료 실험의 지출 범위를 통제하는 장치다.
  2. Citrus Doctor의 정확도 상승과 Huggy LoRA의 500단계 이후 스타일 확산은 추가 학습의 효과가 작업과 체크포인트에 따라 달라짐을 보여준다. 최종 학습 단계보다 동일한 조건의 평가 결과가 모델 선택의 근거가 된다.
  3. Pocket Rewriter의 CPU 실행과 Agate Preview 002의 브라우저용 4단계 모델은 실행 환경에 맞춘 경량화 사례다. 유효 출력률 99.7%와 GenEval 0.536은 서로 다른 품질 지표이므로, 비용 절감과 함께 각 작업의 성능 제약을 판단해야 한다.

🧠 상세 정리

1. 원하는 모델이 없어서 직접 만든 출발점

저자는 Qwen-Image 2.1에 포함된 프롬프트 재작성 모델의 작은 버전을 원했지만, Hub에서는 같은 9B 모델을 압축한 사본만 찾았다고 설명한다. 공식 모델은 약 20 GB의 메모리가 필요하고, 문단 하나를 쓰기 전에 수천 개의 토큰으로 생각하는 방식이어서 원하는 실행 조건과 맞지 않았다. ML Intern에 요구를 설명한 다음 날 CPU에서 실행되는 0.8B 버전을 얻었으며, 유효 출력률은 99.7%, 토큰 사용량은 교사 모델의 약 4분의 1이었다. 9B 모델로 8,797개 요청의 재작성 예시를 생성하는 과정까지 포함한 연산 비용은 USD 16이었다. 이후 며칠 동안 같은 방식으로 다섯 개 모델 프로젝트를 더 진행했고, 각 작업은 ML-intern 모드를 켠 HuggingChat 메시지로 시작해 평가 결과가 모델 카드에 담긴 Hub 공개 모델로 끝났다.

2. 프롬프트에 명시한 근거·검증·예산

저자는 첫 메시지 작성에 가장 많은 노력을 들였으며, 감귤 모델의 첫 프롬프트는 약 450단어였지만 여섯 번째 프로젝트에서는 약 2,000단어로 늘었다고 설명한다. 원문 그대로의 프롬프트 일곱 개는 GitHub의 yvrjsharma/ml-intern-prompts에 공개돼 있고, 프롬프트는 한 줄 아이디어와 목적에 이어 정확한 데이터셋, 기반 모델, 학습 스크립트를 지정하는 구조다. 이미 확인한 내용은 ‘Verified facts, do not re-derive’ 아래에 두어 재조사에 예산을 쓰지 않도록 했으며, 카메라 각도 LoRA에서는 투명 이미지 지원을 추가한 학습 도구와 대체 도구의 위험을 보여주는 GitHub 이슈를 명시했다. 학습 전에는 같은 지표로 기반 모델의 제로샷 성능을 측정하도록 요청하고, 이미지 LoRA에서는 50단계 시험 학습 후 저장된 가중치가 실제로 바뀌었는지 확인하도록 했다. 마지막에는 모델 카드에 들어갈 내용과 기대 결과물을 정하고, 총지출을 USD 12로 제한하며 초과 전에 승인을 요청하라는 조건을 넣었다. ML-intern은 모든 작업을 예산 0달러에서 시작하고 유료 작업에 승인이 필요하며, 예산을 지정하지 않으면 프로젝트 규모에 따른 선택지를 제안한다. 다만 감귤 프로젝트에는 확인된 사실을 별도로 적는 항목이 없었는데도 정확도가 세 배 이상 높아졌으므로, 저자는 처음부터 모든 요소를 갖출 필요는 없다고 덧붙인다.

3. Citrus Doctor: 감귤 문제에 특화한 시각 모델

일반 시각 모델은 노랗게 변한 감귤 잎을 묘사할 수 있지만, 응애 문제인지 마그네슘 결핍인지 구별하고 생물학적·비생물학적 처치법까지 제시하기는 어렵다는 것이 이 프로젝트의 출발점이다. 저자는 Claude를 이용해 Hub의 Project-AgML 조직이 제공하는 세 자료원을 합쳤고, 21가지 해충·질병·영양 결핍 및 처치 접근법을 다루는 3,017개 주석 이미지의 citrus-disease-vlm-instruct 데이터셋을 구성했다. ML-intern은 먼저 기반 모델을 평가한 뒤 이 예시로 Qwen3.5-2B를 미세조정했다. 335개 시험 사진에서 문제를 정확히 명명한 비율은 기반 모델의 14.9%에서 미세조정 모델의 52.8%로 상승했다. 학습은 A10G 한 대에서 두 에포크 진행됐고 연산 비용은 약 USD 1.90으로, 원문은 이 결과를 특정 시험 자료에서 확인한 전문 분야 적응 사례로 제시한다.

4. Huggy LoRA: 캐릭터 재현과 과도한 스타일 확산

이미지 모델은 많은 캐릭터를 알고 있지만 Hugging Face 브랜드 자산의 평면적인 그림체로 그린 Huggy는 알지 못했기 때문에, 저자는 이 캐릭터를 학습하는 LoRA를 요청했다. 기반 모델은 FLUX.2 klein base 4B였고, 학습 자료는 Chunte/huggy_for_training의 캡션이 붙은 그림 84개였다. ML-intern은 100단계마다 체크포인트를 저장하고 각 체크포인트에서 같은 프롬프트 묶음으로 이미지를 생성해 비교할 수 있게 했다. 200단계가 Huggy의 모습이 처음으로 제대로 구현된 시점이었지만, 500단계부터는 Huggy와 관계없는 프롬프트에도 그 스타일이 번지기 시작했다. 학습한 LoRA는 증류된 klein 모델에서도 4단계 생성으로 작동했으며 연산 비용은 약 USD 7.60이었다. 이 사례에서 체크포인트 비교는 캐릭터 재현이 좋아지는 시점과 원치 않는 스타일 확산이 시작되는 시점을 구별하는 근거가 됐다.

5. Viewpoint Orbit LoRA: 새로운 카메라 각도 기능

이전 Qwen-Image 모델에서는 물체 사진을 넣고 왼쪽 45도 등 다른 시점의 모습을 요청하는 카메라 각도 LoRA가 인기 있었지만, 저자가 Qwen-Image 2.1 출시 며칠 뒤 확인했을 때는 해당 버전용 모델이 없었다. ML-intern은 Google Scanned Objects의 가정용 물체 스캔 1,030개를 각각 24개 각도에서 렌더링해 투명 이미지 24,722개를 만들었으며, 이 CPU 작업의 비용은 몇 센트였다. 이후 학습용 물체 461개와 시험용 물체 40개를 확정하고, 23가지 카메라 지시에 고르게 배분한 변환 전후 학습 쌍 1,844개를 구성했다. 학습은 A100 한 대에서 2,000단계 진행돼 약 90분이 걸렸고, 학습 자체의 비용은 약 USD 3.75였다. 전체 프로젝트에는 누락된 패키지나 잘못된 경로 때문에 실패한 뒤 ML-intern이 다시 제출한 작업까지 포함해 48개 작업이 필요했다. 총 소요 시간은 약 반나절, 전체 연산 비용은 약 USD 16이었으며, 본문은 이 사례의 정량적인 생성 품질 점수를 제시하지 않는다.

6. Doodle-in LoRA: 데이터 제작부터 낙서 기반 편집까지

Doodle-in LoRA는 사진에 자홍색 낙서를 그리고 짧은 프롬프트로 물체를 지정하면, 원래 조명과 구도를 유지하면서 낙서를 해당 물체로 바꾸는 기능을 목표로 했다. 기존 데이터셋이 없어 Open Images 사진에서 LaMa 인페인팅 모델로 물체 하나를 지우고 그 자리에 낙서를 넣으며, 손대지 않은 원본 사진을 목표 이미지로 삼는 제작 방식을 프롬프트에 적었다. ML-intern은 CPU 샌드박스에서 쌍 생성 스크립트를 작성·시험한 뒤 GPU 작업으로 실행했고, 각 원본 사진의 저자와 라이선스를 기록하면서 학습 쌍 6,042개와 시험 쌍 160개를 만들었으며 시험 쌍 중 40개는 학습에서 완전히 제외한 23개 물체 클래스에 속했다. 학습 전에는 기반 모델 단독 및 Viggle turbo LoRA 결합 상태를 평가하고, 묶음 편집에서도 동일한 이미지가 나오는지 확인해 평가 비용을 줄였으며, A100 한 대에서 2,000단계를 1시간 38분 동안 학습한 뒤 시험 쌍 48개로 체크포인트를 비교해 500단계를 선택했다. Viggle turbo LoRA와 결합한 6단계 생성에서는 지정 위치의 물체 검출률이 67.5%, 편집당 시간이 4.7초였고, 미학습 클래스와 나머지 클래스의 비교 수치는 각각 65.0%와 64.2%였다. 학습 자체의 비용은 약 USD 4였지만, 전체 프로젝트는 하루를 조금 넘겨 59개 작업을 수행했고 총 연산 비용은 약 USD 24였다.

7. Pocket Rewriter: 9B 교사를 CPU용 학생 모델로 증류

Pocket Rewriter의 데이터 제작은 Inference Providers를 통해 작은 지시 모델로 짧은 이미지 요청 8,797개를 생성하는 단계에서 시작됐다. 요청에는 사진·포스터·로고·인포그래픽 등이 섞였고, 약 3분의 1은 따옴표 안의 정확한 문구를 요구했으며 영어 이외 언어로 된 요청도 다수 포함됐다. 9B 교사는 A100 한 대에서 2시간 37분 동안 이 요청을 모두 재작성했고 비용은 약 USD 6.50이었으며, 품질 필터링 후 1,840개 예시를 학습용으로 선정했다. Qwen3.5 기반 0.8B와 2B 학생 모델의 학습은 A10G에서 각각 12분과 18분이 걸렸고 두 학습의 합산 비용은 USD 0.75였다. 0.8B 모델은 CPU 실행을 위한 812 MB GGUF 파일로도 제공되며, 원문 도입부는 유효 출력률 99.7%와 교사 대비 약 4분의 1의 토큰 사용량을 보고한다. 전체 프로젝트는 약 11시간 동안 24개 작업을 수행했고 총 연산 비용은 약 USD 16이었으며, 두 학생 모델과 데이터셋 외에도 Pocket Studio App 및 교사·학생을 비교하는 Rewriter Arena가 소개된다.

8. Agate 4-step: 브라우저 모델의 생성 횟수 축소

Logolabs의 Agate Preview 002는 260M 매개변수로 브라우저에서 실행할 만큼 작지만, 가이던스를 적용한 50단계 생성에는 이미지당 100회의 네트워크 실행이 필요해 저자는 이를 4회로 줄이도록 요청했다. 첫 실행에서는 학습 이미지 155,000개를 잠재 표현으로 캐시하고 가이던스를 모델에 내재화한 뒤, A100에서 단계 수를 16에서 8, 다시 4로 줄였다. 이 4단계 학생은 같은 4단계로 실행한 교사보다 GenEval과 FID에서 좋은 결과를 냈고 브라우저용 ONNX로 내보내졌으며, 첫 실행에는 약 13시간과 USD 22가 들었다. 저자가 추가 개선을 요청한 두 번째 실행에서는 교사를 16단계로 실행해 이미지 쌍 24,000개를 더 만들고, 이를 이용해 4단계 학생을 약 한 시간 미세조정했다. GenEval은 0.509에서 0.536으로 올랐고 50단계 교사의 점수는 0.563이었으며, 원문은 이 결과를 4단계이자 연산량 4분의 1이라고 표현하지만 해당 비율의 비교 기준을 별도로 설명하지 않는다. 브라우저 버전은 다시 내보내졌고 두 번째 실행의 전체 시간은 약 8시간, 두 실행을 합친 연산 비용은 약 USD 37이었다.

9. 비용의 범위와 저자가 제안한 시작 방식

비용 표는 Citrus Doctor USD 1.90, Huggy LoRA USD 7.60, Pocket Rewriter의 0.8B·2B 합계 USD 16.05, Viewpoint Orbit LoRA USD 16, Doodle-in LoRA USD 24.30, Agate의 두 실행 합계 USD 37을 제시한다. 전체는 약 USD 103으로 정리되며, 이 금액은 각 세션에 보고된 GPU와 CPU 작업 요금이라는 범위가 명시돼 있다. 저자는 HuggingChat에서 ML-intern 모드를 켜고 프롬프트를 붙여 넣는 방식으로 시작할 수 있으며, 공개한 예시 프롬프트도 자유롭게 복사할 수 있다고 안내한다. 출발점으로는 존재하기를 바라는 모델과 이미 보유했거나 제작 방식을 설명할 수 있는 데이터셋을 제안한다. 또한 작은 예산을 정하고 기준 성능과 스모크 테스트를 요청한 뒤, 반환된 결과를 읽고 나서 비용 상한을 높이라는 순서를 권한다. 글은 자신만의 모델을 만들었다면 X에서 공유하고 @Gradio와 @HuggingFace를 태그해 달라는 초대로 마무리된다.

🧾 핵심 주장 / 시사점

  • Citrus Doctor의 14.9%에서 52.8%로의 상승은 학습 전후를 같은 시험 자료로 비교했기 때문에 해석할 수 있다. 반면 유효 출력률이나 생성 속도만으로는 다른 종류의 모델 품질까지 판단할 수 없다.
  • Huggy LoRA의 스타일 확산과 Doodle-in LoRA의 500단계 체크포인트 선택은 더 오래 학습한 결과가 항상 적합한 결과는 아님을 보여준다. 중간 결과를 같은 조건에서 비교하는 과정이 실질적인 모델 선택에 기여했다.
  • 낮은 학습 비용과 전체 프로젝트 비용은 구분된다. Viewpoint Orbit LoRA와 Doodle-in LoRA에서는 데이터 제작, 평가, 재실행 등 여러 작업이 포함돼 전체 비용이 학습 자체의 비용보다 컸다.

✅ 액션 아이템

  • ML-intern 프롬프트에 학습 전 기준 성능, 스모크 테스트, 비용 상한을 명시하고 유료 실행 전 예산 승인 조건 확인.
  • Huggy LoRA의 200단계 캐릭터 재현과 500단계 이후 스타일 확산을 함께 고려해 동일한 프롬프트의 체크포인트 결과 비교.
  • Pocket Rewriter의 CPU 실행·유효 출력률 99.7%와 Agate Preview 002의 브라우저 실행·GenEval 0.536을 각 사용 목적의 성능 제약과 함께 검토.

❓ 열린 질문

  • Citrus Doctor가 335개 시험 사진에서 기록한 정확도 52.8%는 목표로 하는 감귤 문제 식별에 충분한가?
  • Huggy LoRA는 200단계의 캐릭터 재현과 500단계 이후의 스타일 확산을 고려할 때 어떤 체크포인트가 사용 목적에 가장 적합한가?
  • Agate Preview 002의 4단계 학생이 기록한 GenEval 0.536과 50단계 교사의 0.563 차이는 브라우저 실행에서 받아들일 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.