ArticleRussell Brandom·2026년 9월 17일·0

Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire

Quick Summary

Baseten과 연구 조직 Base Labs가 Hugging Face·Goodfire AI와 협력해 오픈웨이트 모델의 훈련·배포에 안전성을 내장하는 평가·모니터링 인프라 표준을 추진한다.

Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire 관련 대표 이미지

🖼️ 인포그래픽

Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire의 핵심 내용을 4단계로 요약한 인포그래픽
Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Baseten과 연구 조직 Base Labs가 Hugging Face·Goodfire AI와 협력해 오픈웨이트 모델의 훈련·배포에 안전성을 내장하는 평가·모니터링 인프라 표준을 추진한다.

📌 핵심 요약

  • Baseten은 수요일 연구 조직 Base Labs와 함께 Hugging Face·Goodfire AI와 협력하는 오픈웨이트 모델 안전 평가·모니터링 인프라 표준을 발표했다.
  • 모델의 안전장치를 제거하는 abliteration 기법이 확산하며 안전성 논쟁이 이어지고 있으며, Hugging Face에는 이 기법이 적용된 모델이 6,000개 넘게 등록돼 있다.
  • Baseten이 올해 초 설립한 Base Labs는 오픈 모델의 훈련·모니터링 방법을 개발하고 공개할 예정이며, 안전 통제를 사후에 추가하기보다 훈련·배포 과정에 내장하는 투명한 표준을 지향한다.
  • 파트너십의 구체적인 기술 구현 방식은 공개되지 않았다. Goodfire AI는 안전성이 오픈 모델에 내장되고 모델 제공자에 의해 제공돼야 한다고 밝혔으며, 기사는 모델 해석 가능성 전문성을 근거로 내장 부분을 맡을 유력 후보로 지목했다.
  • Baseten은 6월 시리즈 F에서 15억 달러를 조달해 기업가치 130억 달러에 도달했고, Goodfire AI는 올해 초 B Capital 주도의 시리즈 B에서 1억 5,000만 달러를 조달했다. Baseten은 개발자 생태계에 프레임워크 기여를 공개적으로 요청했다.

🧩 주요 포인트

  1. abliteration 적용 모델 6,000개 초과 → 안전장치 제거 위험이 이번 오픈웨이트 모델 안전 인프라 추진의 배경이다.
  2. Base Labs의 방법 공개와 훈련·배포 단계의 안전 통제 내장 → Baseten은 개방성을 모델 행동 관찰과 투명한 안전 통제 구현에 유리한 조건으로 본다.
  3. 기술 구현 방식 미공개와 개발자 생태계 참여 요청 → 표준은 향후 공동 개발을 지향하며, Goodfire AI의 구체적인 역할과 구현 효과는 아직 확인되지 않았다.

🧠 상세 정리

1. 안전 인프라 협력과 추진 배경

Baseten은 수요일 연구 조직 Base Labs와 함께 오픈웨이트 모델을 위한 새로운 안전 인프라 표준을 발표했다. Hugging Face와 Goodfire AI가 파트너로 참여하며, 협력의 목표는 안전 평가와 모니터링 인프라를 구축하는 것이다. 이번 발표는 모델의 안전장치를 제거하는 abliteration 기법이 확산하면서 오픈웨이트 모델의 안전성을 둘러싼 논쟁이 이어지는 가운데 나왔다. 이 기법은 모델을 위험하게 만들 수 있으며, 오픈소스 AI 모델을 호스팅하는 Hugging Face에는 적용 모델이 6,000개 넘게 등록돼 있다. 기사는 이 수치를 통해 안전장치 제거 문제가 이미 상당한 규모에 이르렀음을 강조한다.

2. 훈련·배포에 안전성을 내장한다는 구상

Base Labs는 Baseten이 올해 초 출범시킨 연구 조직으로, 앞으로 오픈 모델의 훈련과 모니터링 방법을 개발하고 공개할 예정이다. 회사는 향후 작업을 투명한 오픈 모델 표준으로 제시하며, 안전성을 사후에 덧붙이기보다 훈련과 배포 과정에 내장하는 방향을 강조했다. Baseten은 X에서 개방성이 AI 안전에 이점이 된다고 주장했다. 모델 행동을 더 잘 관찰할 수 있고, 안전 연구를 실행 가능하고 투명한 통제로 전환할 수단도 폐쇄형보다 많다는 설명이다. 이는 개방성이 안전장치 제거를 가능하게 한다는 우려에 대해, 같은 개방성을 안전 연구와 통제 구현의 장점으로 활용하겠다는 입장이다.

3. Goodfire AI의 전문성과 남은 불확실성

참여 기업들은 파트너십이 기술적으로 어떻게 작동할지 아직 공개하지 않았다. Goodfire AI는 Baseten의 게시물에 대한 답변에서 안전성이 오픈 모델에 내장돼야 하며, 모델을 서비스하는 주체가 이를 제공해야 한다고 밝혔다. Goodfire AI는 AI의 ‘블랙박스’를 열어 모델이 어떻게 결정을 내리는지 설명하는 분야를 전문으로 한다. 기사는 이러한 전문성을 근거로 Goodfire AI가 안전성을 모델에 내장하는 부분을 맡을 가장 유력한 후보라고 평가했다. 다만 이는 기사에서 제시한 전망이며, 구체적인 역할 분담이나 기술 구현 방식이 확정돼 공개됐다는 의미는 아니다.

4. 자금 조달 기반과 개발자 참여 요청

AI 추론 제공업체인 Baseten은 6월 시리즈 F 투자에서 15억 달러를 조달했고, 기업가치는 130억 달러로 높아졌다. 파트너인 Goodfire AI도 올해 초 B Capital이 주도한 시리즈 B에서 1억 5,000만 달러를 조달해 모델 해석 가능성 플랫폼을 발전시킬 자금을 확보했다. 기사는 이러한 투자 이력을 통해 두 기업이 상당한 자금 기반을 갖추고 있음을 보여준다. 향후 추진 방향과 관련해 Baseten은 더 넓은 개발자 생태계에 프레임워크 기여를 공개적으로 요청했다. 회사는 모두에게 안전하고 접근 가능한 오픈 모델 생태계를 함께 구축하겠다는 목표를 제시했으며, 구체적인 기술 방식은 여전히 공개되지 않은 상태다.

🧾 핵심 주장 / 시사점

  • 이번 구상은 개방성이 안전장치 제거를 가능하게 하는 동시에 모델 행동 관찰과 안전 통제 연구에도 도움이 될 수 있다는 긴장을 드러낸다.
  • 훈련·배포 과정에 안전성을 내장하고 모델 제공자의 책임을 강조하는 방향은 안전을 모델 개발과 서비스 운영에 걸친 과제로 다룬다.
  • 참여 기업의 자금 조달과 개발자 참여 요청은 추진 기반을 보여주지만, 기술 구현 방식이 공개되지 않아 실제 안전 효과를 판단할 근거는 아직 제한적이다.

✅ 액션 아이템

  • Base Labs가 공개할 훈련·모니터링 방법에서 안전 통제의 내장 방식 확인.
  • 파트너십의 기술 구현 방식과 Goodfire AI의 구체적인 역할이 공개되는지 확인.
  • Baseten의 개발자 생태계 참여 요청에 따른 프레임워크 기여 방식 검토.

❓ 열린 질문

  • Base Labs의 훈련·배포 단계 안전 통제는 abliteration을 통한 안전장치 제거 위험에 어떻게 대응할 것인가?
  • Goodfire AI는 파트너십에서 어떤 구체적인 역할과 기술 구현을 맡게 될 것인가?
  • Baseten은 개발자 생태계의 기여를 어떤 방식으로 프레임워크에 반영할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.