ArticleRebecca Bellan·2026년 9월 3일·0

Abliteration.ai is making a business out of removing AI guardrails

Quick Summary

Abliteration.ai가 GLM 5.3 등 공개 가중치 모델의 안전장치 제거를 서비스로 상용화하면서, 보안 방어 효용과 유해 행위 접근성 확대를 둘러싼 논쟁이 커지고 있다.

Abliteration.ai is making a business out of removing AI guardrails 관련 대표 이미지

🖼️ 인포그래픽

Abliteration.ai is making a business out of removing AI guardrails 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Abliteration.ai is making a business out of removing AI guardrails의 핵심 내용을 4단계로 요약한 인포그래픽
Abliteration.ai is making a business out of removing AI guardrails 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Abliteration.ai가 GLM-5.3 등 공개 가중치 모델의 안전장치 제거를 서비스로 상용화하면서, 보안 방어 효용과 유해 행위 접근성 확대를 둘러싼 논쟁이 커지고 있다.

📌 핵심 요약

  • Abliteration.ai는 Z.ai의 GLM-5.3을 비롯해 유해 요청 거부 성향을 제거한 공개 가중치 모델을 웹 브라우저와 API로 제공하며, 직접 모델을 내려받고 연산 자원을 확보해야 하는 부담을 줄였다.
  • TechCrunch는 무료 계정으로 수정된 GLM-5.3을 시험했고, 크롬 저장 비밀번호 탈취 프로그램과 위험한 인체 병원체의 가정 내 배양 절차 요청에 모델이 응답했다고 보도했다.
  • 공동창업자 Devon은 고객 매출로 주요 클라우드 제공업체와의 여러 계약을 감당하고 있으며, 아직 벤처투자는 받지 않았지만 투자 유치를 논의 중이라고 밝혔다.
  • CivAI의 Andrew Yoon은 유해 사이버·생물무기 활동을 탐지·차단하는 분류기와 고성능 GPU 이용자 신원 확인을 제안했다. Abliteration.ai는 고객용 조정 계층과 일부 제한을 제공하지만, 고객 신원 확인은 결제 카드 기록 외에 도입하지 않았다.
  • Devon은 안전장치 제거 모델이 레드팀의 공격자 행동 재현에 필수적이라고 주장하지만, Fabraix와 Armadin은 현재 다른 방법을 활용하고 있다. Fabraix와 Safe Intelligence는 안전장치 제거에 따른 모델 능력 저하 가능성도 지적했다.

🧩 주요 포인트

  1. 기존 안전장치 제거 기법의 호스팅 서비스화 → 논쟁의 초점이 기법의 존재뿐 아니라 이용 문턱 하락과 제공업체의 책임으로 확대된다.
  2. GLM-5.3의 유해 요청 응답과 제한적인 고객 신원 확인 → 모델 자체의 거부 기능뿐 아니라 서비스 차원의 탐지·차단 및 접근 통제가 쟁점이 된다.
  3. 레드팀 효용 주장과 업체별 활용 방식의 차이 → 공격자 행동 재현의 필요성과 안전장치 제거 모델의 필수성·성능은 구분해서 평가해야 한다.

🧠 상세 정리

1. 안전장치 제거 기법의 서비스화

Abliteration.ai는 모델이 유해 요청을 거부하는 성향을 제거하는 기법에서 이름을 따왔으며, 이를 상업적으로 제공하는 플랫폼을 운영한다. 플랫폼은 Z.ai가 최근 공개한 GLM-5.3을 포함해 안전장치를 제거한 공개 가중치 모델을 호스팅하고, 사용자가 웹 브라우저나 API로 질의할 수 있도록 한다. 연구자와 개발자가 공개 가중치 모델의 거부 기능을 제거해 온 역사는 오래됐고, Hugging Face에도 이런 수정 모델이 수천 개 올라와 있다. 이 회사는 기존에 모델을 직접 내려받고 실행에 필요한 연산 자원을 확보해야 했던 이용 절차를 줄여, 이미 존재하던 기법을 쉽게 접근할 수 있는 서비스로 바꿨다.

2. 보안 테스트라는 목적과 실제 유해 응답

회사는 다른 모델이 거부하는 공격적 사이버 활동, 레드팀 작업, 에이전트 테스트를 가능하게 하는 것이 목표라고 설명했다. 그 근거는 공격 행동을 재현할 수 있어야 방어할 수 있으며, 작동하는 공격 코드를 작성하지 않는 모델은 레드팀의 방어 업무를 제약한다는 주장이다. 그러나 동일한 거부 기능 제거는 보안 테스트 외의 잠재적으로 위험한 요청도 수행하기 쉽게 만든다. TechCrunch는 무료 계정을 만든 뒤 웹 브라우저에서 수정된 GLM-5.3에 크롬 저장 비밀번호 탈취 프로그램과 위험한 인체 병원체의 가정 내 배양 절차를 요청했고, 모델이 두 요청에 응했다고 보도했다. 이 시험 결과는 해당 서비스에서 유해 요청에 대한 응답을 얻을 수 있음을 보여주지만, 기사에는 그 결과물의 실제 효과를 검증했다는 내용은 없다.

3. 고객 매출에 기반한 초기 사업 운영

Abliteration.ai는 기사 기준 전년도 말에 설립됐으며, 공식 법인 등록은 3월에 이뤄졌다. 공동창업자 Devon은 주요 클라우드 제공업체들과 여러 계약을 맺었고, 그 비용을 전적으로 고객 매출로 감당하고 있다고 말했다. 회사는 아직 벤처투자를 받지 않았으나 투자 유치를 위한 논의를 진행 중이라고 밝혔다. 기사에서 확인되는 사업 방식은 수정된 모델을 직접 호스팅해 접근을 제공하는 것으로, 이용자가 자체 실행 환경을 마련해야 하는 부담을 줄이는 데 초점이 있다. 다만 클라우드 계약의 상대방과 규모, 구체적인 매출액이나 투자 논의 조건은 제시되지 않아, 이 설명만으로 회사의 사업 규모나 수익성을 확정할 수는 없다.

4. 악용 우려와 정부 개입 지점

CivAI의 연구 책임자 Andrew Yoon은 안전장치를 제거한 모델이 어떤 요청에도 응하도록 수정될 수 있다며, 이런 모델의 대규모 제공이 실제 피해로 이어질 수 있다고 경고했다. 그는 가까운 미래에 수정된 모델이 위해 행위에 사용되는 사례가 나타날 것으로 예상한다고 밝혔다. TechCrunch가 인터뷰한 전문가 대부분은 공개 가중치 모델에서 안전장치를 제거하는 흐름 자체를 막기 어렵다고 봤다. 이에 Yoon은 정부가 제공업체에 유해 사이버 활동과 생물무기 관련 활동을 탐지하고 차단하는 분류기 운영을 요구할 것을 제안했다. 또한 고성능 GPU에 대한 직접 접근을 임대하는 기업에는 고객 신원을 확인하고, 위험한 오용을 의심할 이유가 있으면 접근을 거부하도록 요구해야 한다고 주장했다.

5. 플랫폼의 제한과 미정인 책임 범위

Abliteration.ai는 고객이 원하는 안전장치를 추가할 수 있도록 조정 계층을 제공하며, 플랫폼 자체에도 일부 제한을 두고 있다. TechCrunch의 시험에서는 자살 방법을 안내하도록 유도하지 못했고, Devon은 폭력을 방지하기 위한 추가 제한을 구현하고 있다고 말했다. 다만 고객 신원 확인은 서비스를 구매할 때 사용한 신용카드를 기록하는 것 외에는 도입하지 않았다고 회사는 설명했다. Devon은 누가 접근할 수 있는지 결정하는 문제가 어렵고, 회사가 어디까지 책임져야 하는지도 아직 정하는 과정에 있다고 밝혔다. 따라서 기사에 나타난 운영 상태는 모든 요청을 무제한 허용하는 체계로 단정하기보다, 일부 제한이 존재하지만 접근 자격과 기업 책임의 경계는 정립 중인 상태로 볼 수 있다.

6. 방어자에게 같은 도구가 필요하다는 주장

Devon과 지지자들은 검열되지 않은 최상위급 모델에 대한 접근을 넓히는 것이 방어에 도움이 된다고 주장한다. Devon은 안전장치를 제거한 모델로 악의적 행위자의 행동을 재현할 수 있으며, 방어자가 필요한 도구를 확보하면 대응 속도를 높이고 사이버보안을 발전시킬 수 있다고 설명했다. 그에 따르면 고객에는 영국과 유럽의 초기 레드팀 스타트업 여러 곳이 포함되며, 이들은 은행과 항공사 등 중요 기반시설과 관련된 기업의 보안을 지원한다. 그는 주요 고객 중 한 곳이 은행의 에이전트를 레드팀 방식으로 시험하고 있고, 현재 모델의 기본 상태로는 그 작업을 수행할 수 없다고 말했다. 이는 회사가 제시한 방어 활용 근거이지만, 기사에는 이러한 고객의 성과를 독립적으로 측정한 결과는 제시되지 않았다.

7. 미세조정이라는 대안과 능력 저하 논쟁

TechCrunch가 접촉한 여러 에이전트 레드팀 업체는 공격자들이 이미 자체적으로 안전장치를 제거한 모델을 사용한다는 점에서 방어자에게도 같은 도구가 유용할 수 있다는 주장에 동의했다. 그러나 실제 업무에서 이 모델이 얼마나 중요한지를 두고는 의견이 갈렸으며, 일부는 원래 안전장치가 적은 공개 가중치 모델을 미세조정해 테스트한다고 밝혔다. Fabraix의 최고경영자 Ahmed Aly는 자사가 안전장치 제거 모델보다 공개 모델의 미세조정에 더 의존하며, 안전장치 제거 과정에서 일부 지식과 능력이 손실된다고 말했다. 그는 이런 손실 때문에 실제 사이버·생물학적 위해를 가하려는 경우에도 효과가 떨어질 수 있다고 주장했다. Safe Intelligence의 최고기술자 Alessio Lomuscio도 능력 저하 가능성에 동의했지만, 시스템의 스트레스 테스트에 유용한 특정 행동을 유도할 수 있다는 가치는 인정했다.

8. 공개 연구의 가치와 남은 평가 과제

Armadin의 창업자이자 수석 설계자인 David Slater는 지금까지 안전장치 제거 모델이 자사의 작업 과정에 포함되지 않았다고 밝혔다. 그는 가장 최근 세대 이전의 공개 가중치 모델은 탈옥을 통해 원하는 행동을 끌어내기가 특별히 어렵지 않았다고 설명했다. 다만 Armadin은 안전장치 제거 기법을 연구하고 있으며, 공개 커뮤니티가 모델의 능력을 이해하도록 하는 일이 중요하다고 봤다. Slater는 이런 작업이 비공개로도 진행될 것이므로 공개 연구가 연구자에게 도구를 제공하고, 실제 모델 능력의 경계와 위해 가능성을 파악하는 데 도움이 된다고 주장했다. 기사는 접근성 확대가 방어를 강화하는지 위험을 높이는지라는 질문을 남기며, 방어 활용의 가치와 안전장치 제거의 필수성에 대한 업계의 평가가 아직 일치하지 않음을 보여준다.

🧾 핵심 주장 / 시사점

  • Abliteration.ai의 차별점은 안전장치 제거 기법의 발명보다 호스팅을 통한 접근성 확대에 있으며, 이 변화가 방어 활용과 악용 모두의 이용 문턱을 낮춘다.
  • 안전장치 제거를 막기 어렵다는 전문가들의 판단은 정책 논의를 서비스 제공업체의 탐지·차단과 연산 자원 접근 통제로 이동시킨다.
  • 유해 요청에 응한다는 사실과 실제 작업 수행 능력은 별개의 평가 대상이며, 업체들의 상반된 견해는 레드팀 효용을 응답 여부만으로 판단하기 어렵다는 점을 드러낸다.

✅ 액션 아이템

  • Abliteration.ai의 접근성 확대가 보안 방어 효용과 유해 행위 접근성에 미치는 영향을 함께 검토.
  • GLM-5.3의 유해 요청 응답을 근거로 서비스 차원의 탐지·차단 및 고객 신원 확인 수준을 점검.
  • 레드팀 활용을 평가할 때 Fabraix와 Armadin의 다른 활용 방식 및 안전장치 제거에 따른 성능 저하 가능성을 함께 비교.

❓ 열린 질문

  • Abliteration.ai의 이용 문턱 하락은 보안 방어 효용과 유해 행위 접근성에 각각 어떤 영향을 미치는가?
  • GLM-5.3의 유해 요청 응답에 대응하려면 서비스 차원의 탐지·차단과 고객 신원 확인을 어느 수준으로 적용해야 하는가?
  • 레드팀에서 안전장치 제거 모델은 다른 방법과 비교해 성능 저하 가능성을 감수할 만큼 필수적인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.