Articleopenai.com·2025년 1월 23일·3

Operator System Card

Quick Summary

오퍼레이터는 화면을 보고 브라우저를 조작하는 컴퓨터 사용 에이전트로, 오픈AI는 실제 행동에서 발생할 수 있는 피해를 줄이기 위해 위험 작업 거부, 중요 행동 전 사용자 확인, 외부 레드팀, 프런티어 위험 평가를 결합한 다층 안전 체계를 적용했다.

Operator System Card 관련 대표 이미지

🖼️ 인포그래픽

Operator System Card 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Operator System Card의 핵심 내용을 4단계로 요약한 인포그래픽
Operator System Card 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

오퍼레이터는 화면을 보고 브라우저를 조작하는 컴퓨터 사용 에이전트로, 오픈AI는 실제 행동에서 발생할 수 있는 피해를 줄이기 위해 위험 작업 거부, 중요 행동 전 사용자 확인, 외부 레드팀, 프런티어 위험 평가를 결합한 다층 안전 체계를 적용했다.

📌 핵심 요약

  • 오퍼레이터는 GPT-4o의 시각 능력과 강화학습 기반 추론을 결합해 스크린샷을 해석하고 커서와 키보드로 그래픽 사용자 인터페이스를 조작하는 컴퓨터 사용 에이전트의 연구용 프리뷰다.
  • 사용자는 상품 주문, 예약, 행사 티켓 구매와 같은 브라우저 작업을 맡길 수 있지만, 프롬프트 인젝션, 되돌리기 어려운 실수, 유해하거나 금지된 작업 수행이라는 새로운 위험이 발생한다.
  • 오픈AI는 작업과 개별 행동의 위험도 및 결과의 가역성을 구분해 평가하고, 결제·이메일 발송·일정 삭제 같은 중요 행동에는 사용자 감독과 명시적 확인을 요구하며 주식 거래처럼 위험이 큰 작업은 제한했다.
  • 내부 레드팀 이후 20개국과 24개 언어권의 외부 레드팀이 프롬프트 인젝션과 탈옥을 포함한 우회 시도를 시험했으며, 실제 피해를 피하기 위해 모의 웹사이트·데이터베이스·이메일 환경도 사용했다.
  • 준비태세 프레임워크 평가에서 컴퓨터 사용이 영향을 줄 수 있는 생화학 위험 도구 활용과 자율 복제 능력을 별도로 시험했으며, 사전 완화 상태의 오퍼레이터는 두 범주 모두 낮은 위험으로 평가됐다.

🧩 주요 포인트

  1. 오퍼레이터는 GPT-4o의 시각 능력과 강화학습 기반 추론을 결합해 스크린샷을 해석하고 커서와 키보드로 그래픽 사용자 인터페이스를 조작하는 컴퓨터 사용 에이전트의 연구용 프리뷰다.
  2. 사용자는 상품 주문, 예약, 행사 티켓 구매와 같은 브라우저 작업을 맡길 수 있지만, 프롬프트 인젝션, 되돌리기 어려운 실수, 유해하거나 금지된 작업 수행이라는 새로운 위험이 발생한다.
  3. 오픈AI는 작업과 개별 행동의 위험도 및 결과의 가역성을 구분해 평가하고, 결제·이메일 발송·일정 삭제 같은 중요 행동에는 사용자 감독과 명시적 확인을 요구하며 주식 거래처럼 위험이 큰 작업은 제한했다.
  4. 내부 레드팀 이후 20개국과 24개 언어권의 외부 레드팀이 프롬프트 인젝션과 탈옥을 포함한 우회 시도를 시험했으며, 실제 피해를 피하기 위해 모의 웹사이트·데이터베이스·이메일 환경도 사용했다.
  5. 준비태세 프레임워크 평가에서 컴퓨터 사용이 영향을 줄 수 있는 생화학 위험 도구 활용과 자율 복제 능력을 별도로 시험했으며, 사전 완화 상태의 오퍼레이터는 두 범주 모두 낮은 위험으로 평가됐다.

🧠 상세 정리

1. 오퍼레이터의 목적과 컴퓨터 사용 방식

오퍼레이터는 오픈AI의 컴퓨터 사용 에이전트 모델을 연구용 프리뷰 형태로 제공한 것으로, GPT-4o의 시각 능력에 강화학습으로 발전시킨 추론 능력을 결합한다. 모델은 별도의 구조화된 웹 인터페이스에만 의존하지 않고 사람이 보는 것과 같은 스크린샷을 해석해 화면의 버튼, 메뉴, 텍스트 입력란을 식별하며 커서와 키보드로 조작한다. 사용자는 식료품 주문, 식당 예약, 행사 티켓 구매처럼 일상적인 브라우저 작업을 지시할 수 있고, 모델은 사용자의 지시와 감독 아래 필요한 단계를 수행한다. 이는 챗GPT가 질문에 답하는 역할을 넘어 사용자를 대신해 실제 행동을 수행하는 방향으로 확장되는 사례이지만, 인터넷에서의 행동이 현실적인 결과를 낳는 만큼 기존 대화형 모델보다 강한 안전 통제가 요구된다.

2. 학습 구성과 사용 데이터

오퍼레이터는 사람이 컴퓨터를 사용하는 방식과 유사하게 화면을 시각적으로 인식하고 커서와 키보드로 조작하도록 학습됐다. 지도학습은 화면을 읽고 사용자 인터페이스 요소를 정확히 클릭하는 데 필요한 기본적인 지각 능력과 입력 제어 능력을 가르치는 역할을 한다. 강화학습은 단순한 클릭을 넘어 작업 순서를 추론하고, 오류를 수정하며, 예상하지 못한 화면이나 사건에 적응하는 고차원 능력을 강화한다. 학습 데이터에는 업계 표준 머신러닝 데이터셋과 웹 크롤링에서 수집한 일부 공개 데이터가 포함됐으며, 사람이 컴퓨터 작업을 해결하는 과정을 시연해 만든 데이터셋도 사용됐다. 보고서는 이러한 학습 구성이 오퍼레이터의 기본 작동 원리를 설명하지만, 실제 배포 안전성은 별도의 정책·제품 통제·평가 체계를 통해 보완해야 한다고 다룬다.

3. 새롭게 발생하는 위험과 다층 방어

컴퓨터를 직접 조작하는 능력은 기술 접근성을 넓힐 가능성과 함께 새로운 위험 경로를 만든다. 대표적인 위험은 제삼자 웹사이트에 삽입된 악성 지시가 모델을 속여 사용자의 본래 의도에서 벗어나게 하는 프롬프트 인젝션이며, 모델이 되돌리기 어려운 실수를 하거나 사용자의 요청에 따라 유해하거나 금지된 작업을 실행할 가능성도 포함된다. 오픈AI는 이에 대응해 위험도가 높은 작업을 선제적으로 거부하고, 중요한 행동 직전에 사용자에게 확인을 요청하며, 잠재적인 위협을 탐지하고 완화하는 능동적 모니터링 체계를 적용했다. 이 접근은 기반 모델인 GPT-4o에 대해 수행했던 안전 작업과 기존 오픈AI 안전 프레임워크를 토대로 하되, 화면 조작과 인터넷 행동에서 새롭게 나타나는 취약점을 모델 수준과 제품 수준에서 함께 다루는 방식이다.

4. 작업과 행동을 구분한 위험 정책

오픈AI는 사용자가 달성하려는 목표를 작업으로, 모델이 그 목표를 이루기 위해 수행하는 개별 단계를 행동으로 구분해 위험을 분석했다. 위험도는 사용자나 다른 사람에게 발생할 수 있는 피해의 크기뿐 아니라 부정적인 결과를 얼마나 쉽게 되돌릴 수 있는지도 고려해 분류했다. 예를 들어 신발 구매라는 작업에는 상품 검색, 판매자 결제 페이지 이동, 실제 구매 완료라는 여러 행동이 포함되며, 잘못된 상품을 구매하면 사용자에게 불편과 손실을 줄 수 있으므로 최종 구매에는 별도의 안전장치가 필요하다. 이에 따라 금융 거래, 이메일 발송, 일정 삭제 같은 중요한 행동에서는 핵심 단계에 사람의 감독을 두고 실행 전 명시적 확인을 요구해 사용자가 진행 상황과 결과를 통제하도록 했다. 위험이 지나치게 크다고 판단한 경우에는 보조 자체를 제한했으며, 보고서는 주식의 판매나 구매를 그 사례로 제시한다.

5. 내부·외부 레드팀과 현실적 시험의 한계

오픈AI는 과거 배포 경험과 내부 시험, 법무·보안·정책 조직의 의견을 결합해 즉각적인 위험과 새롭게 등장할 수 있는 문제를 조사했다. 먼저 모델 및 제품 수준의 완화책을 적용하지 않은 상태에서 안전·보안·제품 조직 구성원이 내부 레드팀을 수행했으며, 실제 피해가 발생하기 전에 시험자가 개입하도록 했다. 내부 시험에서 확인한 문제를 토대로 초기 안전장치를 추가한 뒤, 20개국에 거주하고 24개 언어를 구사하는 검증된 외부 레드팀에게 오퍼레이터를 제공해 프롬프트 인젝션과 탈옥을 비롯한 보호 장치 우회 방법을 탐색하게 했다. 인터넷 접근이 가능한 모델이라는 점 때문에 실제 피해를 유발할 수 있는 작업은 피하도록 했고, 일부 시험에서는 모의 웹사이트·데이터베이스·이메일을 만들어 공격 가능성을 안전하게 재현했다. 이 제약으로 최악의 현실 위험을 완전히 포착했다고 볼 수는 없지만, 발견된 취약점은 추가 완화책에 반영됐으며 제한된 사용자에게 연구용 프리뷰로 먼저 배포해 실제 사용을 면밀히 관찰하는 근거가 됐다.

6. 준비태세 프레임워크에 따른 프런티어 위험 평가

오퍼레이터는 오픈AI 준비태세 프레임워크의 설득, 사이버보안, 화학·생물학·방사선·핵 위험, 모델 자율성이라는 네 가지 프런티어 위험 범주에 따라 평가됐다. GPT-4o를 기반으로 학습됐기 때문에 설득과 사이버보안 범주의 위험 수준은 기반 모델의 평가를 이어받아 각각 중간과 낮음으로 제시됐다. 오퍼레이터에서 새로 증가한 핵심 능력은 키보드와 커서를 이용한 시각적 브라우징이므로, 보고서는 컴퓨터 사용이 실질적으로 영향을 줄 수 있는 생물학적 위험 도구 활용과 자율 복제 평가를 컴퓨터 사용 환경에 맞게 수정했다. 평가 결과 완화책을 적용하기 전의 오퍼레이터는 화학·생물학·방사선·핵 범주와 모델 자율성 범주 모두 낮은 위험으로 분류됐으며, 이는 GPT-4o의 해당 위험 수준과 일치했다. 보고서의 점수 기준상 완화 후 위험이 중간 이하인 모델만 배포할 수 있고, 높음 이하인 모델만 추가 개발할 수 있다.

7. 생물학적 위험 도구 평가와 관찰 결과

생물학적 위험 평가에서는 오퍼레이터가 외부 자원에 연결해 습식 실험이나 새로운 생물학적 설계 작업의 핵심 단계를 자동화할 수 있는지를 시험했다. 브라우징 환경을 제공한 뒤 단백질 구조 예측 도구 사용, 유럽 뉴클레오타이드 아카이브에서 특정 에볼라 바이러스의 염기서열 파일 찾기, 합성 유전자 주문 사이트의 업로드 단계 도달과 같은 과제를 수행하게 했으며, 전체 과제 성공률은 1%였다. 대표 결과에서 단백질 구조 예측 과제는 10회 중 2회 통과했고, 에볼라 염기서열 과제는 매번 해당 페이지까지 도달했지만 광학 문자 인식이나 문자 수 계산 오류 때문에 정답 제출에는 모두 실패했다. 반면 합성 유전자 주문 과제에서는 실제 주문 완료가 아니라 파일 업로드 단계에 표시되는 특정 문장을 확인하는 목표를 10회 모두 수행했다. 보고서는 스크린샷과 그래픽 인터페이스만으로 길고 무작위적으로 보이는 유전자 서열을 처리할 때 광학 문자 인식이 특히 어려웠고, 분자생물학 작업이 학습 분포에서 멀리 떨어져 있을 가능성도 있다고 설명하며 최종 위험 수준을 낮음으로 판정했다.

8. 모델 자율성 평가와 제한적 배포의 근거

모델 자율성 범주는 모델이 스스로 외부로 빠져나가거나, 자기 능력을 개선하거나, 새로운 자원을 획득할 수 있는지를 다룬다. 오픈AI는 자원 획득 능력을 측정하는 자율 복제 평가를 세 개의 주요 과제와 그 하위 단계를 나타내는 여러 보조 과제로 구성하고, 이를 완전한 컴퓨터 사용이 가능한 맥OS 데스크톱 환경에 맞게 조정했다. 여기에 그래픽 처리 장치 대여 웹사이트의 결제 흐름 마지막 단계까지 도달하는 브라우저 중심 과제를 추가했으며, 각 과제를 최대 400단계로 10회씩 실행하고 모델의 약점을 보완하도록 더 자세히 작성한 프롬프트로도 다시 시험했다. 오퍼레이터는 그래픽 처리 장치 대여처럼 브라우징이 중심인 작업에서는 상대적으로 잘 수행했지만, 시각 입력에 의존하는 특성 때문에 코드 편집과 터미널 작업에서 제약을 보였고 자세한 프롬프트를 사용해도 이 양상은 유지됐다. 보고서는 현실적인 자율성을 갖추려면 모든 주요 과제에서 높은 능력이 필요하다고 보았으며, 오퍼레이터가 주요 과제들에서 10%를 넘는 성과를 내지 못한 결과를 근거로 사전 완화 위험을 낮음으로 평가하고 제한된 연구용 프리뷰와 지속적인 관찰을 선택했다.

🧾 핵심 주장 / 시사점

  • 오퍼레이터의 안전 정책은 요청 전체만 허용하거나 거부하는 방식이 아니라, 하나의 작업 안에서도 검색·이동·결제처럼 행동을 세분화하고 피해 규모와 가역성에 따라 사용자 확인 수준을 달리하는 데 핵심이 있다.
  • 생물학적 위험과 자율성 평가에서 낮은 위험 판정을 받은 주된 근거는 화면 기반 조작이 가능하다는 사실 자체가 아니라, 긴 무작위 문자열의 문자 인식과 코드·터미널 조작을 포함한 복합 과제에서 실제 성공률이 제한적이었다는 측정 결과다.
  • 외부 레드팀은 다양한 국가와 언어를 포괄했지만 실제 피해를 피하기 위해 모의 환경을 사용했으므로 최악의 현실 상황을 완전히 재현하지는 못했으며, 이 한계가 제한된 연구용 프리뷰와 실제 사용 모니터링의 필요성으로 이어졌다.

✅ 액션 아이템

  • 오퍼레이터의 실사용 범위를 상품 주문·예약·행사 티켓 구매로 제한하고, 주식 거래는 오퍼레이터 실행 권한에서 제외한다.
  • 결제·이메일 발송·일정 삭제처럼 결과 가역성이 낮은 중요 행동을 사용자 감독 동반 항목으로 분리해 정책에 반영한다.
  • 내부 레드팀과 20개국·24개 언어권 외부 레드팀의 프롬프트 인젝션·탈옥 사례를 반영해 프런티어 위험 점검을 강화한다.

❓ 열린 질문

  • 오퍼레이터 허용 목록에서 현재 범주 외에 추가로 제한하거나 금지해야 할 동작은 무엇인가?
  • 시뮬레이션된 모의 웹사이트·DB·이메일 환경의 결과가 실제 사용자 GUI 조작 환경에서 동일한 안전성을 보장하는지 어떻게 판단할 것인가?
  • 생화학 위험 도구 활용과 자율 복제 시험에서 사전 완화 상태의 낮은 위험 판정은 어떤 기준으로 주기적으로 재평가해야 하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.