Advancing computer use with Ironclad
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
OpenAI는 Ironclad와 복잡한 계약 업무를 학습·평가하는 연구를 진행했으며, GPT‑6 Astra는 연구 평가에서 GPT‑5.6 Sol보다 평균 점수가 32% 높고 시도당 추정 소요 시간은 48% 짧았다.
📌 핵심 요약
- OpenAI는 전문 소프트웨어에서 기업의 업무 규칙을 이해하고 다단계 작업을 수행하며 결과가 최초 요구사항을 충족하는지 검증하는 에이전트를 연구하고 있다. 첫 협력사인 Ironclad와는 계약, 승인, 재사용 가능한 법률 조항을 설정하는 과제를 개발했으며, GPT‑6 Astra는 Ironclad 과제로 학습한 첫 프런티어 모델이다.
- Ironclad 직원과 OpenAI 내 Ironclad 사용자는 법무·상업·조달 업무에서 11개 과제를 선정했다. 숙련자의 과제당 평균 소요 시간은 약 30~40분으로 추정되며, 과제별 평가 기준은 8~50개다. 연구진은 Ironclad가 제공한 호스팅 소프트웨어 환경에서 대표 업무 흐름을 바탕으로 합성 학습 과제를 만들고 강화학습을 적용했다.
- 각 모델의 최고 점수 설정인 GPT‑6 Astra의 Max reasoning과 GPT‑5.6 Sol의 High reasoning을 비교했다. 11개 연구 과제의 평균 점수는 각각 55.0%와 41.6%로 Astra가 32% 높았으며, 시도당 평균 추정 소요 시간은 37.0분에서 19.2분으로 48% 감소했다.
- Astra 개발에 사용된 내부 모델은 같은 과제에서 63.7%를 기록했으며, OpenAI는 이러한 추가 개선을 향후 모델에 반영하는 것을 목표로 한다. 동일 과제의 시연에서는 Astra가 약 94%의 기준을 추정 20분에, GPT‑5.6 Sol이 약 85%를 추정 32분에 충족했다. Ironclad는 예외 상황에서도 업무 규칙을 보존해야 하므로 인간의 감독과 완전한 계약 관리 플랫폼이 여전히 중요하다고 설명한다.
- OpenAI는 현재 에이전트가 안정적으로 완료하지 못하는 전문 업무를 가진 소수의 소프트웨어 기업을 추가 협력사로 초대하고 있다. 협력사는 구체적인 작업 사례, 실패 증거, 성공 판단 기준과 함께 업무 전문가, 안전한 테스트 환경, 연구에 안전하게 사용할 수 있는 데이터를 제공할 수 있어야 한다.
🧩 주요 포인트
- 다단계 계약 업무에서는 개별 설정의 정확성만으로 충분하지 않다 → 금액 기준과 예외 상황을 포함해 완성된 업무 흐름이 최초 요구사항대로 작동하는지가 성공 판단의 핵심이다.
- ~50개 기준으로 평가한 평균 점수와 추정 소요 시간이 함께 개선됐다 → GPT‑6 Astra는 요구사항 충족 수준과 효율성에서 진전을 보였지만, 평균 55.0%는 충족하지 못한 요구사항이 여전히 있음을 보여준다.
- Ironclad의 업무 전문성과 실제 고객 요구가 모델 개발에 연결됐다 → 향후 제품에서 AI가 담당하는 계약 업무를 확대할 가능성이 생기지만, 업무 규칙 보존과 인간의 감독은 계속 중요하다.
🧠 상세 정리
1. 전문 소프트웨어 활용을 위한 Ironclad 협력
OpenAI는 GPT‑6 Astra를 소개하며 문서 작성부터 웹사이트 테스트까지 전문 업무에서 모델의 컴퓨터 활용 능력이 발전했음을 보여줬다. 다음 목표는 에이전트가 전문 소프트웨어를 더 능숙하고 효율적으로 사용해 복잡한 기업 문제를 해결하도록 만드는 것이다. 이를 위해 기업의 업무 규칙을 이해하고, 여러 단계의 작업을 수행하며, 결과가 최초 요구사항에 부합하는지 확인하도록 모델을 학습시키는 방법을 연구하고 있다. OpenAI는 해당 업무를 깊이 이해하는 소수의 소프트웨어 기업과 직접 협력해 어렵고 가치가 높은 작업을 학습·평가 과제로 전환한다. 첫 협력사인 AI 계약 분야의 Ironclad는 계약, 승인, 재사용 가능한 법률 조항을 설정하는 과제와 성공 기준을 정의하는 데 기여했으며, GPT‑6 Astra는 이 과제로 학습한 첫 프런티어 모델이다.
2. 개별 설정을 넘어 전체 업무 흐름 검증
소프트웨어 구매 절차를 설정하는 법무 운영팀은 일정 금액을 넘는 구매에 재무 승인을 요구하고, 특정 요청에는 보안 검토를, 비표준 계약 조건에는 법무 검토를 적용해야 할 수 있다. 담당자는 이러한 요구사항을 접수 양식, 문서 템플릿, 승인 규칙, 최종 계약 기록으로 구체화해야 한다. 같은 작업을 수행하는 AI 에이전트도 소프트웨어의 여러 화면과 단계를 이동하는 동안 원래 요구사항을 계속 유지해야 한다. 예를 들어 지출 기준을 넘는 경우의 재무 승인을 설정하는 데 그치지 않고, 기준을 넘는 요청과 넘지 않는 요청이 각각 올바른 경로를 따르는지 확인해야 한다. 따라서 개별 단계가 정확하더라도 충분하지 않으며, 완성된 절차가 처리하도록 설계된 여러 상황에서 제대로 작동해야 한다.
3. 11개 연구 과제와 학습·평가 환경
Ironclad 직원과 OpenAI에서 Ironclad를 사용하는 사람들이 연구진을 도와 법무·상업·조달 업무에 걸친 11개 과제를 선정했다. 과제에는 비밀유지계약 설정, 조달 승인 절차 생성, 요청자가 선택한 관할을 반영하도록 재사용 가능한 법률 조항 수정 등이 포함됐다. OpenAI는 숙련된 사용자가 이러한 작업을 수행하는 데 과제당 평균 약 30~40분이 걸릴 것으로 추정했다. 각 과제는 복잡도에 따라 8~50개 기준으로 평가해 모델이 올바르게 수행한 부분과 부족한 부분을 구분했다. Ironclad는 모델이 연습할 수 있는 자사 제품의 호스팅 소프트웨어 환경을 제공했고, 연구진은 대표적인 업무 흐름을 바탕으로 합성 학습 과제를 개발해 강화학습으로 연습과 피드백을 통한 개선을 유도했다. OpenAI는 업무 전문가가 선정한 과제, 상세한 평가 기준, 연습 환경의 결합이 고객에게 중요한 실제 업무의 개선을 뒷받침한다고 설명한다.
4. Astra의 성능과 추정 소요 시간
연구진은 각 모델이 가장 높은 점수를 기록한 설정인 Astra의 Max reasoning과 GPT‑5.6 Sol의 High reasoning을 사용해 비교했다. 11개 연구 과제에서 Astra의 평균 점수는 55.0%, GPT‑5.6 Sol은 41.6%로, Astra의 점수가 상대적으로 32% 높았다. 시도당 평균 추정 소요 시간은 Sol의 37.0분에서 Astra의 19.2분으로 줄어 약 48% 감소했으며, 이는 시뮬레이션에 기반한 추정 시간이다. Astra 개발에 사용된 내부 모델은 같은 과제에서 63.7%를 기록했고, OpenAI는 이러한 추가 성능 향상을 향후 모델에 반영하는 것을 목표로 한다. 동일한 연구 과제를 수행한 시연에서는 Astra가 평가 기준의 약 94%를 추정 20분에 충족했고, GPT‑5.6 Sol은 약 85%를 추정 32분에 충족했다. 이 결과는 Astra가 더 적은 추정 시간으로 더 많은 요구사항을 충족했음을 보여주지만, 모든 요구사항의 완전한 충족을 의미하지는 않는다.
5. 계약 업무의 통제와 인간 감독
Ironclad의 참여는 계약 절차가 예외 상황을 처리하면서도 기업이 의존하는 업무 규칙을 유지해야 한다는 고객의 과제를 반영한다. 에이전트가 작업 도중 규칙 하나를 놓치면 소프트웨어 기업이 안심하고 맡길 수 있는 업무의 범위가 제한된다. 원문은 이러한 이유로 복잡한 계약 업무에서 에이전트의 능력이 개선되더라도 인간의 감독이 여전히 중요하며, 완전한 계약 관리 플랫폼도 필수적이라고 설명한다. Ironclad는 OpenAI 연구진과의 협력을 통해 이런 문제를 기반 모델의 개발 과정에 직접 반영하고 함께 연구할 수 있다. 모델의 역량이 높아지면 Ironclad가 자사 제품의 더 많은 영역에서 이를 활용할 기회가 생길 수 있다. 법무팀과 사업팀에는 기존 통제를 유지하면서 AI가 복잡한 계약 업무에 드는 노력의 더 많은 부분을 담당할 가능성을 뜻한다.
6. 추가 협력사의 과제와 참여 조건
OpenAI는 현재 에이전트가 안정적으로 완료하지 못하는 중요한 전문 업무를 대상으로 연구·엔지니어링 팀과 직접 협력할 소수의 소프트웨어 기업을 초대하고 있다. 협력을 시작하려면 에이전트에게 요구하는 작업이 무엇인지 보여주는 구체적인 사례가 필요하다. 또한 에이전트가 어디에서 실패하는지에 대한 증거와 성공적인 결과를 어떻게 판단할지에 대한 기준을 제시해야 한다. 참여 기업은 해당 업무를 깊이 이해하는 사람들, 안전한 테스트 환경, 연구에 안전하게 사용할 수 있는 데이터도 제공할 수 있어야 한다. OpenAI는 이러한 자료와 조건을 실패 원인을 조사하고 모델의 개선 여부를 측정하기 위한 출발점으로 삼겠다고 설명한다. 따라서 협력의 중심은 실제 전문 업무에서 확인되는 실패와 그 개선을 판단할 수 있는 구체적인 근거에 있다.
🧾 핵심 주장 / 시사점
- 과제별 기준 충족 점수는 수행의 부분적인 성공과 실패를 드러낸다. 평균 55.0%를 과제 전체의 완료율로 해석하면 연구 결과의 의미를 왜곡할 수 있다.
- 시간 감소는 시도당 추정·시뮬레이션 시간에 관한 결과이므로, 실제 고객 환경에서 측정한 처리 시간과 구분해 해석할 필요가 있다.
- 계약 업무에서 AI의 활용 범위를 넓히는 데에는 수행 능력 향상뿐 아니라 예외 상황에서도 업무 규칙을 유지하고 인간의 감독을 이어가는 것이 중요하다.
✅ 액션 아이템
- GPT‑6 Astra의 평균 55.0%와 GPT‑5.6 Sol의 41.6%를 Max reasoning·High reasoning 조건 및 추정 소요 시간과 함께 비교해 개선 범위를 검토한다.
- Ironclad의 다단계 계약 업무에서 금액 기준과 예외 상황이 최초 요구사항대로 처리되는지 확인하고 인간의 감독 필요성을 검토한다.
- OpenAI와의 협력 가능성을 검토하기 위해 구체적인 작업 사례, 실패 증거, 성공 판단 기준과 업무 전문가·안전한 테스트 환경·연구용 데이터의 제공 가능성을 확인한다.
❓ 열린 질문
- GPT‑6 Astra의 평균 55.0%에서 아직 충족하지 못한 요구사항은 어떤 업무 규칙이나 예외 상황과 관련돼 있는가?
- Ironclad가 AI의 계약 업무 범위를 확대할 때 업무 규칙 보존과 인간의 감독을 어떻게 유지할 것인가?
- OpenAI가 초대한 소프트웨어 기업은 어떤 구체적인 작업 사례와 실패 증거를 제시하고, 성공 판단 기준을 어떻게 정의할 것인가?