ArticleOpenAI·2026년 9월 3일·0

Legora reviewed 41 documents in minutes with GPT-6 Astra

Quick Summary

Legora는 GPT 6 Astra로 41개 문서의 재무제표 대조를 수분 내 완료하고, 전문가의 최종 판단을 유지하면서 검토의 정확성·완전성·신뢰성을 높였다고 밝혔다.

Legora reviewed 41 documents in minutes with GPT-6 Astra 관련 대표 이미지

🖼️ 인포그래픽

Legora reviewed 41 documents in minutes with GPT-6 Astra 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Legora reviewed 41 documents in minutes with GPT-6 Astra의 핵심 내용을 4단계로 요약한 인포그래픽
Legora reviewed 41 documents in minutes with GPT-6 Astra 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Legora는 GPT-6 Astra로 41개 문서의 재무제표 대조를 수분 내 완료하고, 전문가의 최종 판단을 유지하면서 검토의 정확성·완전성·신뢰성을 높였다고 밝혔다.

📌 핵심 요약

  • Legora는 50개 이상의 시장에서 1,800개 이상의 사내 법무 조직과 로펌에 속한 10만 명 이상의 전문가가 사용하는 법률·전문 업무용 에이전트 운영체제다.
  • 재무제표 대조는 초안의 모든 수치를 시산표·연결명세서·전년도 재무제표와 확인하는 작업으로, Legora의 법률 엔지니어에 따르면 저녁 내내 또는 며칠이 걸릴 수 있다.
  • Legora에 따르면 GPT-6 Astra 기반 에이전트는 단일 실행으로 41개 문서를 수분 내 대조하고, 모든 잔액을 근거 명세서와 확인해 금액 불일치와 각 점검 내역을 기록했다.
  • Legora의 에이전트 추론 벤치마크 BAR에서 GPT-6 Astra는 이전 모델 대비 재무제표 대조 작업의 성능이 거의 40% 향상됐고, 전체 과제의 평균 향상률은 약 3%였다.
  • GPT-6 Astra는 매출 주석에 숨긴 50만 파운드 차이를 포함해 의도적으로 삽입한 오류 4개를 모두 발견했고, 이전 모델이 올바르게 수행한 점검을 유지하면서 약 50개를 추가 완료했다. 최종 판단은 법률 전문가가 맡는다.

🧩 주요 포인트

  1. 장시간 걸리던 재무제표 대조를 41개 문서에 걸쳐 수분 내 수행 → 전문가가 검토할 1차 결과를 더 빠르게 제공.
  2. 오류 4개 탐지와 약 50개 추가 점검, 개별 점검 기록 확보 → 오류 발견뿐 아니라 검토 범위와 결과 확인의 근거도 강화.
  3. 재무제표 대조의 거의 40% 향상과 BAR 전체 평균 약 3%의 차이 → 특정 업무 성과와 전반적인 성능 개선을 구분해 해석할 필요.

🧠 상세 정리

1. 법률·전문 업무 플랫폼과 재무제표 대조의 부담

Legora는 법률 및 전문 업무를 위한 에이전트 운영체제로, 50개 이상의 시장에서 1,800개 이상의 사내 법무 조직과 로펌, 10만 명 이상의 전문가가 사용한다. 법률 엔지니어는 고객과 직접 협력해 업무 방식을 이해하고 계약 검토부터 법률 조사까지 전체 업무 흐름에 플랫폼을 맞춘다. 그중 재무제표 대조는 초안의 모든 수치를 시산표, 연결명세서, 전년도 재무제표와 비교해 일치 여부를 확인하는 작업이다. 법률 엔지니어 퍼시벌 퍼크스는 이 작업에 저녁 내내, 때로는 며칠이 걸릴 수 있다고 설명했다.

2. 41개 문서의 일괄 처리와 전문가의 판단

Legora에 따르면 GPT-6 Astra를 사용한 에이전트는 단일 실행으로 41개 문서의 재무제표 대조를 수분 내 완료했다. 각 잔액을 근거 명세서와 비교하고 금액 불일치를 찾아내며 모든 점검을 기록해, 전문가가 개별 항목과 수치를 검토할 수 있게 했다. 퍼크스는 많은 문서를 받아 복잡한 정보를 해석하고 서로 다른 항목과 수치를 처리하는 능력이 달라졌다고 설명했다. 에이전트가 광범위한 비교를 수행하더라도 각 결과에 대한 판단 책임은 전문가에게 남는다. Legora는 이러한 사람의 검토 참여 방식을 법률 업무에서 감사·세무·컴플라이언스·리스크로 플랫폼을 확장하는 데 핵심으로 삼고 있다.

3. 업무별 성능 향상과 벤치마크의 범위

Legora는 실제 사용 사례에서 가져온 법률 업무의 전체 수행 성능을 측정하는 에이전트 추론 벤치마크 BAR로 GPT-6 Astra를 평가했다. 회사가 보고한 재무제표 대조 작업의 성능은 이전 모델보다 거의 40% 향상됐다. 반면 BAR의 모든 과제를 합친 평균 향상률은 약 3%였다. 따라서 재무제표 대조에서 확인한 개선 폭과 전체 과제의 평균 개선 폭은 구분해서 읽어야 한다. 원문은 두 수치의 적용 범위를 달리 제시하므로, 거의 40%라는 결과를 법률 업무 전반의 향상률로 확대해 해석할 근거는 제공하지 않는다.

4. 오류 탐지와 점검 범위에서 확인된 개선

Legora는 재무제표 대조에서 정확성·완전성·신뢰성의 개선을 확인했다고 밝혔다. GPT-6 Astra는 회사가 재무제표에 의도적으로 삽입한 오류 4개를 모두 찾았으며, 여기에는 매출 주석에 숨겨진 50만 파운드 차이도 포함됐다. 모든 잔액을 근거 명세서와 대조하고 각 점검을 기록했으며, 이전 모델이 올바르게 수행한 점검을 모두 유지하면서 약 50개의 점검을 추가로 완료했다. 이 결과는 더 빠르고 완전한 1차 검토와 전문가가 확인할 수 있는 더 명확한 기록으로 이어졌다. 다만 최종 결정은 계속 법률 전문가의 책임으로 남는다.

🧾 핵심 주장 / 시사점

  • 개선의 근거는 처리 속도에만 있지 않으며, 오류 탐지·추가 점검·점검 기록이라는 서로 다른 측면에서 제시됐다.
  • 특정 재무제표 대조 작업의 큰 개선 폭은 BAR 전체 평균과 함께 봐야 성과의 적용 범위를 정확히 이해할 수 있다.
  • 자동화의 역할은 비교와 기록을 수행해 전문가의 검토를 지원하는 것이며, 결과에 대한 최종 판단 책임은 전문가에게 유지된다.

✅ 액션 아이템

  • 재무제표 대조의 거의 40% 향상과 BAR 전체 평균 약 3%를 구분해 성능 평가에 반영.
  • 41개 문서에서 기록된 금액 불일치와 개별 점검 내역을 법률 전문가의 최종 판단 근거로 검토.
  • 오류 4개 탐지와 약 50개 추가 점검을 정확성 및 검토 범위 개선의 근거로 함께 확인.

❓ 열린 질문

  • 재무제표 대조의 거의 40% 향상과 BAR 전체 평균 약 3%의 차이는 어떤 과제별 특성에서 비롯됐는가?
  • 41개 문서의 개별 점검 기록은 법률 전문가의 최종 판단에 어떻게 활용되는가?
  • 이전 모델보다 추가 완료한 약 50개 점검은 어떤 재무제표 항목에 해당하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.