Basis completes a tax workbook 2x faster with GPT-6 Astra
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Basis는 GPT-6 Astra가 GPT-5.6 Sol보다 50개 탭의 세금 워크북을 절반의 시간에 완료하고, 내부 평가 점수도 약 20% 높였다고 밝혔다.
📌 핵심 요약
- Basis는 회계사의 반복적인 수작업을 자동화하는 AI 에이전트를 개발하며, 장시간 작업의 안정적인 완료와 사용자 의도 이해를 연구한다.
- Basis가 50개 탭의 복잡한 세금 워크북으로 비교한 결과, GPT-6 Astra는 GPT-5.6 Sol보다 절반의 시간에 작업을 완료했다. 정확하고 안정적인 완료가 과제의 목표였다.
- Basis 공동창업자 Mitch Troyanovsky는 GPT-6 Astra가 작업 초기에 더 나은 결정을 내려 오류 수정 시간을 줄이고, 토큰을 더 효율적으로 사용한다고 설명했다.
- Basis는 GPT-6 Astra가 작업 난도에 따라 추론에 사용하는 연산량을 조절하면서 캐시를 유지하도록 한다. Troyanovsky는 이것이 비용과 응답 시간을 줄여 장시간 작업의 경제성을 높인다고 말했다.
- Basis는 GPT-6 Astra의 내부 평가 점수가 약 20% 개선됐으며, 사용자 의도 이해와 질문·가정 표시·지시 준수가 개선을 이끌었다고 밝혔다. 평가에는 템플릿 준수, 세금 질문에 대한 1차 자료 참조, 자체 검증도 포함되며, 모델이 더 적은 명시적 지시로 이러한 기대를 추론해 개별 상황별 규칙 작성의 필요성을 줄였다고 설명했다.
🧩 주요 포인트
- 초기 판단 개선 → 오류를 수정하는 우회를 줄여, 50개 탭의 세금 워크북 처리 속도와 토큰 효율을 높이는 방향으로 작용.
- 작업 난도별 추론량 조절과 캐시 유지 → 필요한 단계에 연산을 집중하면서 장시간 작업의 비용과 응답 시간을 줄일 수 있다는 Basis의 설명.
- 맥락에서 질문·가정 표시·지시 준수 등의 기대를 추론 → 개별 상황별 규칙 의존도를 낮추고, 내부 평가에 포함되지 않은 상황에 대한 Basis의 신뢰를 높임.
🧠 상세 정리
1. 회계 자동화와 사용자 의도 이해
Basis는 회계사가 매일 수행하는 수작업의 상당 부분을 자동화하는 AI 에이전트를 개발한다. 이를 통해 회계사가 반복적인 업무에 쓰던 시간을 전략적인 업무로 옮길 수 있도록 돕는 것이 회사가 설명하는 목적이다. 연구의 중심에는 오랜 시간이 걸리는 작업을 에이전트가 안정적으로 끝내도록 하는 문제가 있으며, Basis는 GPT-6 Astra에서 회계사의 목표를 더 잘 이해하는 모습을 관찰했다고 밝혔다. 공동창업자 Mitch Troyanovsky도 이 모델이 사용자의 의도와 문제를 더 잘 이해한다고 평가했다.
2. 50개 탭의 세금 워크북 처리 시간
Basis는 50개 탭으로 구성된 복잡한 세금 워크북을 대상으로 GPT-6 Astra와 GPT-5.6 Sol을 비교했다. 과제의 목표는 워크북을 정확하고 안정적으로 완성하는 것이었으며, Troyanovsky에 따르면 GPT-6 Astra는 GPT-5.6 Sol이 필요로 하는 시간의 절반에 작업을 끝냈다. Basis는 작업 초기에 더 나은 결정을 내리는 점도 관찰했는데, 이는 에이전트가 더 직접적인 경로로 작업하고 실수를 바로잡는 데 쓰는 시간을 줄이는 데 도움이 됐다고 설명했다. Troyanovsky는 이러한 특성이 토큰 사용의 효율성도 높인다고 말했다. 다만 원문에는 두 모델의 구체적인 소요 시간이나 정확도 비교 수치는 제시되지 않았다.
3. 난도에 따른 추론량 조절
Basis는 작업이 진행되는 동안 GPT-6 Astra가 단계별 난도에 맞춰 추론에 사용하는 연산량을 조절하도록 한다. 어려운 단계에서는 연산량을 늘리고, 쉬운 단계에서는 줄이는 방식이다. 모델은 이러한 조절 과정에서도 캐시를 유지할 수 있다고 설명된다. Troyanovsky는 이 기능이 비용과 응답 시간을 줄여, Basis와 고객 모두에게 장시간 실행되는 작업을 더 경제적으로 만든다고 말했다. 원문은 이 효과의 방향을 설명하지만, 비용이나 응답 시간이 각각 얼마나 감소했는지는 수치로 제시하지 않는다.
4. 내부 평가 개선과 실제 활용에 대한 신뢰
Basis는 GPT-6 Astra를 사용했을 때 내부 평가 점수가 약 20% 개선됐다고 밝혔다. 회사는 질문해야 할 시점, 가정을 명시하는 방식, 지시 준수 등을 포함한 사용자 의도 이해의 개선이 이를 이끌었다고 설명했다. 평가는 에이전트의 작업 과정과 최종 답변을 모두 살피며, 템플릿 준수, 세금 질문에 대한 1차 자료 참조, 자체 검증 여부도 확인한다. Basis에 따르면 GPT-6 Astra는 더 넓은 맥락에서 이러한 기대를 추론하므로 명시적인 지시가 덜 필요하다. 이는 개별 상황마다 규칙을 작성할 필요를 줄이고, 내부 테스트에 포함되지 않은 상황도 에이전트가 처리할 수 있다는 팀의 신뢰를 높였다.
🧾 핵심 주장 / 시사점
- Basis의 설명에서 처리 속도 개선은 초기 판단의 질과 연결된다. 오류 수정에 드는 시간을 줄이는 것이 긴 작업의 효율을 높이는 요인으로 제시된다.
- 추론량을 단계별로 조절하면서 캐시를 유지하는 능력은 장시간 작업의 경제성을 높이는 요소로 제시되지만, 구체적인 절감 규모는 공개되지 않았다.
- 약 20%의 내부 평가 개선과 테스트 밖 상황에 대한 신뢰는 구분할 필요가 있다. 전자는 Basis가 보고한 평가 결과이며, 후자는 맥락 이해와 규칙 작성 부담 감소를 바탕으로 한 팀의 판단이다.
✅ 액션 아이템
- 50개 탭의 세금 워크북에서 GPT-6 Astra의 처리 시간 단축과 정확하고 안정적인 완료 여부를 함께 검토.
- 작업 난도별 추론량 조절과 캐시 유지가 장시간 작업의 비용·응답 시간에 미치는 효과 확인.
- 약 20%의 내부 평가 개선을 질문·가정 표시·지시 준수, 템플릿 준수, 1차 자료 참조, 자체 검증 항목과 연결해 검토.
❓ 열린 질문
- 50개 탭의 세금 워크북 비교에서 GPT-6 Astra와 GPT-5.6 Sol의 정확하고 안정적인 완료 여부는 어떻게 평가됐는가?
- 작업 난도별 추론량 조절과 캐시 유지로 비용과 응답 시간은 각각 얼마나 줄었는가?
- 약 20%의 내부 평가 점수 개선은 질문·가정 표시·지시 준수 등 평가 항목별로 어떻게 나타났는가?