Introducing Claude Opus 5
Quick Summary
Claude Opus 5는 Fable 5에 근접한 성능을 절반 수준의 비용으로 제공하며, 코딩·지식 업무·장기 다단계 작업에서 자기 검증과 반복 수행을 강화한 일상용 모델이다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Claude Opus 5는 Fable 5에 근접한 성능을 절반 수준의 비용으로 제공하며, 코딩·지식 업무·장기 다단계 작업에서 자기 검증과 반복 수행을 강화한 일상용 모델이다.
📌 핵심 요약
- Anthropic은 2026년 7월 24일 Claude Opus 5를 공개했으며, Claude Max의 새 기본 모델이자 Claude Pro에서 가장 강력한 모델로 배치했다.
- Opus 5는 Frontier-Bench와 GDPval-AA의 코딩·지식 업무 평가에서 최고 수준을 기록했지만, 사이버보안 과제에서는 Mythos 5보다 뒤처졌다.
- Frontier-Bench v0.1에서는 Opus 4.8 성능의 두 배를 넘으면서 과제당 비용은 낮았고, CursorBench 3.2 최대 노력 설정에서는 Fable 5 최고점과 0.5% 이내 차이를 절반의 과제당 비용으로 달성했다.
- ARC-AGI 3에서는 차상위 모델의 세 배 점수, Zapier AutomationBench에서는 같은 과제당 비용 기준 약 1.5배 통과율, OSWorld 2.0에서는 Fable 5 최고 결과를 약 3분의 1을 조금 넘는 비용으로 상회했다.
- 생명과학·시각 결과물·에이전트형 코딩 사례와 초기 고객 보고는 자기 검증, 근본 원인 분석, 장기 작업의 일관성 향상을 보여줬으며, 배포 전 자동 행동 감사에서는 기존 비교 모델보다 정렬성·기만 방지·오용 저항·비가역적 행동 회피가 우수하다고 보고됐다.
🧩 주요 포인트
- 노력 설정에 따라 지능과 토큰 소비를 조정할 수 있고 고·초고·최대 설정에서 비용 대비 성능 우위가 나타나, Opus 5의 핵심 가치는 단순 최고점뿐 아니라 운용 효율에도 있다.
- FreeCAD 재구성, 패키지 관리자 버그, 거래소 데이터 피드 사례에서 자체 도구와 시험 장치를 만들고 근본 원인을 확인해 완료했으며, 이는 검증 수단이 부족한 장기 과제에서의 자율성을 보여준다.
- 과학·금융·법률·프런트엔드·코드 검토의 초기 사용자 보고는 정확도와 일관성 개선을 가리키지만, 사이버보안에서는 Mythos 5보다 낮아 과제별 모델 선택이 필요하다.
🧠 상세 정리
1. 출시와 제품 포지셔닝
Anthropic은 2026년 7월 24일 Claude Opus 5를 즉시 이용 가능한 모델로 발표했다. 회사는 이 모델을 신중하고 선제적으로 행동하며, Claude Fable 5의 최상위권 지능에 근접하면서 가격은 절반인 모델로 규정했다. Opus 5는 Claude Max의 새 기본 모델이고 Claude Pro에서 제공되는 가장 강력한 모델이며, 매일 사용하는 업무에서 다른 모델보다 효율적으로 작동하도록 설계됐다. Frontier-Bench와 GDPval-AA 같은 코딩·지식 업무 평가에서는 새로운 최고 수준으로 소개됐지만, 사이버보안 과제에서는 Mythos 5보다 뒤처진다는 한계도 함께 명시됐다.
2. 코딩 성능과 비용 효율
Opus 5는 전작 Opus 4.8과 같은 비용에서 성능을 크게 높였으며, 사용자는 노력 설정을 바꿔 지능을 우선하거나 토큰을 절약해 더 빠르고 저렴한 결과를 선택할 수 있다. Frontier-Bench v0.1에서는 모든 비교 모델을 앞섰고, Opus 4.8보다 낮은 과제당 비용으로 두 배가 넘는 성능을 기록했다. CursorBench 3.2의 최대 노력 설정에서는 Fable 5의 최고점과 0.5% 이내 차이를 보이면서 과제당 비용은 절반이었다. 고·초고·최대 노력 설정에서도 같은 비용 기준으로 다른 모든 모델보다 높은 성능을 달성했다고 설명된다. 이 결과들은 최고 노력 수준의 절대 성능뿐 아니라 다양한 예산 구간에서의 비용 대비 성능을 Opus 5의 핵심 강점으로 제시한다.
3. 지식 업무와 문제 해결 평가
새로운 문제 해결 능력을 측정하는 ARC-AGI 3에서 Opus 5의 점수는 차상위 모델의 세 배였다. 업무를 처음부터 끝까지 완수하는지를 측정하는 Zapier AutomationBench에서는 같은 과제당 비용 기준으로 차상위 모델보다 약 1.5배 높은 통과율을 보였다. 가장 낮은 노력 설정에서도 다른 어떤 모델보다 많은 과제를 통과해, 높은 토큰 사용량에만 의존하지 않는 성과를 나타냈다. 컴퓨터 사용 평가인 OSWorld 2.0에서는 모든 비용 구간에서 다른 모델을 앞섰고, Fable 5의 최고 결과를 약 3분의 1을 조금 넘는 비용으로 넘어섰다. 서로 다른 평가에서 반복된 결과는 Opus 5가 코딩 외에도 신규 문제 해결, 업무 자동화, 컴퓨터 조작에서 비용 효율을 유지한다는 발표의 근거가 된다.
4. 과학 연구와 시각 결과물
Opus 5는 구조생물학, 유기화학, 생물정보학을 포함한 모든 생명과학 평가에서 Opus 4.8보다 높은 성능을 보였다. 향상이 가장 두드러진 영역 중 하나는 분광학 데이터로 분자 구조를 추론하는 유기화학 과제로, 내부 평가에서 Opus 4.8보다 10.2%포인트 높은 점수를 기록했다. 단백질 서열의 변이가 기능에 미치는 영향을 예측하는 과제에서는 7.7%포인트 향상됐다. 시각 결과물에서도 공기역학적 물체와 비공기역학적 물체 주변의 공기 흐름을 조절 가능한 풍동 형태로 시각화했고, 세포 구성 요소를 탐색할 수 있는 단순화된 대화형 삽화를 제작했다. 발표는 이러한 사례를 과학적 추론 개선과 더 강한 시각적 산출 능력을 함께 보여주는 결과로 제시한다.
5. 자기 검증과 근본 원인 해결
Opus 5는 작업 결과를 직접 검증하고 성공할 때까지 신중하게 반복하는 능력이 강화된 모델로 설명된다. 한 Frontier-Bench 과제에서는 기계 부품 도면을 직접 볼 수 없는 조건에서도 원시 픽셀에서 형상을 추출하는 자체 컴퓨터 비전 절차를 작성한 뒤 완전한 3D FreeCAD 모델을 반복적으로 재구성했으며, 같은 조건의 경쟁 모델은 다섯 차례 시도에서 성공하지 못했다. 대중적인 오픈소스 패키지 관리자의 실제 버그를 다룬 사례에서는 표면 증상만 수정하지 않고 근본 원인을 찾아, 커뮤니티 패치가 놓친 예외 상황까지 해결했다. 또 한 거래 회사의 엔지니어와 진행한 단일 세션에서는 새 거래소용 시장 데이터 피드를 만들었고, 검증할 실시간 피드가 없자 자체 시험 장치를 구축해 데이터 해석의 정확성을 확인했다. 세 사례 모두 모델이 주어진 도구와 검증 경로가 부족할 때 필요한 절차를 스스로 구성했다는 점을 공통적으로 보여준다.
6. 코딩 도구와 개발 현장의 평가
초기 접근 고객들은 Opus 5가 FrontierCode 1.1에서 절반의 비용으로 Fable 수준에 접근했으며, Devin에서는 어려운 디버깅과 근본 원인 분석에 특히 강했다고 보고했다. Cursor 측은 CursorBench에서 Fable 5에 약간 못 미치지만 유사한 행동 특성을 보였고, Lovable은 가장 어려운 에이전트형 코딩 과제에서 Opus 4.7보다 22% 향상되면서 실행 간 편차도 줄었다고 밝혔다. 전체 스택 애플리케이션 제작에서는 애니메이션·게임·3D 작업을 포함한 프런트엔드 품질이 기존 Opus 모델보다 개선됐다는 평가가 나왔다. 다른 사례에서는 데스크톱과 휴대전화 너비로 페이지를 직접 열어 모바일 화면 아래에 가려진 상품과 화면 밖 결제 버튼을 찾아 수정했고, 코드 변경에서는 불필요한 코드 없이 간결한 차이를 만들며 코드베이스 고유의 미묘한 위험을 더 잘 발견했다고 보고됐다. 이러한 평가는 단순 코드 생성보다 디버깅, 시각 확인, 코드 검토, 요구사항 유지 같은 개발 과정 전반에서의 개선에 초점을 둔다.
7. 업무 분야별 초기 고객 결과
Zapier의 사례에서 Opus 5는 계정 상태 자료를 입력받아 위험 계정을 표시하고 담당자에게 알린 뒤 유지 업무용 요약까지 만드는 이탈 방지 절차를 끝까지 수행해 100%를 기록했으며, 이전 모델은 통과하지 못했다고 보고됐다. 유전체 분석에서는 적절한 통계 검정으로 교란 요인을 배제하고 독립적인 방법으로 결과를 교차 확인했으며, Box의 내부 평가에서는 Opus 4.8보다 전체 8%, 데이터 분석 11%, 실사 업무 17% 향상됐다. 일부 금융 모델링 과제에서는 노력 설정 전반의 정확도가 평균 9%포인트 높았고, 작업 회차와 도구 호출은 3분의 1 줄었으며 소요 시간은 60% 감소했다. 법률 에이전트 업무에서는 기업 지배구조와 중재 분야의 향상이 두드러졌고, 낮은 추론 수준에서도 Opus 4.8의 최대 추론과 유사한 성능을 평균 26% 적은 토큰으로 달성했다는 보고가 나왔다. 최초 계약 수정안 평가에서는 Opus 4.8의 거의 두 배 점수를 기록했고, 거래 평가에서는 약 7분의 1 수준의 추론 토큰과 절반 미만의 지연 시간으로 Opus 계열 중 가장 높은 결과를 냈다고 소개됐다. 이 수치들은 모두 발표문에 인용된 내부 평가 또는 초기 고객 경험으로 제시된 결과다.
8. 장기 작업에서의 판단과 자율성
장기적이고 모호한 업무에 관한 고객 보고에서는 Opus 5가 계획을 곧바로 실행하기보다 전제와 결과를 확인하고 필요한 판단만 사용자에게 요청하는 경향이 강조됐다. 한 사용자는 개발 환경 전반의 수석 보좌 역할을 맡긴 결과 모델이 자체 모니터를 만들고 각 환경을 운영했다고 밝혔고, 다른 사례에서는 연구 보조 코드베이스의 대규모 변경을 수행하면서 피드백에 적응하고 추론을 설명했다. 발표 자료 제작에서는 전체 자료를 만든 뒤 수정하는 장기 흐름, 코드 전달에서는 브랜치·서식·시험 영향을 확인하는 행동, 설계 논의에서는 사용자의 제안에 근거 있는 이견을 유지하면서 절충안을 제시하는 판단이 언급됐다. 운영 감시 사례에서는 잠재적 이상 신호를 실제 환경과 다시 대조해 정상 신호임을 확인하고, 정정 내용을 자체 기억에 기록한 뒤 감시 질의를 종료했다. 고객들은 이런 행동을 논리적 결함을 실행 전에 발견하고 복잡한 작업의 맥락을 오래 유지하는 능력으로 평가했으며, JetBrains IDE와 Kiro를 비롯한 개발 환경에서의 활용 계획도 밝혔다. 다만 이 대목의 성과는 여러 초기 사용자의 관찰과 내부 평가를 모은 것이므로, 발표문은 사례별 조건과 수치를 서로 다른 맥락에서 제시한다.
9. 정렬성과 안전성
Anthropic은 배포 전 자동 행동 감사에서 Opus 5가 자사 모델 가운데 가장 높은 정렬성을 보였다고 밝혔다. Claude의 헌법을 따르는 정도가 Opus 4.8, Sonnet 5, Fable 5보다 높았고, 기만적 행동 비율은 가장 낮으며 오용을 유도하는 속임수에도 가장 덜 취약했다고 설명했다. 되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동을 피하는 측면에서도 지금까지 가장 안전한 모델이라고 평가했다. 이는 고객 사례에서 강조된 사전 검증, 논리적 오류 확인, 성급한 실행 회피와 같은 행동적 특징과 같은 방향을 가리킨다. 다만 제공된 원문은 자동 행동 감사의 전체 비정렬성 점수로 2.3을 언급하는 도중 문장이 끝나므로, 해당 수치의 완전한 지표명과 척도 및 비교 방식은 이 자료만으로 확정할 수 없다.
🧾 핵심 주장 / 시사점
- Opus 5의 발표는 최대 성능만이 아니라 노력 설정별 비용 곡선을 강조해, 같은 모델을 속도·토큰·정확도 요구에 맞춰 운용하는 접근을 핵심 가치로 제시한다.
- 자체 컴퓨터 비전 절차와 시험 장치를 만든 사례는 정답 생성보다 검증 경로를 스스로 확보하는 능력이 장기 에이전트 작업의 성패를 좌우했음을 보여준다.
- 코딩·지식 업무·과학·업무 자동화에서는 폭넓은 향상이 보고됐지만 사이버보안에서는 Mythos 5보다 뒤처져, 모든 영역에서 단일 모델이 우세하다는 결론은 지원되지 않는다.
✅ 액션 아이템
- Claude Max와 Claude Pro에서 Claude Opus 5의 일상 업무 적용 범위 및 Opus 4.8 대비 비용·성능 검토.
- Frontier-Bench v0.1, CursorBench 3.2, Zapier AutomationBench, OSWorld 2.0 결과를 실제 코딩·지식 업무 특성과 대조 평가.
- 장기 다단계 작업에서 노력 설정별 토큰 소비와 자기 검증 효과를 확인하고, 사이버보안 과제는 Mythos 5와 별도 비교.
❓ 열린 질문
- Claude Max의 기본 모델인 Claude Opus 5가 Opus 4.8 대비 일상 업무의 비용과 처리 효율을 얼마나 개선하는가?
- CursorBench 3.2에서 Fable 5와 0.5% 이내인 성능이 다른 코딩·지식 업무에서도 절반의 과제당 비용으로 유지되는가?
- Mythos 5보다 뒤처진 사이버보안 과제에서는 Claude Opus 5의 자기 검증과 장기 다단계 작업 강점이 어느 범위까지 유효한가?