Articleanthropic.com·2026년 9월 22일·0

Introducing Claude Opus 5.5

Quick Summary

Anthropic은 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내면서 일반적인 작업 비용은 Opus 5보다 40% 낮추고 안전성과 소통 방식을 개선한 Claude Opus 5.5를 발표했다.

Introducing Claude Opus 5.5 관련 대표 이미지

🖼️ 인포그래픽

Introducing Claude Opus 5.5 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing Claude Opus 5.5의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing Claude Opus 5.5 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic은 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내면서 일반적인 작업 비용은 Opus 5보다 40% 낮추고 안전성과 소통 방식을 개선한 Claude Opus 5.5를 발표했다.

📌 핵심 요약

  • 2026년 9월 22일 공개된 Claude Opus 5.5는 Claude 5.5 제품군의 첫 모델이며, Claude Sonnet 5.5와 Claude Haiku 5.5는 향후 몇 주 내 출시될 예정이다.
  • Anthropic은 Opus 5.5가 에이전트 코딩·컴퓨터 사용·지식 작업 벤치마크에서 선도적인 성능을 보인다고 설명한다. 다만 벤치마크 점수 차이가 실제 업무 차이를 덜 정확하게 반영하며, 실제 사용에서 Claude Fable 5.1과의 격차는 점수보다 작다고 밝혔다.
  • 기본 설정의 일반적인 작업 비용은 Opus 5보다 40% 낮고 출력 생성 속도는 30% 이상 빠르다. 100만 토큰당 입력은 4달러, 출력은 20달러, 캐시 읽기는 0.20달러이며, Claude Code와 Claude Platform의 Fast mode는 최대 2.5배 속도에 입력 8달러·출력 40달러다.
  • 공개 전 Frontier Design과 METR 등의 외부 평가를 받았으며, Anthropic의 자동화 행동 감사에서 지금까지 평가한 모델 중 최고 성적을 기록했다. 다만 평가에는 한계가 있고, 생물학·사이버보안 능력이 Claude Mythos 5.1과 비슷해 Claude Fable 5.1과 유사한 보호 장치와 검증 프로그램을 적용한다.
  • 초기 사용자 사례에는 68만 줄 코드 이전을 하루 미만에 완료한 작업과 20만 줄 코드 감사·수정을 3시간 미만에 마친 작업이 포함된다. Anthropic은 더 명확하고 자연스러운 설명이 결과 검토를 돕는다고 설명하며, Pro·Max·Team·좌석 기반 Enterprise의 5시간 사용 한도를 늘리고 저장 후 원하는 때 사용할 수 있는 사용 한도 초기화도 제공한다.

🧩 주요 포인트

  1. 토큰 단가 인하와 작업당 토큰 절감 → Opus 5 대비 40% 비용 감소가 결합 효과로 나타나므로, 성능 비교에는 실제 작업 비용과 Fast mode의 별도 요금을 함께 고려할 필요가 있다.
  2. 대규모 코드 작업의 시간 단축과 벤치마크 해석의 한계 → Claude Opus 5.5의 실용적 가치는 최고 점수뿐 아니라 실제 업무의 완료 시간과 수정 부담으로 판단할 필요가 있다.
  3. 자동화 행동 감사 개선과 생물학·사이버보안 보호 장치 병행 → Claude Opus 5.5의 안전성 향상은 평가 한계와 검증 프로그램의 접근 조건을 함께 보아야 한다.

🧠 상세 정리

1. Claude 5.5 제품군의 첫 공개와 핵심 변화

Anthropic은 2026년 9월 22일 Claude 5.5 제품군의 첫 모델인 Claude Opus 5.5를 발표하며, 대부분의 업무에서 Claude Fable 5.1 수준의 성능을 제공한다고 설명했다. 이번 모델은 회사가 최첨단 모델 발전 속도 조절을 촉구한 뒤 처음 내놓은 모델이며, 공개 전에 Frontier Design과 METR 등을 통한 외부 평가를 거쳤다. 소개의 중심은 Opus 5 대비 성능 향상, 비용 절감, 안전성 개선, 더 자연스러운 소통이라는 네 가지 변화다. 초기 평가에서는 단일 프롬프트로 게임을 만드는 비교에서 그래픽과 완성도가 높은 평가를 받았고, 장시간 협업에서도 설명을 이해하고 검토하기 쉬워졌다는 반응이 나왔다. Claude Sonnet 5.5와 Claude Haiku 5.5도 향후 몇 주 안에 출시되며 성능·효율·안전성 개선의 상당 부분을 공유할 예정이다.

2. 복잡한 실무 작업과 소통 방식의 개선

초기 사용자 한 명은 엔지니어링 팀이 수주 동안 수행했을 68만 줄 규모의 코드 이전을 Opus 5.5로 하루 미만에 완료했다고 보고했다. 웹 앱의 모든 페이지에서 로딩 시간을 줄이도록 한 평가에서는 Opus 5.5가 40회 중 39회 성공했으며, Opus 5는 개선 폭이 더 작으면서 앱 동작까지 변경했다. Anthropic은 이러한 사례를 복잡하고 광범위한 소프트웨어 작업에서 성능 향상이 드러나는 근거로 제시한다. 소통 측면에서는 중요한 정보를 앞에 배치하고 더 명확하게 설명해, Opus 5의 글이 이해하기 어렵다는 기존 피드백에 대응했다고 밝혔다. 회사는 결과물을 따라가고 확인하기 쉬워지는 변화가 실용적 이점뿐 아니라 안전성에도 도움이 된다고 설명하지만, 제시된 사례는 초기 사용자 경험과 회사 자체 평가라는 맥락에서 읽어야 한다.

3. 정렬 평가와 고위험 분야의 보호 장치

Opus 5.5는 수천 개의 모의 상황에서 행동을 평가하는 Anthropic의 자동화 행동 감사에서 지금까지 시험한 모델 중 가장 좋은 결과를 기록했다. 최근 모델들보다 되돌리기 어려운 행동을 하거나 부여된 경계를 벗어날 가능성이 훨씬 낮았으며, Opus 5보다 프롬프트 인젝션에 대한 저항성도 높아졌다는 설명이다. 회사는 장시간 과제, 수행 불가능한 과제, 실제 사건을 본뜬 상황으로 정렬 평가를 확대했으나 여전히 한계가 있다고 명시하고 상세 내용을 Opus 5.5 System Card에 제시했다. 생물학과 사이버보안 능력은 Claude Mythos 5.1과 비슷하다고 평가해 Claude Fable 5.1에 적용한 것과 유사한 보호 장치를 함께 배포한다. 심사를 거친 기관은 발표 당일부터 Life Sciences Verification Program에 신청할 수 있고, 향후 몇 주 동안 Cyber Verification Program 접근도 확대해 검증된 사이버보안 실무자가 사용할 수 있도록 할 예정이다.

4. 벤치마크 성과와 실제 업무 차이의 구분

Anthropic은 Opus 5.5가 에이전트 코딩, 컴퓨터 사용, 지식 작업에서 선도적인 결과를 보였다고 설명하며 여러 모델의 비교 점수를 공개했다. Opus 5.5의 Terminal-Bench 4.0 점수는 66.4%로 Claude Fable 5.1의 55.8%, Opus 5의 52.3%, GPT-6 Astra의 57.9%보다 높았고, 지식 작업 평가 GDPval-AA v2.1에서는 1846점을 기록했다. 컴퓨터 사용 평가 OSWorld 2.0에서는 부분 평가 기준 81.8%, 도구를 사용한 Humanity's Last Exam에서는 67.7%를 기록했다. 다만 모든 항목에서 가장 높은 것은 아니어서 AutomationBench에서는 Opus 5.5가 40.0%, GPT-6 Astra가 41.4%였고, Terminal-Bench-Science 0.1에서는 각각 58.7%와 64.6%였다. 회사 스스로도 이 수준의 모델에서는 벤치마크 격차가 실제 업무 차이를 설명하는 신뢰도가 낮아졌으며, 자체 사용에서 Opus 5.5와 Claude Fable 5.1의 차이는 점수표가 시사하는 것보다 작다고 밝혔다.

5. 평가 설정과 보호 장치가 점수에 미치는 영향

별도 설명이 없는 Opus 5.5 결과는 적응형 사고의 max 노력 수준을 사용했지만, Terminal-Bench 4.0에서는 Opus 5.5의 xhigh와 GPT-6 Astra의 high 결과를 각 모델의 최고 점수로 제시했다. Opus 5.5는 실제 서비스용 보호 장치를 켠 상태에서 평가했으며, 보호 장치가 개입하면 사이버보안 과제는 Claude Opus 4.8이, 생물학과 최첨단 LLM 개발 과제는 Claude Opus 5가 대신 수행했다. Anthropic은 이러한 대체 수행이 Opus 5.5의 벤치마크 성능을 낮췄을 가능성이 있다고 설명했다. 반면 Zapier가 평가한 AutomationBench에서는 대체 모델을 쓰지 않아 보호 장치 개입을 실패로 처리했으며, 회사는 이 때문에 실사용에서 기대하는 점수보다 낮아졌다고 주장했다. Terminal-Bench 4.0에서 Opus 5.5의 표준오차는 ±2.6점이고 다른 Claude 모델은 ±1.6~2점이며, Terminal-Bench-Science 0.1은 모델별 ±3.5~5점이므로 점수 차이는 이러한 불확실성과 함께 해석해야 한다.

6. 토큰 가격·속도·구독 사용 한도의 변화

Anthropic은 Opus 5.5가 Opus 5보다 서비스에 필요한 연산량이 적고 작업당 토큰도 덜 사용해, 기본 설정의 일반적인 작업 비용이 40% 감소한다고 설명했다. 100만 토큰당 입력 가격은 5달러에서 4달러로, 출력은 25달러에서 20달러로 각각 20% 내려가며, 캐시 쓰기는 6.25달러에서 5달러로 낮아진다. 에이전트와 코딩 작업 비용의 대부분을 차지한다는 캐시 읽기는 100만 토큰당 0.50달러에서 0.20달러로 60% 인하되고, 출력 생성 속도는 30% 이상 빨라졌다. Claude Code와 Claude Platform에서 제공하는 Fast mode는 최대 2.5배 속도를 제공하지만 입력과 출력 가격은 각각 100만 토큰당 8달러와 40달러로 별도 책정된다. 구독 측면에서는 Pro·Max·Team·좌석 기반 Enterprise의 5시간 사용 한도를 확대하고, 구독자가 저장했다가 원하는 시점에 사용할 수 있는 사용 한도 초기화를 제공한다.

7. 대규모 코딩 작업과 비용 대비 성능

초기 사용자는 20만 줄 코드베이스의 감사와 수정을 Opus 5.5로 3시간 미만에 끝냈으며, Opus 5는 같은 작업에 20시간 넘게 걸리고 토큰도 2.5배 사용했다고 보고했다. 내부 평가에서 서버 간 웹 트래픽 부하를 분산하는 HAProxy를 C에서 Rust로 변환했을 때, Opus 5.5와 Claude Fable 5.1의 결과물은 모두 HAProxy 자체 회귀 테스트를 거의 전부 통과했다. 이때 Opus 5.5는 9.5시간, Claude Fable 5.1은 12시간이 걸렸고 Opus 5.5의 비용은 51% 낮았다. FrontierCode의 기본 medium 설정에서는 Opus 5.5가 54.6%로 GPT-6 Astra의 최고 점수 53.3%를 작업당 약 20%의 비용으로 넘어섰으며, 이는 앞선 표의 기본 max 설정 결과 54.4%와 평가 설정이 다르다. Terminal-Bench 4.0에서는 기본 설정으로 Opus 5의 max 성능을 약 5분의 1 비용에 웃돌고 GPT-6 Astra와는 약 40% 비용으로 대등한 성능을 냈다고 설명한다. CursorBench 4.0의 기본 설정 점수는 52.5%로 GPT-5.6 Sol의 최고 점수 41.7%보다 약 11점 높았고, 비용은 약 3분의 1이었다.

8. 초기 고객이 보고한 효율성과 작업 방식 변화

GitHub는 Copilot CLI와 VS Code 평가에서 Opus 5.5가 측정 대상 중 토큰과 단계 사용량이 가장 적은 축에 속했으며, VS Code에서는 Opus 5보다 절반 미만의 단계로 더 많은 터미널 과제를 해결했다고 밝혔다. Clio의 개발자는 6개 저장소에 걸친 작업을 맡겼을 때 모델이 18시간 넘게 과제를 유지하면서 서비스 간 통신과 적용 방식을 다뤘고, Opus 5보다 빠르게 중간 목표에 도달하면서 재작업도 거의 필요하지 않았다고 전했다. Lovable은 맥락을 한 번 수집하고 더 완결된 수정을 수행해 반복 시도를 줄였으며, 완료 단계가 3분의 1에서 절반가량 감소하고 토큰 사용량도 크게 줄었다고 설명했다. Quantium은 Chat·Cowork·Claude Code 전반에서 평가했으며, 이전에 4일 동안 38개 프롬프트가 필요했던 복잡한 코딩 과제를 3시간 동안 11개 프롬프트로 처리했다고 보고했다. 이들 증언은 효율 향상이 반복 수정 시간을 줄이고 결과 검증에 더 집중할 여지를 준다는 방향으로 일치하지만, 원문은 이를 초기 고객 사례로 제시하며 모든 작업에 동일한 개선 폭을 보장하지는 않는다.

🧾 핵심 주장 / 시사점

  • 비용 개선은 토큰 가격 인하만으로 설명되지 않는다. 작업당 토큰과 수행 단계 감소가 함께 작용하므로, 동일한 작업을 완료하는 데 드는 총비용이 핵심 비교 기준이 된다.
  • 벤치마크 최고 점수, 기본 노력 수준의 비용 대비 성능, 장시간 실무 사례는 서로 다른 근거다. 이를 구분해야 Opus 5.5의 성능 우위와 실제 업무에서의 개선 폭을 과장하지 않을 수 있다.
  • 명확한 설명과 경계 준수의 개선은 사람이 결과를 검토하는 데 도움이 되지만, 생물학·사이버보안 역량에 대한 별도 보호 장치와 평가 한계까지 없애는 것은 아니다.

✅ 액션 아이템

  • Claude Opus 5.5와 Opus 5의 실제 작업 비용을 비교해 40% 절감의 적용 범위를 확인하고 Fast mode의 별도 요금을 함께 검토.
  • 대규모 코드 작업에서 Claude Opus 5.5의 완료 시간과 수정 부담을 평가해 벤치마크 결과의 실제 업무 적용성을 확인.
  • 생물학·사이버보안 활용 시 Claude Opus 5.5의 보호 장치, 검증 프로그램 접근 조건, 평가 한계를 함께 검토.

❓ 열린 질문

  • Opus 5 대비 40% 비용 절감은 실제 사용할 작업에서도 비슷하게 나타나는가?
  • Claude Opus 5.5와 Claude Fable 5.1의 실제 업무 격차는 완료 시간과 수정 부담에서 어느 정도인가?
  • 생물학·사이버보안 보호 장치와 검증 프로그램의 접근 조건은 Claude Opus 5.5의 활용 범위에 어떤 영향을 주는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.