Introducing Claude Sonnet 5.5
Quick Summary
Anthropic은 Claude Sonnet 5.5를 Sonnet 5보다 출력 생성이 30% 이상 빠르고 자사 테스트에서 작업당 비용이 최대 30% 낮으며, 범위가 명확한 일상 업무와 코딩에서 Claude Opus 5.5를 보완하는 모델로 소개했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Anthropic은 Claude Sonnet 5.5를 Sonnet 5보다 출력 생성이 30% 이상 빠르고 자사 테스트에서 작업당 비용이 최대 30% 낮으며, 범위가 명확한 일상 업무와 코딩에서 Claude Opus 5.5를 보완하는 모델로 소개했다.
📌 핵심 요약
- 2026년 9월 28일 발표된 Claude Sonnet 5.5는 Claude 5.5 제품군의 두 번째 모델로, 버그 수정과 문서·슬라이드·스프레드시트 제작에 강점을 내세운다. 복잡하고 개방적인 업무에서는 Opus 5.5가 여전히 더 강하며, 대량 처리와 비용 민감형 애플리케이션용 Claude Haiku 5.5는 향후 몇 주 내 합류할 예정이다.
- Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%로 Sonnet 5의 10.3%를 크게 앞섰다. GDPval-AA v2.1에서는 1844점으로 Opus 5.5의 1846점에 근접했고, CursorBench 4.0에서는 55.5%를 기록했다.
- 토큰 100만 개당 입력 $2, 출력 $10, 캐시 읽기 $0.20으로 Sonnet 5와 단가는 같지만, Anthropic 테스트에서는 토큰 사용량 감소로 작업당 비용이 최대 30% 줄었다. 출력 생성은 30% 이상 빨라졌으며, 여러 벤치마크에서는 Low 또는 Medium effort로 Sonnet 5의 최고 점수를 작업당 약 10분의 1 비용에 넘어섰다.
- 초기 테스트에서는 코드베이스 이해, 도구 호출 효율, 자연스러운 협업과 디자인 품질 개선이 보고됐다. Base44의 실제 앱 제작 118건에서는 Opus 5와 동등한 점수에 도달하면서 평균 반복 횟수가 7.7회에서 3.6회로 줄었고, Slack은 출력 토큰 약 14% 감소, Zendesk는 티켓 처리 속도 20% 향상을 보고했다.
- 자동화된 행동 감사에서 Sonnet 5.5는 대부분의 정렬 지표에서 Sonnet 5와 같거나 개선된 결과를 보였다. 사이버보안 역량이 Opus 5와 비슷해 Sonnet 최초로 해당 사이버 안전장치와 대체 대응 체계를 도입했으며, 생물학 안전장치는 Sonnet 5와 동일하다. 두 안전장치는 좁은 범위의 고위험 요청을 대상으로 한다.
🧩 주요 포인트
- 모델별 역할 분담: Sonnet 5.5의 속도·효율 개선은 범위가 명확한 업무와 빠른 반복에 유리하지만, 지속적인 판단이 필요한 복잡한 업무에서는 Opus 5.5의 우위가 유지된다.
- 비용 비교의 기준 변화: Sonnet 5와 토큰 단가는 같아도 사용량과 effort에 따라 작업당 비용이 달라지므로, 최고 점수뿐 아니라 동일 업무의 품질·비용·속도를 함께 비교해야 한다.
- 개선 근거의 적용 범위: Terminal-Bench 4.0 등 벤치마크와 Base44·Slack·Zendesk의 초기 테스트는 성능과 효율 향상을 뒷받침하지만, 개별 평가 결과를 모든 업무의 개선 폭으로 일반화할 수는 없다.
🧠 상세 정리
1. 발표와 Claude 5.5 제품군 내 역할
Anthropic은 2026년 9월 28일 Claude 5.5 제품군의 두 번째 모델인 Claude Sonnet 5.5를 발표하며, Sonnet 5 대비 뚜렷한 성능 개선과 속도·비용상의 이점을 강조했다. Sonnet 5.5의 주된 역할은 범위가 명확한 일상 업무, 버그 수정, 완성도 높은 문서·슬라이드·스프레드시트 제작이며, 디자인 감각도 강점으로 소개됐다. Claude Opus 5.5는 신중한 판단이 필요한 복잡한 작업에 초점을 두고, Sonnet 5.5는 더 빠르고 저렴한 보완 모델로 자리 잡는다. 글쓰기 역시 이전 세대보다 명료해졌으며, 초기 사용자는 Sonnet 5보다 협업하기 좋은 모델이라고 평가했다. 대량 처리와 비용에 민감한 애플리케이션을 겨냥한 Claude Haiku 5.5는 발표 시점으로부터 향후 몇 주 내 제품군에 합류할 예정이라고 밝혔다.
2. 벤치마크의 큰 도약과 해석의 한계
Sonnet 5.5는 에이전트 코딩 평가인 Terminal-Bench 4.0에서 70.6%를 기록해 Sonnet 5의 10.3%를 크게 앞섰으며, 표에 제시된 Opus 5.5 점수는 66.4%다. 지식 업무 평가 GDPval-AA v2.1에서는 Sonnet 5.5가 1844점, Sonnet 5가 1449점, Opus 5.5가 1846점으로 나타나 상위 모델과의 격차가 매우 작았다. 도구를 사용한 Humanity’s Last Exam에서는 Sonnet 5.5가 64.5%로 Sonnet 5의 54.9%보다 높았고, 도구를 사용하지 않은 Chartography에서는 61.6%로 Sonnet 5의 15.6%를 넘어섰다. 장기 작업과 이미지 이해 능력도 개선돼, 스크린샷만으로 Pokémon Red를 끝까지 클리어한 최초의 Sonnet 모델이라고 소개됐다. 다만 Anthropic은 벤치마크가 역량의 일부만 보여 준다고 명시했으며, 내부 및 외부 테스트에서는 지속적인 판단이 필요한 복잡하고 개방적인 작업에 Opus 5.5가 여전히 확실히 더 강했다고 설명했다.
3. Effort 설정에 따른 성능과 작업당 비용
원문은 모델의 점수를 작업당 비용과 함께 비교하면서, effort를 높이면 대체로 작업 시간이 길어지고 비용이 늘지만 점수도 올라간다고 설명한다. 여러 벤치마크에서 Sonnet 5.5는 Low 또는 Medium effort만으로 Sonnet 5의 최고 점수를 작업당 약 10분의 1 비용에 넘어섰으며, 낮은 effort에서 Opus 5.5를 보완하는 비용상의 이점이 가장 잘 드러났다. Claude 앱의 기본값인 Medium effort에서는 Terminal-Bench 4.0에서 Sonnet 5의 최고 점수를 작업당 10분의 1 미만 비용으로 크게 앞섰다. Claude Platform의 기본값인 High effort에서는 FrontierCode에서 GPT-6 Sol의 최고 점수와 동등한 결과를 약 5분의 1 비용에 냈다고 밝혔다. CursorBench 4.0에서는 Low effort로 Sonnet 5의 최고 점수를 10분의 1 미만 비용에 넘어섰고, AA-Briefcase에서는 Medium effort로 약 9분의 1 비용에 앞섰다. 높은 effort에서는 Opus 5.5와 성능뿐 아니라 비용도 비슷해질 수 있으며, Terminal-Bench와 CursorBench의 비용 비교 그래프는 GPT-6 Sol의 공개 결과가 없어 GPT-5.6 Sol을 사용했다고 명시했다.
4. 코딩 성능과 개발 현장의 초기 평가
코딩 영역에서는 FrontierCode의 High effort에서 Sonnet 5.5가 같은 설정의 Sonnet 5보다 10점 높으면서 작업당 비용은 약 15분의 1이었다고 설명한다. 실제 Cursor 세션의 모호하고 여러 파일에 걸친 작업을 평가하는 CursorBench 4.0에서는 최고 점수 55.5%를 기록해 Opus 5.5의 57.8%에 근접했다. 초기 테스터들은 코드베이스를 빠르게 이해하고 Sonnet 5보다 도구 호출을 더 많이 묶어 실행해 단계 수와 비용을 줄이는 점을 높이 평가했다. Epic Games는 수만 줄 규모의 게임 시스템 아키텍처와 여러 시간에 걸친 작업을 처리했다고 밝혔고, CodeRabbit은 출력 토큰과 과도한 웹 검색이 줄었다며 단순·중간 난도 리뷰부터 옮길 계획이라고 전했다. Base44는 실제 앱 제작 118건에서 Opus 5와 동등한 점수를 얻으면서 평균 반복 횟수가 Opus 5의 7.7회에서 3.6회로 줄었고, 비교 모델 가운데 실패한 도구 호출도 가장 적었다고 보고했다. Unity는 프로젝트를 다시 열어 실행 결과를 확인하는 방식으로 대부분의 작업이 검증을 통과했으며, 자체 다단계 Unity Editor 및 코딩 평가에서 작업의 90%를 완료했다고 밝혔다.
5. 지식 업무와 결과물의 완성도
지식 업무에서는 44개 직종과 9개 주요 산업의 실제 과제를 평가하는 GDPval-AA에서 Sonnet 5.5가 Opus 5.5와 거의 같은 점수를 얻고 Sonnet 5보다 약 400점 높았다는 점을 강조한다. 장기 지식 업무 평가인 AA-Briefcase v1.1에서는 Sonnet 5.5가 1811점으로 Sonnet 5의 1359점과 GPT-6 Sol의 1483점을 앞섰으며, Opus 5.5는 1822점이었다. 컴퓨터 사용 평가 OSWorld 2.1의 partial 조건에서는 Sonnet 5.5가 80.1%, Sonnet 5가 57.0%, Opus 5.5가 81.8%를 기록했고, 차트 인식에서도 Opus 5.5에 근접했다. 초기 테스터들은 수치 외에도 대화가 더 자연스럽고 사용자 인터페이스를 세련되게 다듬으며, 슬라이드 템플릿을 따라 수정이 거의 필요 없는 자료를 만드는 능력을 언급했다. 내부 테스트에서는 상장기업의 분기 실적 자료와 실적 발표 통화 기록, 슬라이드 템플릿을 주고 10장짜리 운영 검토 자료를 요청했으며, 전문가 두 명이 첫 초안을 그대로 발송할 수 있다고 판단했다.
6. 업무별 고객 테스트에서 보고된 효율 개선
Slack은 기존 프롬프트를 바꾸지 않은 상태에서 거의 모든 오프라인 Slackbot 평가가 Sonnet 5보다 개선됐으며, 단계 수가 줄고 출력 토큰도 약 14% 감소했다고 밝혔다. Zendesk는 응답과 에스컬레이션 요청에 관한 수백 건의 실제 지원 사례에서 잘못된 판단이 줄고 티켓 처리 속도가 현재 운영 중인 Claude 모델들보다 20% 빨라졌다고 보고했다. Balyasny Asset Management는 질의응답·추출·분석·예측을 포함한 금융 과제 2,441건에서 Sonnet 5보다 높은 점수를 얻었으며, 답변당 토큰 사용량은 Sonnet 5의 약 497k에서 약 121k로 감소했다고 전했다. Box는 원본 문서의 데이터를 다시 확인해 이전 모델이 놓친 오류를 잡았고, 정확도가 높아지는 동시에 2.4배 빠르고 전체 토큰 사용량이 12% 적었다고 평가했다. Lovable은 코딩 평가에서 도구 호출이 약 3분의 1 줄고 셸 실행이 대략 절반으로 감소했다고 밝혔으며, Atlassian은 Sonnet 5 대비 Rovo Agents를 최대 30% 빠르게 실행할 수 있을 것으로 기대했다. 이 결과들은 각 기업의 평가 환경과 업무에서 나온 관찰 또는 전망이므로, 모든 사용 사례에서 동일한 개선 폭을 보장하는 수치로 제시되지는 않았다.
7. 정렬 평가와 사이버·생물학 안전장치
Anthropic은 자동화된 행동 감사에서 Sonnet 5.5가 대부분의 정렬 측정 항목에서 Sonnet 5보다 개선되거나 같은 수준을 보였다고 밝혔다. 이는 모든 항목에서 일괄적으로 향상됐다는 주장과는 구분되며, 원문은 대부분의 지표라는 범위를 유지한다. 사이버보안 역량은 Opus 5와 비슷한 수준으로 평가돼, Sonnet 계열 최초로 가장 강력한 모델들을 위해 개발했던 것과 같은 유형의 사이버 안전장치 및 대체 대응 체계를 갖추고 출시됐다고 설명한다. 생물학 분야의 안전장치는 Sonnet 5와 동일하게 유지되며, 두 분야의 안전장치는 모두 좁은 범위의 고위험 요청을 겨냥한다. 원문에 따르면 일상적인 소프트웨어 개발과 대부분의 생명과학 업무는 영향을 받지 않으며, 성능 평가 방법의 자세한 내용은 Sonnet 5.5 System Card를 참조하도록 안내한다.
8. 동일한 토큰 단가와 실제 비용·속도의 차이
Sonnet 5.5의 가격은 토큰 100만 개당 입력 $2, 출력 $10, 캐시 읽기 $0.20으로 Sonnet 5와 동일하다. Anthropic이 제시한 비용 절감의 근거는 단가 인하가 아니라 같은 작업에 일반적으로 훨씬 적은 토큰이 필요하다는 점이며, 자사 테스트에서는 이전 모델보다 작업당 비용이 최대 30% 낮았다. 출력 생성 속도는 Sonnet 5보다 30% 이상 빨라져 지금까지 나온 Sonnet 가운데 가장 빠르다고 소개됐고, 이 속도는 덜 복잡한 작업을 빠르게 반복하는 용도에 적합하다는 설명으로 이어진다. 다만 출력 생성 속도, 고객이 측정한 전체 작업 처리 속도, 특정 벤치마크에서의 작업당 비용은 측정 대상과 조건이 다르므로 각각의 맥락에서 읽어야 한다. 제공된 원문은 마지막 가격 비교표에서 Sonnet 5.5와 Opus 5.5의 캐시 읽기 가격이 각각 $0.20이라고 표시된 뒤 중간에 끊기므로, 이어지는 가격 항목이나 추가 설명은 이 자료만으로 확인할 수 없다.
🧾 핵심 주장 / 시사점
- Sonnet 5.5의 경제성은 토큰 단가 인하보다 작업을 적은 단계와 토큰으로 끝내는 효율 개선에서 나온다. 따라서 실제 이점은 동일한 품질을 얻는 데 필요한 총사용량과 effort에 달려 있다.
- 일부 벤치마크에서 Opus 5.5에 근접하거나 앞서는 결과와 복잡한 개방형 업무에서의 판단력 우위는 함께 성립할 수 있다. 모델 선택에는 점수뿐 아니라 업무 범위와 지속적인 판단의 필요성이 중요하다.
- 코딩과 지식 업무의 초기 사례는 속도뿐 아니라 수정·반복 부담이 줄어들 가능성을 보여 준다. 다만 고객별 평가 조건과 비교 대상이 달라, 보고된 개선율을 하나의 공통 효과로 합쳐 해석하기는 어렵다.
✅ 액션 아이템
- 범위가 명확한 일상 업무와 버그 수정은 Sonnet 5.5 적용을 검토하고, 지속적인 판단이 필요한 복잡한 업무는 Opus 5.5와 비교.
- Sonnet 5와 Sonnet 5.5를 동일 업무에서 비교해 품질·속도·작업당 비용을 확인하고, Low 또는 Medium effort의 효율을 검토.
- Base44·Slack·Zendesk의 초기 테스트 결과를 참고하되, 실제 적용 업무에서도 반복 횟수·출력 토큰·처리 속도 개선이 재현되는지 확인.
❓ 열린 질문
- Sonnet 5.5와 Opus 5.5를 구분해 적용할 때, 범위가 명확한 업무와 지속적인 판단이 필요한 복잡한 업무의 경계는 무엇인가?
- Low 또는 Medium effort에서 Sonnet 5의 최고 점수를 약 10분의 1 비용으로 넘어선 결과는 어떤 실제 업무에서도 재현되는가?
- Base44·Slack·Zendesk가 보고한 반복 횟수·출력 토큰·처리 속도 개선은 다른 업무 조건에서 어느 정도 유지되는가?