First Look at Claude Opus 5: Fable-Tier AI for Half the Cost?
Quick Summary
Claude Opus 5는 초기 실사용 비교에서 Fable 5에 가까운 성능과 더 적은 제약을 절반 수준의 가격에 제시했다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 결론
Claude Opus 5는 초기 실사용 비교에서 Fable 5에 가까운 성능과 더 적은 제약을 절반 수준의 가격에 제시했다.
📌 핵심 요점
- Opus 5의 가격은 입력 5달러·출력 25달러로 Opus 4.8과 같고 Fable 5의 절반 수준이어서, 고성능 모델의 비용 대비 작업 완수율을 높일 가능성이 있다.
- 동일한 게임 자산과 짧은 지시로 진행한 비교에서는 44분 만에 타이틀 화면·전투·체크포인트를 갖춘 횡스크롤 게임을 완성해 Fable 5 결과보다 충실한 첫 결과를 냈다.
- 공개 그래프상 Opus 4.8을 뚜렷하게 앞섰고 다수 항목에서 Fable 5도 근소하게 넘었으며, Arc-AGI 3와 Zapier 자동화 벤치에서도 큰 폭의 개선을 보였다.
- 계획 수립·자체 검증·반복 수정뿐 아니라 필요한 컴퓨터 비전 파이프라인을 직접 만들고, 기존 벤치마크의 측정 결함과 실제 코드 버그를 찾아내는 감사 능력도 드러냈다.
- Three.js 3D 세계 제작에서는 기존 Opus 4.8·GLM 5.2·Kimi K3 결과를 넘어서는 시각적 완성도를 보였고, 완화된 가드레일과 프롬프트 캐시 유지도 장시간 에이전트 작업의 강점으로 제시됐다.
🧩 배경과 문제 정의
- Claude Opus 5의 핵심 평가지표는 Fable 5에 가까운 성능을 절반 가격으로 제공하면서 정상적인 코딩 작업을 방해하던 가드레일을 얼마나 줄였는지다.
- Fable 5는 높은 작업 품질에도 정상적인 개발 요청을 자주 차단하므로, 순수 성능뿐 아니라 실제 작업 완수율과 사용 편의성도 비교해야 한다.
- 이를 확인하기 위해 동일 자산을 활용한 게임 제작, 결함이 남은 개인 벤치마크 감사, Three.js 3D 세계 생성 과제가 사용됐다.
🕒 시간순 섹션별 상세정리
1. Fable급 성능과 절반 가격
- Claude Opus 5는 Anthropic의 최신 Opus 계열 모델로 소개되며 Sonnet과 Fable 5에 이은 라인업을 완성한다. [00:43]
- 초기 정보상 Fable 5와 비슷한 성능을 내면서 제한은 더 적고, 일반 코딩보다 사이버보안에 집중한 Opus 4.8 수준의 가드레일을 지향한다. [00:58]
- Fable 5급 성능을 절반 가격에 제공해 비용과 작업 차단을 함께 줄일 가능성이 핵심 경쟁력으로 드러난다. [01:13]
2. 동일한 자산을 이용한 게임 비교
- 문명 스타일 전략 게임의 기존 자산을 마리오형 횡스크롤 게임으로 바꾸는 동일 조건의 과제로 Fable 5와 Opus 5를 비교했다. [01:52]
- 다른 파일을 참조하거나 추가 질문을 하지 않고 한 개의 오리지널 레벨을 창의적으로 완성하라는 짧은 지시만 제공했다. [02:39]
- 44분 뒤 타이틀 화면·배경·전투·체크포인트를 갖춘 플레이 가능한 게임이 완성됐고, Fable 5 결과보다 훨씬 충실한 구성을 보였다. [04:52]
3. 추론과 자동화로 확장된 성능
- Opus 5는 계획 수립, 자체 검증, 반복 수정을 통해 과제를 끝까지 수행하며 가격은 Opus 4.8과 같은 입력 5달러·출력 25달러다. [05:47]
- 공개 그래프에서는 Opus 4.8을 뚜렷하게 앞서고 다수 항목에서 Fable 5도 근소하게 넘었지만, 에이전트 코딩에서는 GPT-5.6 Soul이 우위를 기록했다. [06:14]
- Arc-AGI 3에서는 차상위 모델의 약 3배, Zapier 자동화 벤치에서는 약 1.5배의 통과율을 보여 코딩 외 영역에서도 개선을 나타냈다. [06:58]
4. 자체 검증과 도구 제작
- 어려운 디버깅과 근본 원인 분석에서 자체 검증 루프를 활용해 오류를 발견하고 수정하는 데 집중한다. [07:31]
- Frontier Bench에서는 필요한 컴퓨터 비전 파이프라인을 직접 작성해 기존 도구 호출을 넘어 문제 해결용 도구 자체를 만들었다. [07:53]
- 아티팩트·애니메이션·게임·3D 작업의 시각 품질 개선은 첫 게임 실험의 높은 완성도와도 연결됐다. [08:01]
5. 장시간 작업의 비용과 안전 경계
- 대화 중 사용 도구가 바뀌어도 프롬프트 캐시가 유지돼 장시간 작업에서 캐시 손실에 따른 비용과 지연을 줄인다. [08:20]
- 합법적인 보안 연구에서는 Fable 5보다 개입이 약 85% 감소하지만, 취약점 악용과 관련된 두 영역에는 제한을 유지한다. [08:49]
- 입력 5달러·출력 25달러로 Fable 5의 절반 수준이어서 비슷한 출력 품질이 유지된다면 비용 대비 성능이 주요 선택 요인이 된다. [09:26]
6. Tom’s Bench 독립 감사
- Tom’s Bench는 Claude Code·Codex·Hermes Agent의 실제 세션으로 개인의 AI 에이전트 사용 방식을 측정하려 했지만 로컬 모델 실행에서 문제가 반복됐다. [10:08]
- Fable 중심의 초기 구현은 GPT-5.6 Soul 감사와 Hermes Agent 실행까지 거쳤어도 정상 완료가 어려워 벤치마크 설계의 난도를 드러냈다. [10:40]
- 기존 모델들이 구현 완료와 무결함을 선언한 뒤 Opus 5가 DGX Spark용 로컬 모델 벤치마크의 버그와 설계 결함을 독립적으로 다시 감사했다. [11:09]
7. 측정 타당성과 코드 결함 발견
- 55개 항목 중 18개가 한 번도 0점을 넘지 못했고, 포크 9개는 통과 불가능하며 나머지 포크 트랙도 0.5점으로 제한돼 측정 타당성이 훼손됐다. [11:22]
- 포화된 판정기 외에도 웹 검색 제한 파라미터 누락, 취약한 코드 식별, 항상 거부되는 읽기 경로 등 실제 구현 버그가 발견됐다. [12:19]
- GPT-5.6 Soul의 재검토에서는 대부분의 결함이 완전 또는 부분 유효했지만, 모델을 전혀 구분하지 못한다는 단정은 근거가 부족한 것으로 평가됐다. [13:07]
8. Three.js 판타지 세계 과제
- 빈 디렉터리에서 소규모 참고 사진과 텍스처만 사용해 Three.js 기반 3D 판타지 세계를 처음부터 구축하는 마지막 과제가 시작됐다. [14:29]
- 같은 유형으로 만든 GLM 5.2·Kimi K3·Opus 4.8 결과를 기준으로 Opus 5의 시각 구성과 3D 구현 능력을 비교했다. [14:59]
9. 풍부하고 자연스러운 3D 결과
- 기존 비교에서는 Opus 4.8이 비교적 정교했고 GLM 5.2는 거칠었으며, Kimi K3가 세 모델 중 가장 좋은 결과를 냈다. [15:32]
- Opus 5는 클릭 가능한 랜드마크와 모닥불·캐릭터·연못을 구현하고 언덕과 길에 여러 층위의 질감을 더해 풍부하고 자연스러운 세계를 완성했다. [17:05]
10. 최종 비교와 활용 전망
- Opus 5의 3D 세계는 Opus 4.8뿐 아니라 기존 최고 평가를 받은 Kimi K3보다도 확연히 높은 수준으로 평가됐다. [17:35]
- Fable은 가드레일 때문에 절반가량의 상황에서 사용하기 어렵지만 Opus 5는 제약이 크게 완화돼, 높은 역량과 첫 결과의 완성도를 바탕으로 활용 빈도가 커질 가능성이 제시됐다. [18:27]
🧾 결론
- 이번 첫인상에서 Opus 5의 차별점은 단순 벤치마크 점수보다 게임 제작, 코드 감사, 3D 세계 생성처럼 서로 다른 과제를 끝까지 완수한 데 있다.
- Fable 5와 비슷한 출력 품질을 지향하면서 정상적인 개발 요청에 대한 개입을 줄였다는 점은 실제 사용 가능성과 모델 역량을 함께 개선하는 방향이다.
- 입력 5달러·출력 25달러의 가격, 캐시 유지, 높은 첫 결과의 완성도를 종합하면 장시간 코딩·자동화·시각 제작에서 비용 대비 경쟁력이 클 가능성이 있다.
📈 투자·시사 포인트
- Fable 5급 성능을 절반 가격에 제공한다는 주장이 반복 실험에서도 유지된다면 고성능 AI 모델 시장의 가격 경쟁을 강화할 수 있다.
- 도구 변경 후에도 프롬프트 캐시가 유지되고 불필요한 개입이 감소하면, 장시간 에이전트 서비스의 비용·지연·중단 문제를 함께 낮출 여지가 있다.
- 향후 모델 평가는 정적 벤치마크 점수뿐 아니라 자체 검증, 결함 감사, 도구 제작, 시각 결과물과 같은 실제 작업 완수 능력까지 포함해야 한다.
- 보안 가드레일을 완전히 없애지 않고 정상 개발 작업의 차단을 줄이는 접근은 성능과 안전의 균형을 제품 경쟁력으로 전환하려는 신호다.
⚠️ 불확실하거나 확인이 필요한 부분
- 공개 그래프와 초기 사용 결과는 유망하지만, 영상에 제시된 소수 과제와 첫 실행만으로 다양한 환경에서의 평균 성능과 재현성을 확정하기는 어렵다.
- Tom’s Bench는 개인 세션을 바탕으로 만들었고 측정 불가능 항목과 구현 버그가 발견됐으므로, 이 감사 결과를 일반적인 모델 순위로 확대해서는 안 된다.
- 합법적인 보안 연구에서 개입이 약 85% 감소했다는 수치는 특정 범위의 비교이며, 취약점 악용과 관련된 두 영역에는 제한이 계속 유지된다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 게임 제작과 3D 세계 생성 과제를 같은 자산·프롬프트·실행 조건으로 여러 차례 반복해 완성도와 성공률의 변동을 기록한다.
- 입력·출력 토큰, 프롬프트 캐시 적중, 실행 시간, 재시도 횟수를 함께 수집해 Fable 5와 Opus 5의 실제 과제당 비용을 비교한다.
- 개인 벤치마크를 모델 평가에 사용하기 전에 통과 불가능 항목, 점수 상한, 포화된 판정기와 구현 경로를 독립적으로 감사한다.
- 코딩·자동화·보안 연구별로 가드레일 개입 지점을 구분해 정상 작업 완수율과 안전 제한의 경계를 확인한다.
❓ 열린 질문
- 동일한 과제를 반복하거나 더 큰 코드베이스에서 실행해도 Opus 5의 첫 결과 완성도와 자체 검증 능력이 유지되는가?
- 캐시 유지와 낮은 명목 가격을 포함한 실제 장시간 에이전트 작업의 총비용은 Fable 5보다 얼마나 낮아지는가?
- 합법적인 보안 연구와 취약점 악용 사이에서 Opus 5가 유지하는 두 제한 영역은 실제 개발 흐름에 어떤 영향을 주는가?