How Couchbase built a multi-model AI architecture for Capella iQ with Amazon Bedrock
Quick Summary
Couchbase는 Capella iQ에 공급자 독립형 다중 모델 구조를 구축하고, Amazon Bedrock의 사설 연결과 미국 내 교차 리전 추론을 활용해 유연성·보안·가용성을 높였으며 Claude Sonnet 4.5로 핵심 업무에서 약 76%의 내부 평가 정확도를 달성했다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 요약
Couchbase는 Capella iQ에 공급자 독립형 다중 모델 구조를 구축하고, Amazon Bedrock의 사설 연결과 미국 내 교차 리전 추론을 활용해 유연성·보안·가용성을 높였으며 Claude Sonnet 4.5로 핵심 업무에서 약 76%의 내부 평가 정확도를 달성했다.
📌 핵심 요약
- Capella iQ의 기업 도입이 확대되자 Couchbase는 단일 대규모 언어 모델 의존을 벗어나 여러 기반 모델 공급자를 지원하는 확장성과 복원력 중심의 추론 구조를 마련했다.
- 운영 구조는 두 개의 AWS 리전에 걸친 제어 영역과 Amazon EKS 기반 마이크로서비스로 구성되며, VPC 인터페이스 엔드포인트를 통해 모델 호출을 사설 경로로 전달한다.
- Amazon Bedrock의 교차 리전 추론은 요청을 미국 지리 경계 안의 세 리전으로 자동 분산해 수요 급증이나 리전 성능 저하에 대응하며, 별도의 애플리케이션 장애 전환 로직을 요구하지 않는다.
- Couchbase는 SQL++ 생성, 인덱스 추천, 쿼리 설명, iQ Insights, 다중 대화 등을 평가했고, Claude Sonnet 4.5는 BIRD 방법론을 본뜬 내부 평가에서 약 76%의 정확도로 운영 품질 기준을 충족했다.
- 운영 과정에서는 교차 리전 장애 전환 시험과 모델별 결과 정규화가 주요 과제였으며, 향후에는 한정된 고빈도 작업에 미세 조정한 소형 모델을 적용해 추론 비용을 낮출 계획이다.
🧩 주요 포인트
- 공급자 추상화 계층을 선제적으로 구축해 모델 교체를 코드 수정이 아닌 설정 변경으로 전환했고, 서비스 중단과 사용자 경험의 변화를 줄였다.
- 사설 네트워크 호출과 미국 내 교차 리전 분산을 결합해 데이터 거버넌스 요구를 지키면서 트래픽 급증과 리전 장애에 대한 운영 복원력을 확보했다.
- 표준화된 벤치마크와 자동 평가 파이프라인을 마련함으로써 새 모델 도입을 일회성 전환이 아니라 지속적으로 검증할 수 있는 운영 절차로 만들었다.
🧠 상세 정리
1. 도입 배경과 설계 목표
Capella iQ는 자연어 요청으로 SQL++ 쿼리를 생성하고, 인덱스를 추천하며, 여러 차례 이어지는 대화를 처리하는 개발자 보조 기능이다. Couchbase는 기업 고객의 도입이 늘면서 단일 대규모 언어 모델만으로는 고객별 배포 선호, 트래픽 급증, 리전 장애, 새로운 모델 채택 요구를 충분히 수용하기 어렵다고 판단했다. 이에 따라 사전에 용량을 확보하지 않아도 확장할 수 있고 여러 기반 모델 공급자를 선택할 수 있으며, AWS 리전 간 높은 가용성을 유지하는 모델 독립형 추론 구조를 요구사항으로 설정했다. 핵심 목표는 모델이나 공급자를 바꾸더라도 애플리케이션의 중심 로직과 개발자 경험을 흔들지 않고, 운영 환경에서 유연성과 복원력을 함께 확보하는 것이었다.
2. 제어 영역과 마이크로서비스 구조
운영 구조의 제어 영역은 고가용성을 위해 us-east-1과 us-west-2 두 AWS 리전에 걸쳐 배치됐으며, us-east-1의 Amazon EKS 클러스터에서 Capella iQ 마이크로서비스가 실행된다. cp-api 파드는 개발자 요청을 받아 인증과 세션 처리를 수행하고 추론 호출을 조율하며, cp-internal-api 파드는 내부 서비스 통신과 모델 공급자 선택 및 조직별 라우팅 재정의를 담당한다. cp-ns 파드는 모델 공급자 설정, 테넌트별 재정의, 조직 선호도와 같은 네임스페이스 수준의 구성을 관리한다. 이러한 역할 분리는 모델 선택 정책을 호출 처리 코드에서 분리하며, 모델 업그레이드나 공급자 변경을 네임스페이스 설정 갱신만으로 수행할 수 있게 한다.
3. 요청 처리와 사설 추론 경로
개발자의 자연어 요청이 cp-api에 도착하면 서비스는 사용자를 인증하고 세션 문맥을 불러온 뒤, SQL++ 생성이나 인덱스 추천 등 요청 유형에 맞는 프롬프트 틀을 선택한다. 이어 대화 이력을 포함한 추론 입력을 구성하고 cp-ns의 테넌트별 모델 설정을 적용하며, cp-internal-api가 공급자 선택과 조직 수준의 라우팅 규칙을 결정한다. 완성된 요청은 VPC 인터페이스 엔드포인트를 통해 Amazon Bedrock 런타임으로 전달되므로 전체 프롬프트와 응답 데이터가 공용 인터넷을 통과하지 않고 AWS 인프라 안에 머문다. 생성된 답변은 같은 사설 경로로 돌아오며 cp-api가 내용을 정규화하고 형식을 다듬어 Capella iQ 화면에 전달하고, 후속 대화를 위해 대화 상태도 보존한다.
4. 교차 리전 추론과 운영 복원력
VPC 인터페이스 엔드포인트는 Amazon Bedrock의 교차 리전 추론과 연결돼 추론 요청을 미국 지리 경계 안의 us-east-1, us-east-2, us-west-2로 자동 배분한다. 수요가 급격히 늘거나 특정 리전의 성능이 저하되면 사용 가능한 리전으로 요청이 이동하며, 이를 위해 Couchbase가 애플리케이션 수준의 별도 장애 전환 로직이나 사전 확보 용량을 운영할 필요가 없다. 다만 실제 장애 전환을 검증하는 과정에서는 부분적인 엔드포인트 성능 저하와 리전별 제한 상황을 개발 환경에서 재현하기 어려워 맞춤형 시험 도구가 필요했다. Couchbase는 AWS와 함께 요청이 정상 리전으로 재전송되는지 확인하고, 운영 준비를 위해 시간 초과와 재시도 설정을 조정하면서 응답 품질과 지연 시간에 미치는 영향도 검증했다.
5. 모델 평가와 Claude Sonnet 4.5 선정
Couchbase는 운영 모델을 고르기 전에 SQL++ 생성, 인덱스 추천, 쿼리 설명, iQ Insights 생성, 다중 대화 등 Capella iQ의 핵심 업무를 포괄하는 벤치마크를 마련했다. Amazon Bedrock에서 이용할 수 있는 여러 모델에 표준화된 프롬프트와 응답 시험 세트를 적용하고, 기능적 정확성·결정성·지연 시간·출력 형식의 일관성이라는 네 가지 기준으로 결과를 평가했다. Claude Sonnet 4.5는 BIRD 방법론을 본뜬 내부 평가에서 약 76%의 정확도를 기록하고 모든 평가 업무에서 운영 품질 기준을 충족했으며, 중대한 품질 회귀도 나타나지 않았다. 모델마다 토큰화 방식, 문맥 창 처리, 응답 형식이 달라 공정한 비교를 위해 결과 정규화가 필요했고, 팀은 평가 재현성과 효율성을 높이기 위해 자동화된 평가 파이프라인을 구축했다.
6. 운영 성과와 향후 모델 전략
Amazon Bedrock의 관리형 서버리스 추론 환경과 단일 응용 프로그램 인터페이스는 Couchbase가 개별 모델 인프라를 직접 관리하지 않고도 여러 모델 계열을 평가하고 채택할 수 있게 했다. 통제된 트래픽 시험에서 Claude Sonnet 4.5는 허용 범위 안에서 지연 시간과 처리량 목표를 충족했고, 사용자에게 영향을 주는 품질 저하는 관찰되지 않았다. Couchbase는 공급자 추상화가 장기적인 선택권을 제공하지만, 실제 다중 모델 운영에는 벤치마크 체계, 프롬프트 설계, 관측 가능성에 대한 지속적인 투자가 필요하다는 점도 확인했다. 앞으로는 Amazon Bedrock Custom Model Import를 통해 인덱스 추천이나 쿼리 설명처럼 범위가 명확하고 요청량이 많은 작업에 미세 조정한 소형 모델을 배치해 품질을 유지하면서 추론 비용을 줄이고, 새 모델도 같은 평가 체계로 검증할 계획이다.
🧾 핵심 주장 / 시사점
- 모델 독립성은 여러 모델을 호출할 수 있다는 기능만으로 완성되지 않으며, 공급자 선택·테넌트 설정·조직별 정책을 애플리케이션 코드와 분리하는 구조가 함께 필요하다.
- 교차 리전 추론은 장애 전환 구현 부담을 줄이지만, 부분 장애와 제한 상황을 재현하는 시험 도구 및 시간 초과·재시도 조정은 별도의 운영 준비 과제로 남는다.
- 새 모델의 빠른 채택 능력은 모델 목록보다 표준 벤치마크, 출력 정규화, 자동 평가, 관측 가능성을 지속적으로 운영할 수 있는 체계에 좌우된다.
✅ 액션 아이템
- Capella iQ처럼 공급자 추상화 계층을 두어 모델 교체를 코드 수정이 아닌 설정 변경으로 처리하는 기준을 정의한다.
- Amazon Bedrock 교차 리전 추론과 VPC 인터페이스 엔드포인트 사설 경로가 리전 장애·트래픽 급증에 주는 복원력 범위를 점검한다.
- Claude Sonnet 4.5의 약 76% 내부 평가 정확도를 SQL++ 생성·인덱스 추천·iQ Insights 등 핵심 업무별로 비교한다.
❓ 열린 질문
- Capella iQ 핵심 업무에서 Claude Sonnet 4.5의 약 76% 정확도가 운영 품질 기준으로 충분한 임계값은 무엇인가?
- Amazon Bedrock 교차 리전 추론이 미국 지리 경계 안 세 리전 자동 분산만으로 수요 급증과 리전 성능 저하에 충분한가?
- 한정된 고빈도 작업에 미세 조정한 소형 모델을 넣을 때 추론 비용 절감과 정확도 균형을 어떻게 판단할 것인가?