Articlelangchain.com·2026년 8월 26일·0

Evaluating OpenWiki with WikiBench

Quick Summary

WikiBench는 코드베이스 질문에 대한 에이전트의 답변으로 OpenWiki의 품질을 평가하며, 위키와 소스를 함께 활용할 때 소스만 사용할 때보다 정확도와 비용 효율이 높아짐을 보여준다.

Evaluating OpenWiki with WikiBench 관련 대표 이미지

🖼️ 인포그래픽

Evaluating OpenWiki with WikiBench 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Evaluating OpenWiki with WikiBench의 핵심 내용을 4단계로 요약한 인포그래픽
Evaluating OpenWiki with WikiBench 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

WikiBench는 코드베이스 질문에 대한 에이전트의 답변으로 OpenWiki의 품질을 평가하며, 위키와 소스를 함께 활용할 때 소스만 사용할 때보다 정확도와 비용 효율이 높아짐을 보여준다.

📌 핵심 요약

  • OpenWiki는 코드베이스 문서를 생성·유지하는 오픈소스 에이전트이며, WikiBench는 위키의 실질적인 도움과 OpenWiki 변경에 따른 품질 개선을 측정하기 위해 개발됐다.
  • WikiBench는 Harbor에서 고정된 커밋의 저장소를 사용하며, 영역 전반을 다루는 포괄성 질문과 특정 동작을 묻는 검색 질문에 대한 답변의 사실 충족도와 읽은 자료에 대한 근거성을 평가한다.
  • 동일한 Luna 모델로 비교했을 때 OpenWiki 0.3.0은 OpenWiki 0.2.5와 Bare DeepAgents보다 우수했으며, 계획 수립을 강화한 뒤 포괄성 질문에서 개선이 두드러졌다.
  • OpenWiki 0.3.0의 모델 비교에서 DeepSeek Flash와 GLM 5.2는 모두 좋은 성능을 보였지만, DeepSeek Flash의 비용은 GLM 5.2의 약 6분의 1이었다. 실행 비용은 GLM 5.2가 9.18달러, Luna가 0.44달러였고, 소요 시간은 Terra가 11분, GLM 5.2가 50분이었다.
  • 위키와 소스를 함께 제공한 읽기 에이전트는 가장 높은 평균 점수를 기록하면서 소스만 제공한 경우보다 비용이 낮았다. 위키만 제공한 경우의 성능은 훨씬 낮았다.

🧩 주요 포인트

  1. 답변의 정확성과 근거성을 함께 채점 → 문서 자체의 형식보다 코드베이스 질문 해결에 기여하는 정도로 위키 품질을 비교한다.
  2. 계획 수립 강화 이후 포괄성 개선이 집중됨 → 저장소 전반을 다루는 능력과 특정 동작을 찾아 설명하는 능력을 구분해 개선 효과를 해석한다.
  3. 모델별 비용·시간 차이와 위키·소스 병행 효과 → 생성 단계의 자원 사용과 읽기 단계의 정확도·비용 효율을 함께 고려할 필요가 있다.

🧠 상세 정리

1. OpenWiki의 효용과 개선을 측정하는 WikiBench

OpenWiki는 코드베이스 문서를 생성하고 유지하는 오픈소스 에이전트다. 개발팀은 위키가 코딩 에이전트에게 실제로 도움이 되는지, OpenWiki에 적용하는 변경이 결과물을 개선하는지 측정할 필요가 있었다. WikiBench는 이 두 질문에 답하기 위해 실제 코드베이스에 근거한 질문으로 생성된 위키를 평가한다. 이를 통해 서로 다른 위키의 품질 차이와 위키 사용 자체의 효과를 모두 비교한다. 평가의 중심은 문서가 얼마나 많이 만들어졌는지가 아니라, 해당 문서를 활용하는 에이전트가 저장소에 관한 질문에 얼마나 잘 답하는지에 있다.

2. Harbor 기반 실행 구조와 질문 생성

WikiBench는 장시간 작업을 수행하는 에이전트를 평가하는 프레임워크인 Harbor 위에서 실행된다. Harbor 작업은 맥락을 제공하는 환경, 작업을 수행하는 에이전트, 결과를 평가하는 검증기로 구성된다. WikiBench의 환경은 특정 커밋으로 고정한 저장소이며, 에이전트는 그 저장소에서 OpenWiki 초기화를 실행해 최초 위키를 생성한다. 검증기는 읽기 에이전트가 위키나 소스를 활용해 저장소 질문에 답하도록 한다. 질문은 고정된 커밋의 패키지나 하위 시스템 등 주요 영역을 조사해 자동 생성한다. 포괄성 질문은 변경할 코드의 위치·상호작용·검증 방법을 공통 형식으로 묻고, 검색 질문은 특정 동작을 개별적으로 묻는다.

3. 사실 충족도와 근거성을 결합한 채점

각 질문에는 답변이 포함해야 할 사실 목록을 담은 JSON 형식의 채점 기준이 함께 생성된다. 답변을 평가할 때 첫 번째 언어 모델 심사자는 요구된 사실이 답변에 포함됐는지 확인한다. 두 번째 심사자는 그 사실이 에이전트가 실제로 읽은 페이지에 근거하는지 확인하므로, 정확성과 근거성을 모두 충족해야 점수를 받는다. 예를 들어 요구된 사실이 5개인데 답변이 3개만 충족했다면 해당 답변의 점수는 0.6이다. 전체 위키의 점수는 모든 답변 점수의 평균으로 계산한다. 같은 읽기 에이전트에게 원시 소스만 제공해 답하게 할 수도 있어, 위키 버전 사이의 비교를 넘어 위키 자체의 효용도 평가할 수 있다.

4. 실행 구성 비교와 계획 수립 강화의 효과

첫 번째 실험은 동일한 Luna 모델을 사용해 Bare DeepAgents, OpenWiki 0.2.5, OpenWiki 0.3.0을 비교했다. 위키 생성에 특화되지 않은 범용 에이전트 실행 구성인 Bare DeepAgents의 성능이 가장 낮았고, OpenWiki 0.3.0은 이전 버전보다 우수했다. OpenWiki 0.3.0은 시스템 프롬프트와 전담 하위 에이전트를 통해 계획 수립을 더 강조했다. 개발팀은 이 변경이 더 폭넓은 위키로 이어질 것으로 예상했으며, 실제 개선의 대부분은 포괄성 질문에서 나타나 그 가설과 일치했다. 반면 페이지 작성 개선에는 상대적으로 덜 집중했기 때문에 검색 질문의 성능 향상은 더 작았다.

5. 모델별 성능·비용·시간과 저장소 탐색량

다음 실험은 OpenWiki 0.3.0을 여러 모델로 실행해 성능과 자원 사용을 비교했다. DeepSeek Flash와 GLM 5.2는 모두 좋은 성능을 보였지만, DeepSeek Flash의 비용은 GLM 5.2의 약 6분의 1이었다. 실행 비용은 GLM 5.2가 9.18달러, Luna가 0.44달러였으며, 소요 시간은 Terra가 11분, GLM 5.2가 50분으로 차이가 컸다. 작업 내용을 살펴보면 DeepSeek와 GLM은 Luna보다 약 3배 많은 파일을 읽었지만 작성한 페이지는 1.2~1.5배에 그쳤다. 이는 추가 작업이 출력량을 늘리는 데 집중되기보다 저장소를 더 폭넓게 이해하는 데 주로 사용됐음을 보여준다.

6. 위키와 소스를 함께 활용할 때의 효과

위키 자체의 효과를 확인하기 위해 읽기 에이전트에 위키만 제공하는 경우, 원시 소스만 제공하는 경우, 두 자료를 모두 제공하는 경우를 비교했다. 위키와 소스를 함께 제공했을 때 평균 점수가 가장 높았으며, 비용도 소스만 사용하는 경우보다 낮았다. 원문은 위키가 색인처럼 작동해 에이전트에게 탐색의 출발점을 제공하고, 저장소 구조를 처음부터 파악하는 부담을 줄인다고 설명한다. 위키만 사용한 경우의 성능은 훨씬 낮아, 위키는 소스를 대체하기보다 소스 탐색을 안내할 때 효과적이었다. 개발팀은 이러한 평가 구조를 통해 실행 구성과 모델을 비교하고, 그 결과를 OpenWiki의 개선 방향을 정하는 데 활용하고 있다.

🧾 핵심 주장 / 시사점

  • 위키 품질을 사용자의 질문에 답하는 에이전트의 성과로 측정하면, 문서 생성 변경이 실제 활용에 미치는 효과를 확인할 수 있다.
  • 포괄성 질문과 검색 질문을 분리한 평가는 계획 수립 개선과 개별 페이지 작성 개선의 효과를 구별하는 데 도움이 된다.
  • 위키는 소스 탐색의 출발점을 제공할 때 가치가 크며, 생성 비용뿐 아니라 이후 답변 과정의 비용과 정확도도 함께 살펴볼 필요가 있다.

✅ 액션 아이템

  • WikiBench의 사실 충족도와 근거성을 기준으로 OpenWiki 변경 전후의 품질 비교.
  • DeepSeek Flash와 GLM 5.2의 성능·비용을 비교하고, 모델별 소요 시간을 함께 검토.
  • 위키와 소스를 함께 활용하는 구성을 기준으로 소스 단독 사용 대비 정확도와 비용 효율 확인.

❓ 열린 질문

  • OpenWiki 0.3.0의 포괄성 질문 개선과 검색 질문 개선은 각각 어느 정도였는가?
  • DeepSeek Flash와 GLM 5.2의 성능 차이는 약 6분의 1이라는 비용 차이와 비교할 때 어느 정도인가?
  • 위키와 소스를 함께 활용할 때 소스만 사용하는 경우보다 평균 점수와 비용은 각각 얼마나 개선됐는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.