Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking
Quick Summary
Andreessen Horowitz의 투자를 받은 Vals는 비공개 시험과 산업별 실무 평가로 기존 AI 벤치마크의 한계를 보완하고 평가의 표준이 되려 한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Andreessen Horowitz의 투자를 받은 Vals는 비공개 시험과 산업별 실무 평가로 기존 AI 벤치마크의 한계를 보완하고 평가의 표준이 되려 한다.
📌 핵심 요약
- 2024년 설립된 Vals는 지난해 8VC와 Bloomberg Beta가 주도한 시드 투자를 받았으며, 2026년 9월 19일 기사 기준 지난달 Andreessen Horowitz가 주도한 시리즈 A에서 4,000만 달러를 조달했다.
- 공동창업자 Rayan Krishnan은 학술 벤치마크가 최신 모델의 발전을 따라가지 못한다고 지적하며, AI 기업이 광고하는 역량을 실제로 검증해야 한다고 주장한다.
- Vals는 구체적인 시험 자료를 공개하지 않으며, 법률·금융·코딩 분야의 복잡한 업무에서 인간과 같은 품질의 결과물을 만들 수 있는지 평가한다.
- Vals는 긍정적인 성과뿐 아니라 부정적인 영향도 평가하려 하며, 재귀적 자기 개선 벤치마크와 정신건강·사이버보안·생물보안·무력충돌법 관련 평가 작업으로 범위를 넓히고 있다.
- 기업이 모델 평가 비용을 지불하는 Vals는 매출이 지난해의 8배라고 밝혔고, 직원은 연초 8명에서 25명으로 늘었다. 추가로 10~15명을 채용할 계획이며, 연방기관 대상 모델 평가 프로그램도 최근 시작했다.
🧩 주요 포인트
- 공개 시험을 학습에 활용할 가능성 → Vals는 시험 자료 비공개를 통해 평가의 신뢰성을 확보하려 한다.
- 일반 지식보다 산업별 업무 완수 능력과 부정적 영향에 초점 → AI의 실무 가치와 위험을 함께 판단하려는 접근이다.
- 유료 평가와 매출·인력 확대 → 모델 개선 및 도입 판단을 지원하는 평가 사업이 성장하고 있으나, 업계 표준으로의 정착은 아직 목표다.
🧠 상세 정리
1. 홍보 수단이 된 벤치마크와 기존 평가의 한계
AI 업계에서 벤치마크는 모델 역량을 검증하고 경쟁사보다 우수하다고 홍보하는 통상적인 수단이 됐다. 기사는 좋은 벤치마크 성적이 거의 언제나 좋은 홍보 효과로 이어진다고 설명한다. 그러나 기업들은 기존 평가 체계를 공략하는 방법도 알아냈으며, 오래된 벤치마크 상당수는 현대 모델의 능력을 측정하도록 설계되지 않았다. Krishnan은 뛰어난 신규 모델이 빠르게 등장하는 속도를 학술 벤치마크가 따라가지 못했다고 말한다. 그의 문제의식은 AI가 사회 전반에 통합되는 만큼 평가가 기업의 광고 내용과 실제 수행 능력 사이의 차이를 검증해야 한다는 것이다.
2. Vals의 설립과 투자 유치
Vals는 이러한 평가 체계의 한계를 고치겠다는 목표로 2024년 설립됐다. 회사는 설립 후 2년도 지나지 않아 기술 업계에서 주목받는 존재가 됐으며, 지난해 8VC와 Bloomberg Beta가 주도한 시드 투자를 유치했다. 2026년 9월 19일 기사 기준 지난달에는 Andreessen Horowitz가 주도한 시리즈 A에서 4,000만 달러를 조달했다. 25세 공동창업자 Rayan Krishnan은 Palantir 인턴 경력이 있고, Stanford 학부 시절 Microsoft와 대학의 인공지능 연구소에서 일했다. 그는 벤치마크가 업계 발전에 뒤처지는 모습을 직접 관찰한 경험에서 Vals의 출발점을 찾는다.
3. 비공개 시험과 산업별 실무 평가
Krishnan은 과거 평가가 변호사 시험과 유사한 문제를 풀 만큼 정보를 알고 있는지처럼 지능을 추상적으로 측정했다고 설명한다. 공개된 시험 자료는 기업이 해당 문제에 맞춰 모델을 학습시키는 데 쓰일 수 있어, 시험의 공정성을 둘러싼 문제를 낳는다. Vals는 이와 달리 구체적인 시험 자료를 공개하지 않는 방식으로 차별화를 시도한다. 평가 대상도 일반 지식에 머무르지 않고 법률·금융·코딩 등 특정 산업의 복잡한 업무를 완수하는 능력에 맞춘다. 핵심 질문은 각 분야에서 모델이 인간과 같은 품질의 결과물을 만들어낼 수 있는지이며, 이를 통해 모델의 실제 영향을 살피겠다는 구상이다.
4. 성과 검증에서 부정적 영향 평가로 확장
Vals가 살피려는 대상은 모델이 좋은 결과를 내는지 여부에만 한정되지 않는다. Krishnan은 모델이 현실 세계에서 제약 없이 작동할 경우 어떤 부정적인 영향을 낳을지도 분석하고 싶다고 말한다. 이러한 방향에 따라 회사는 전통적인 산업별 업무 외에도 새로운 영역으로 평가 범위를 확장하고 있다. 이미 재귀적 자기 개선에 관한 벤치마크가 있으며, 정신건강·사이버보안·생물보안 분야에서도 작업을 진행 중이라고 밝혔다. 무력충돌법 분야에서는 모델이 제네바협약을 어떻게 적용하는지 이해하는 작업도 언급했지만, 기사는 각 평가의 구체적인 방법이나 성능 결과를 제시하지 않는다.
5. 유료 평가의 사업 논리와 성장
Vals의 수익 모델은 기업이 자사 모델의 평가 비용을 지불하는 구조다. 기사는 성능이 부족하다는 결과를 얻을 수도 있는데 왜 비용을 내느냐는 의문을 제기하고, 효과적인 측정이 문제 해결과 지속적인 개선에 도움이 된다고 설명한다. Krishnan은 이를 학생이 SAT 응시를 위해 College Board에 비용을 내는 것에 비유하며, 평가 결과는 새로운 AI 모델을 도입하려는 기업의 의사결정에서도 중요해지고 있다. Vals는 현재 매출이 지난해의 8배라고 밝혔고, 직원은 연초 8명에서 25명으로 약 3배가 됐다. 회사는 더 큰 사무실로 이전하고 10~15명을 추가 채용할 계획이며, 연방기관에 모델 평가를 제공하는 프로그램도 최근 시작했다.
6. 공공 신뢰와 기업 공시에서의 역할 전망
Krishnan은 Vals의 평가 방식이 AI 기업의 사업 성장과 공공 신뢰 형성에서 중요한 역할을 하게 될 것으로 본다. 그는 AI 모델이 경제의 핵심 요소가 되고 더 널리 확산될수록 벤치마크가 모델 사용을 좌우하는 요인이 될 것이라고 전망한다. 인터뷰에서는 SpaceX가 상장했다고 말하고, Anthropic은 올해 후반 상장이 예정돼 있으며 OpenAI도 곧 상장할 것으로 추측한다고 덧붙인다. 이를 바탕으로 그는 평가가 기업의 공시나 향후 AI 투자 설명에서도 중심적인 역할을 할 것이라고 예상한다. 이러한 내용은 창업자가 제시한 전망이며, 기사에서 Vals가 이미 업계의 확립된 표준이 됐다고 입증하는 것은 아니다.
🧾 핵심 주장 / 시사점
- Vals의 차별화는 시험 자료의 비공개 여부와 실제 산업 업무를 측정하는 평가 내용이라는 두 축에 있다.
- 성과와 부정적 영향을 함께 살피는 접근은 벤치마크의 역할을 능력 비교에서 실제 활용의 가치와 위험 판단으로 넓힌다.
- 매출과 인력 증가는 평가 사업의 성장 근거지만, 업계 표준으로 자리 잡았다는 증거와는 구분할 필요가 있다.
✅ 액션 아이템
- Vals의 시험 자료 비공개 방식이 평가의 신뢰성 확보에 어떤 근거를 제공하는지 검토.
- 법률·금융·코딩 분야의 AI 도입 판단에서 복잡한 업무 완수 능력과 부정적 영향을 함께 고려.
- Vals의 매출 8배 성장과 업계 표준 정착 여부를 구분해 판단.
❓ 열린 질문
- Vals는 시험 자료를 공개하지 않으면서 평가의 신뢰성을 어떻게 입증할 수 있는가?
- 법률·금융·코딩에서 인간과 같은 품질의 결과물이라는 기준은 어떻게 정의되는가?
- Vals의 매출 8배 성장과 인력 확대가 업계 표준 정착으로 이어질지는 무엇으로 판단할 수 있는가?