LangChain State of AI 2024 Report
Quick Summary
LangChain의 2024년 보고서는 LangSmith 사용 데이터를 통해 오픈소스 모델과 다단계 AI 에이전트의 확산, LLM 호출 효율화, 평가와 인간 피드백 활용을 보여준다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
LangChain의 2024년 보고서는 LangSmith 사용 데이터를 통해 오픈소스 모델과 다단계 AI 에이전트의 확산, LLM 호출 효율화, 평가와 인간 피드백 활용을 보여준다.
📌 핵심 요약
- LangSmith 조직별 사용 기준으로 OpenAI는 2위 Ollama보다 6배 넘게 사용됐으며, Ollama와 Groq는 상위 5위에 진입했다. 오픈소스 모델 제공업체들의 합산 사용량은 상위 20개 제공업체 사용량의 20%를 차지했다.
- LangSmith 트레이스의 15.7%는 LangChain 이외의 프레임워크에서 발생했다. SDK 사용 비중은 Python 84.7%, JavaScript 15.3%였으며, JavaScript 사용은 전년 대비 3배 증가했다.
- 2024년 3월 출시된 LangGraph의 트레이스를 전송하는 조직은 LangSmith 조직의 43%였다. 도구 호출을 포함한 트레이스 비율은 2023년 평균 0.5%에서 2024년 평균 21.9%로 상승했다.
- 트레이스당 평균 단계 수는 2023년 2.8개에서 2024년 7.7개로 늘었지만, 평균 LLM 호출 수는 1.1회에서 1.4회로 증가하는 데 그쳤다.
- LLM 기반 평가에서는 관련성·정확성·완전 일치·유용성이 주요 기준이었다. 주석이 달린 실행 수는 18배 증가했고, 실행당 피드백은 2.28개에서 2.59개로 소폭 늘었다.
🧩 주요 포인트
- OpenAI의 우세 속 Ollama·Groq 성장 → 로컬 실행과 클라우드 배포 등 유연한 오픈소스 모델 활용에 대한 관심 확대.
- LangGraph 확산과 도구 호출 증가, 단계 수 대비 완만한 LLM 호출 증가 → 다단계 작업의 복잡성과 LLM 요청 비용을 함께 관리하는 설계 흐름.
- LangChain 외부 트레이스와 품질 평가·인간 피드백 활용 → 프레임워크를 넘는 관측 가능성과 응답 신뢰성 개선의 중요성.
🧠 상세 정리
1. 보고서의 관찰 범위와 모델 제공업체
LangChain 팀은 2024년 12월 19일 보고서에서 매달 약 3만 명이 가입하는 LangSmith의 제품 사용 패턴을 바탕으로 LLM 앱 개발의 변화를 설명했다. 따라서 제시된 수치는 LangSmith 사용자와 조직에서 관찰한 결과로 이해해야 한다. 조직별 사용 기준으로 OpenAI는 가장 많이 쓰이는 제공업체였으며, 2위 Ollama보다 사용량이 6배 넘게 많았다. 로컬 실행에 초점을 둔 Ollama와 클라우드 배포에 초점을 둔 Groq는 모두 오픈소스 모델 실행을 지원하며 상위 5위에 진입했다. 보고서는 이를 유연한 배포 선택지와 맞춤형 AI 인프라에 대한 관심 증가로 해석했다.
2. 오픈소스 모델과 검색 인프라
오픈소스 모델을 제공하는 주요 업체의 구성은 전년과 비교해 비교적 일관되게 유지됐다. Ollama, Mistral, Hugging Face는 개발자가 각 플랫폼에서 오픈소스 모델을 실행할 수 있도록 지원하는 대표 업체로 언급됐다. 조직 수를 기준으로 집계한 상위 20개 LLM 제공업체 사용량에서 오픈소스 모델 제공업체들의 합산 사용량은 20%를 차지했다. 검색은 여전히 많은 생성형 AI 작업 흐름의 핵심 요소였으며, 상위 3개 벡터 저장소의 구성도 전년과 같았다. Chroma와 FAISS가 가장 인기 있는 선택지로 제시됐고, Milvus·MongoDB·Elastic의 벡터 데이터베이스가 새롭게 상위 10위에 포함됐다.
3. 프레임워크를 넘는 관측과 언어별 사용
LangSmith의 관측 기능은 LangChain 프레임워크로 만든 애플리케이션 밖에서도 사용됐다. 2024년 전체 트레이스의 15.7%가 LangChain 이외의 프레임워크에서 발생했으며, 보고서는 이를 개발 프레임워크와 무관하게 관측 가능성이 필요하다는 흐름으로 설명했다. SDK 사용에서는 Python이 84.7%를 차지해 디버깅·테스트·모니터링의 중심 언어로 남았다. JavaScript SDK는 15.3%를 차지했고, 전년 대비 사용이 3배 증가했다. 보고서는 JavaScript의 성장을 웹 중심 애플리케이션을 개발하려는 관심과 연결하며, LangSmith가 다양한 개발 환경에서 활용되고 있음을 보여줬다.
4. LangGraph와 도구 호출의 확산
제어 가능한 에이전트 프레임워크인 LangGraph는 2024년 3월 출시된 이후 꾸준히 채택됐다. 보고서에 따르면 LangSmith 조직의 43%가 LangGraph 트레이스를 전송하고 있었으며, 이는 기본적인 LLM 상호작용을 넘어 여러 작업을 조율하는 활용을 반영한다. 도구 호출을 포함하는 트레이스 비율도 2023년 평균 0.5%에서 2024년 평균 21.9%로 상승했다. 도구 호출은 모델이 함수나 외부 자원을 언제 사용할지 결정하고 직접 호출할 수 있게 하는 기능이다. 보고서는 이러한 증가를 에이전트 행동의 확산으로 설명했으며, 데이터베이스 쓰기처럼 외부 시스템과 상호작용하는 작업을 수행할 수 있다는 점을 강조했다.
5. 작업 복잡성과 LLM 호출 효율
트레이스당 평균 단계 수는 2023년 2.8개에서 2024년 7.7개로 증가해 작업 흐름이 더 복잡해졌음을 보여줬다. 여기서 단계는 LLM 호출, 검색기 실행, 도구 호출처럼 트레이스 안에서 수행하는 개별 작업을 뜻한다. 보고서는 단순한 질문과 답변을 넘어 정보를 검색하고 처리한 뒤 실행 가능한 결과를 만드는 연속 작업이 늘고 있다고 설명했다. 반면 트레이스당 평균 LLM 호출 수는 1.1회에서 1.4회로 비교적 완만하게 증가했다. 이는 전체 단계의 증가가 같은 비율의 LLM 호출 증가로 이어지지는 않았음을 보여주며, 보고서는 개발자가 기능을 확장하면서 비용이 많이 드는 LLM 요청을 억제하는 설계로 해석했다.
6. 자동 평가와 인간 피드백
LangSmith 사용자들은 부정확하거나 품질이 낮은 응답을 줄이기 위해 평가 기능으로 테스트를 자동화하고 인간 피드백을 개선 과정에 반영했다. LLM을 심사자로 사용하는 평가는 채점 규칙을 프롬프트에 담아 출력이 기준에 맞는지 점수화하며, 관련성·정확성·완전 일치·유용성이 주요 평가 항목이었다. 보고서는 이러한 기준을 응답이 요구에서 크게 벗어나지 않는지 확인하는 대략적인 품질 점검으로 설명했다. 주석이 달린 실행 수는 한 해 동안 18배 증가했으며, 증가 추세는 LangSmith 사용량 성장과 선형적으로 비례했다. 실행당 피드백 수는 2.28개에서 2.59개로 조금 늘었지만 여전히 적은 수준이었다. 보고서는 이를 바탕으로 자동 평가와 인간 피드백이 복잡해지는 LLM 애플리케이션의 품질 개선에 함께 활용되고 있음을 보여줬다.
🧾 핵심 주장 / 시사점
- OpenAI의 높은 사용량과 오픈소스 모델 제공업체의 성장이 함께 관찰돼, 제공업체의 우세와 배포 선택지의 다양화가 동시에 진행되고 있다.
- 전체 단계 수가 LLM 호출 수보다 훨씬 빠르게 증가한 점은 에이전트의 복잡성을 LLM 호출 횟수만으로 설명하기 어렵다는 점을 보여준다.
- 주석이 달린 실행 수의 18배 증가와 실행당 피드백의 소폭 증가는 피드백 활용 규모 확대와 개별 실행의 피드백 밀도를 구분해서 볼 필요가 있음을 보여준다.
✅ 액션 아이템
- OpenAI·Ollama·Groq의 사용 동향을 바탕으로 로컬 실행과 클라우드 배포 선택지 검토.
- LangGraph와 도구 호출을 활용하는 다단계 작업에서 단계 수와 LLM 호출 수를 함께 점검.
- 관련성·정확성·완전 일치·유용성 평가와 인간 피드백을 활용해 응답 신뢰성 개선.
❓ 열린 질문
- Ollama·Groq의 성장과 관련해 로컬 실행과 클라우드 배포 중 어떤 선택지가 필요한가?
- 평균 단계 수 7.7개와 LLM 호출 수 1.4회라는 결과를 바탕으로 다단계 작업의 복잡성과 LLM 요청 비용을 어떻게 함께 관리할 것인가?
- 관련성·정확성·완전 일치·유용성 평가와 인간 피드백을 응답 신뢰성 개선에 어떻게 함께 활용할 것인가?