Deep Agents v0.7
Quick Summary
Deep Agents v0.7은 불필요한 기본 프롬프트와 도구 설명을 걷어내 기본 입력 토큰을 약 65% 줄이면서 평가 성능을 유지하고, 미들웨어와 파일시스템의 구성 가능성을 높인 릴리스다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 요약
Deep Agents v0.7은 불필요한 기본 프롬프트와 도구 설명을 걷어내 기본 입력 토큰을 약 65% 줄이면서 평가 성능을 유지하고, 미들웨어와 파일시스템의 구성 가능성을 높인 릴리스다.
📌 핵심 요약
- 기본 시스템 프롬프트 제거, 내장 도구 설명 43% 축소, TodoListMiddleware 기본 제외를 통해 기본 에이전트의 입력 토큰을 약 6천 개에서 2천 개로 줄였다.
- 자율 작업·다중 대화·장문 맥락의 세 평가 범주와 네 모델을 사용해 v0.7을 v0.6.12와 비교한 결과, 전체 보상은 대체로 유지되고 토큰과 비용은 전반적으로 감소했다.
- gpt-5.6-luna는 토큰 사용량이 34%, 비용이 15% 줄고 보상은 4% 높아졌지만, 모든 모델의 보상 신뢰구간은 0을 포함해 보상 차이가 통계적으로 명확하지는 않았다.
- TodoListMiddleware는 기본값에서 빠졌지만 장기 다단계 작업, 상대적으로 성능이 낮은 모델, 사용자에게 계획과 진행 상황을 보여줘야 하는 환경에서는 선택적으로 다시 사용할 수 있다.
- 기본 미들웨어 교체, 요약 시점과 프롬프트 조정, 파일 읽기·검색 동작 개선과 함께 일부 호환 계층 제거 및 기본 파일 도구 변경이 포함됐다.
🧩 주요 포인트
- 기본 하네스 축소 → 모델이 이미 처리할 수 있는 중복 지침을 제거해 매 요청의 토큰과 비용 부담을 낮췄다.
- 복수 작업 유형과 모델을 이용한 비교 평가 → 단순 토큰 절감뿐 아니라 성능 유지 여부와 모델별 예외까지 함께 검증했다.
- 최소한의 기본값과 교체 가능한 미들웨어 → 공통 설정을 강제하기보다 애플리케이션 특성에 맞춰 계획·요약·파일 도구를 조정할 수 있게 했다.
🧠 상세 정리
1. 맥락 엔지니어링과 하네스 단순화의 배경
Deep Agents v0.7은 에이전트의 능력이 모델에 제공되는 맥락에 크게 좌우되며, 그 맥락을 구성하는 일이 하네스의 핵심 역할이라는 관점에서 출발한다. 그러나 모델이 발전하면서 주요 모델 제공업체의 프롬프트 지침도 계속 바뀌기 때문에, 과거에 필요했던 안내를 그대로 유지하면 이미 모델이 익힌 행동을 중복 설명하게 된다. 글은 최신 맥락 엔지니어링 사례를 인용하며, 잘 설계된 도구 스키마가 사용법을 직접 보여주므로 몇 개의 예시를 길게 넣는 방식보다 유용할 수 있고 예시는 오히려 모델의 탐색 범위를 좁힐 수 있다고 설명한다. 또한 같은 지침을 시스템 프롬프트와 도구 설명에 반복해도 의미 있는 강화 효과가 없다는 점을 강조한다. 이에 따라 v0.7은 숨은 지침을 늘리기보다 간결하고 사용자가 직접 구성할 수 있는 기본 하네스를 목표로 삼았다.
2. 기본 입력 토큰을 65% 줄인 세 가지 변경
개발진은 불필요한 기본 입력을 줄이면 성능을 유지하면서 토큰과 비용 효율을 높일 수 있다는 가설을 세우고 세 가지 변경을 적용했다. 먼저 일반 지침과 도구 사용 안내를 담고 있던 내부 기본 시스템 프롬프트를 제거했으며, 내장 도구 설명도 기존보다 43% 짧게 다듬었다. 이어 계획용 프롬프트와 write_todos 도구가 평가 성능을 유의미하게 개선하지 않았다는 결과에 따라 create_deep_agent에서 TodoListMiddleware를 기본으로 포함하지 않도록 바꿨다. 세 변경을 합친 결과 기본 프롬프트·도구·미들웨어에 해당하는 기본 입력 토큰은 기본 에이전트의 한 턴을 기준으로 약 6천 개에서 2천 개로 감소했다. 이는 약 65%의 절감이며, 사용자 작업 자체의 모든 토큰이 아니라 하네스가 기본적으로 추가하는 입력을 대상으로 한 수치다.
3. 세 평가 범주와 네 모델을 통한 검증
성능 저하 여부는 자율 작업, 대화형 작업, 장문 맥락 작업의 세 범주로 구성한 새 평가 모음으로 검증했다. 자율 범주는 코딩과 데이터 분석 같은 종단 간 작업을, 대화형 범주는 모의 사용자와의 다중 턴 상호작용을, 장문 맥락 범주는 긴 입력에서 정보를 찾고 추론하는 능력을 각각 측정했다. v0.7 하네스와 기존 v0.6.12를 gpt-5.6-luna, gemini-3.6-flash, claude-sonnet-4-6, claude-opus-4-8에 걸쳐 비교한 결과 전체 보상은 대체로 유지됐고 토큰과 비용은 전반적으로 감소했다. 특히 gpt-5.6-luna는 토큰이 34%, 비용이 15% 줄면서 보상이 4% 높아졌고, claude-sonnet-4-6의 비용 증가는 주로 난도가 높은 자율 작업 두 개에서 발생한 것으로 추적됐다. 다만 모든 모델의 보상 신뢰구간은 0을 포함했으며, 통계적으로 명확한 감소는 Luna와 Opus의 토큰 사용량, 그리고 Luna의 비용에서 확인됐다는 제한도 함께 제시됐다.
4. Todo 목록을 선택 기능으로 전환
TodoListMiddleware는 이제 기본 하네스에 포함되지 않고 필요한 사용자가 명시적으로 추가하는 선택 기능이 됐다. 세 작업 범주와 세 모델을 대상으로 한 별도 평가에서 todo 기능을 끈 구성이 보상은 약간 높고 비용은 낮게 나타났기 때문에, 기본 write_todos 도구와 계획 프롬프트를 제거했다. 그렇다고 todo 목록 자체가 불필요하다는 의미는 아니며, 많은 턴에 걸쳐 여러 단계를 추적해야 하는 긴 작업이나 단계 누락 가능성이 높은 상대적으로 덜 유능한 모델에는 여전히 도움이 될 수 있다. 또한 실행 결과뿐 아니라 계획과 진행 상황을 사용자 화면에 보여주는 것이 중요한 환경에서도 가치가 있으며, 이런 경우에는 middleware 목록에 TodoListMiddleware 인스턴스를 한 줄로 추가해 다시 활성화할 수 있다.
5. 프롬프트와 미들웨어 구성 권한 확대
지난 6개월 동안 사용자들이 가장 많이 요구한 사항은 FilesystemMiddleware 교체, SummarizationMiddleware 기준 조정, 전역 기본 프롬프트 변경처럼 기본 하네스의 동작을 공식적으로 바꿀 수 있는 기능이었다. v0.7은 숨은 기본 프롬프트를 없애 사용자가 작성한 프롬프트가 내부 지침과 중복되거나 충돌할 가능성을 줄였고, 동일한 이름을 가진 미들웨어 인스턴스를 전달하면 기존 기본 미들웨어를 제자리에서 교체하도록 했다. 대표적으로 기본 SummarizationMiddleware는 대화가 맥락 창의 85%를 넘을 때 일반 요약 프롬프트를 사용하지만, 이제 개발자가 별도 모델과 요약 프롬프트를 지정하고 임계값도 바꿀 수 있다. 글의 예시는 요약 시점을 맥락 창의 50%로 앞당기고 파일 경로와 결정을 그대로 보존하도록 프롬프트를 설정하는 방법을 보여준다. 같은 교체 방식은 요약뿐 아니라 프롬프트 캐시의 유효기간 같은 다른 기본 미들웨어 설정에도 적용된다.
6. 파일시스템 도구의 실행성과 대규모 탐색 개선
Deep Agents에서 파일시스템은 에이전트가 상태를 읽고 쓰며 탐색하는 핵심 맥락 관리 계층으로 취급되며, v0.7은 평가 결과와 실제 사용 궤적에서 확인한 문제를 바탕으로 여러 동작을 개선했다. write_file은 기존 파일을 만났을 때 오류를 내는 대신 해당 파일을 덮어쓰도록 변경돼 수정 작업의 흐름이 단순해졌다. 페이지 단위 read_file은 전체 줄 수와 남은 줄 수, 다음 읽기에 사용할 오프셋을 알려주므로 긴 파일을 연속해서 탐색하기 쉬워졌다. grep과 glob은 큰 디렉터리 트리에서 무한정 기다리는 대신 일부 결과와 잘림 여부를 반환하며, grep에는 최대 1천 건 제한, 스트리밍 출력, 선택 가능한 주변 문맥 줄 기능도 추가됐다. 이러한 변경은 파일 도구가 대규모 트리에서 멈추는 위험을 줄이고, 에이전트가 남은 탐색 범위를 명시적으로 파악하도록 돕는다.
7. 호환성 변경과 업그레이드 방법
이번 릴리스에는 기본 동작 변경과 과거 호환 계층 정리도 포함되므로 기존 사용자는 이전 설정에 의존하는 부분을 확인해야 한다. TodoListMiddleware가 기본에서 제외된 것 외에도 v0.5에서 이미 폐기 예정이었던 백엔드 팩토리 지원이 제거됐으며, 이제 구체적인 BackendProtocol 인스턴스를 사용해야 한다. v0.5부터 예고됐던 다른 파일 형식과 백엔드 프로토콜 관련 폐기 항목도 함께 제거됐고, delete 도구는 기본 파일시스템 도구 목록에 새로 포함됐다. 삭제 기능이 필요하지 않은 환경에서는 FilesystemMiddleware의 도구 허용 목록을 사용해 이를 제외할 수 있으며, 구체적인 이전 절차와 코딩 에이전트용 업그레이드 프롬프트는 변경 기록에서 제공된다. v0.7은 파이썬 패키지 색인과 npm에 배포됐으며, 각각 기존 deepagents 패키지를 갱신하거나 최신 npm 패키지를 설치하는 방식으로 사용할 수 있다.
🧾 핵심 주장 / 시사점
- 이번 결과는 최신 모델을 위한 하네스에서 지침의 양 자체보다 중복 없는 프롬프트와 명확한 도구 인터페이스가 더 중요할 수 있음을 보여준다.
- 기본 입력 절감은 모든 모델에서 동일한 비용 효과를 보장하지 않으므로, 토큰·비용·보상을 작업 유형과 모델별로 함께 평가해야 한다.
- todo와 요약 기능을 제거하기보다 선택적으로 재구성하게 한 설계는 단순한 기본값과 복잡한 실제 사용 사례를 동시에 지원하는 방향이다.
✅ 액션 아이템
- Deep Agents v0.7에서 기본 입력 토큰이 약 6천 개에서 2천 개로 줄었는지, 실제 요청 단위 토큰·비용 변화를 점검한다.
- TodoListMiddleware를 장기 다단계 작업과 사용자에게 계획·진행 상황을 보여줘야 하는 환경에 선택적으로 다시 쓸 기준을 정한다.
- v0.7과 v0.6.12 비교처럼 자율 작업·다중 대화·장문 맥락에서 보상 유지와 토큰·비용 감소가 함께 나오는지 비교한다.
❓ 열린 질문
- gpt-5.6-luna의 토큰 34%·비용 15% 감소와 보상 4% 상승이, 보상 신뢰구간이 0을 포함하는 상황에서 어떻게 해석되는가?
- TodoListMiddleware를 기본값에서 뺀 뒤 상대적으로 성능이 낮은 모델에는 어떤 조건에서 선택적으로 다시 켜야 하는가?
- 기본 미들웨어 교체와 일부 호환 계층 제거 이후 파일 읽기·검색 동작은 애플리케이션별로 어디까지 재구성해야 하는가?