Articlehuggingface.co·2026년 8월 18일·0

How Much Memory Does Your Agent Actually Need?

Quick Summary

에이전트 메모리는 많이 제공할수록 좋은 기능이 아니라, 모델의 역량과 남은 개선 여지에 맞춰 전체 주입·선별 검색·미사용 중 적정 용량을 선택해야 하는 조정 대상이다.

How Much Memory Does Your Agent Actually Need? 관련 대표 이미지

🖼️ 인포그래픽

How Much Memory Does Your Agent Actually Need? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How Much Memory Does Your Agent Actually Need?의 핵심 내용을 4단계로 요약한 인포그래픽
How Much Memory Does Your Agent Actually Need? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

에이전트 메모리는 많이 제공할수록 좋은 기능이 아니라, 모델의 역량과 남은 개선 여지에 맞춰 전체 주입·선별 검색·미사용 중 적정 용량을 선택해야 하는 조정 대상이다.

📌 핵심 요약

  • ALTK-Evolve는 에이전트의 성공·실패 궤적에서 재사용 가능한 행동 지침을 추출하고, 가중치 갱신이나 사람의 주석 없이 추론 시점의 문맥에 다시 제공한다.
  • AppWorld의 다단계 과제 585개와 역량 수준이 다른 모델 8개를 평가한 결과, 메모리 효과는 전체 지침이 유리한 강한 모델, 선별 검색이 유리한 약한 모델, 개선이 측정되지 않는 포화 모델의 세 양상으로 나타났다.
  • DeepSeek-V3.2는 전체 지침을 제공했을 때 TGC가 9.5퍼센트포인트, SGC가 16.1퍼센트포인트 상승했으며, Claude Opus 4.6과 GPT-5.5도 높은 기준 성능에도 불구하고 엄격한 SGC에서 각각 7.1퍼센트포인트와 7.2퍼센트포인트 개선됐다.
  • gpt-oss-120b는 고신뢰 핵심 지침과 과제별 관련 지침을 결합한 선별 검색에서 TGC와 SGC가 각각 16.1퍼센트포인트 상승했고, 토큰 사용량 증가는 5%에 그쳤다.
  • 전체 지침 주입의 비용 증가는 주로 추론 단계 증가가 아니라 반복되는 입력 토큰에서 발생했으며, 정적 지침 접두부를 안정적으로 유지해 프롬프트 캐싱을 활용하면 운영 비용을 줄일 수 있다.

🧩 주요 포인트

  1. 동일한 학습 지침 집합을 전달 방식만 달리해 비교했다는 점에서, 성능 차이는 지침 생성법보다 모델별 메모리 투여 전략의 영향으로 해석할 수 있다.
  2. TGC보다 SGC 개선 폭이 더 큰 사례가 많았다는 결과는, 적절한 지침이 평균적인 과제 성공뿐 아니라 표현·데이터·경계 조건이 달라진 변형 전체에 대한 신뢰성을 높였음을 보여준다.
  3. 선별 검색은 약한 모델에서 정확도와 비용을 동시에 개선했고, 전체 지침은 충분한 역량과 개선 여지가 있는 모델에서 효과적이므로 단일 메모리 정책을 모든 모델에 적용하는 방식은 비효율적이다.

🧠 상세 정리

1. 문제의식과 핵심 주장

이 글은 에이전트가 과거 경험에서 얻은 지침을 얼마나 많이 제공받아야 하는지를 다룬다. 과거 작업의 교훈을 추출해 다시 문맥에 넣으면 경험이 쌓일수록 성능이 좋아질 것처럼 보이지만, 모델 8개로 평가 범위를 넓히자 더 많은 메모리가 항상 더 나은 결과를 만들지는 않았다. 모델에 따라 전체 지침이 가장 효과적이기도 했고, 일부만 선별한 구성이 더 정확하면서 저렴하기도 했으며, 어떤 모델에서는 측정 가능한 개선이 나타나지 않았다. 따라서 에이전트 메모리는 단순히 켜고 끄는 기능이 아니라 모델의 역량, 개선 여지, 문맥 처리 능력과 과제 특성에 맞춰 양을 조정해야 하는 투여량으로 제시된다. 글의 중심 결론은 축적한 경험을 모두 제공하는 것이 아니라 각 모델이 실제로 활용할 수 있는 만큼 제공해야 한다는 것이다.

2. 모델 밖에서 이루어지는 학습

여기서 메모리는 과거 대화나 작업 기록을 그대로 재생하는 것이 아니라, 이전 궤적에서 추출한 성공 전략, 피해야 할 실수, 드문 경계 사례 등의 행동 지침 집합을 뜻한다. 에이전트가 과제를 수행해 궤적을 만들면 ALTK-Evolve가 성공한 실행과 실패한 실행 모두에서 재사용 가능한 지침을 추출하고, 이를 하나의 지침 집합으로 통합한다. 추론 시점에는 이 집합 전체 또는 현재 과제와 관련된 일부가 에이전트 문맥에 제공된다. 이 과정에서는 모델 가중치를 갱신하지 않고 사람의 주석도 요구하지 않으므로, 바뀌는 것은 기반 모델 자체가 아니라 모델 주변에 배치되는 안내 정보다. 이러한 구조 때문에 같은 추출·통합·검색 절차를 서로 다른 모델에 적용할 수 있으며, 연구에서는 이를 역량 수준이 다른 8개 모델에 사용했다.

3. 평가 환경과 비교 구성

평가는 달력, 메시징, 결제 등을 포함한 9개 모의 앱에서 수행되는 AppWorld의 다단계 과제 585개를 대상으로 진행됐으며, 일반 시험 과제 168개와 도전 시험 과제 417개로 구성됐다. 메모리에 쓰인 지침은 AppWorld 훈련 분할의 궤적에서 한 번만 생성됐고, 시험 분할 데이터는 지침 구축에 사용되지 않았다. 기준 구성은 메모리를 전혀 넣지 않은 원래 에이전트이고, 전체 지침 구성은 채굴된 모든 지침을 매 ReAct 단계마다 주입한다. 선별 검색 구성은 동일한 지침 집합에서 고정된 고신뢰 핵심 지침과 과제별로 검색한 소수의 관련 지침을 결합한다. 두 메모리 구성은 지침을 만드는 방식이 아니라 전달하는 방식만 다르므로, 비교의 초점은 동일한 경험을 얼마나 넓게 문맥에 넣느냐에 있다. 모델마다 자체적으로 채굴하는 지침 수가 달라 원시 개수는 직접 비교하기 어렵기 때문에, 연구는 지침 개수 대신 전체 주입과 선별 검색이라는 전략 단위로 결과를 보고했다.

4. 모델 역량에 따른 세 가지 양상

첫 번째 양상은 충분한 역량과 개선 여지가 있는 강한 모델로, 이들은 드문 경계 사례를 포함한 전체 지침 집합을 흡수하고 활용할 수 있어 전체 주입에서 가장 좋은 결과를 보였다. 두 번째는 상대적으로 작거나 약한 모델로, 지나치게 큰 지침 집합을 한꺼번에 받으면 효과가 떨어지고 고신뢰 핵심 지침과 과제별 관련 지침을 조합한 선별 검색에서 더 좋은 성능을 냈다. 세 번째는 메모리를 추가해도 측정 가능한 개선이 나타나지 않은 포화 양상이며, 연구의 GLM-5 실행 결과가 여기에 해당했다. 다만 포화라는 명칭은 관찰된 결과를 기술할 뿐 원인이 입증됐다는 의미가 아니며, 이미 과제 성능 상한에 가까웠거나 지침이 남은 실패를 다루지 못했거나 모델이 지침을 효과적으로 적용하지 못했을 가능성이 제시됐다. 어느 양상에 속하는지는 매개변수 수만으로 결정되지 않고 벤치마크상 개선 여지, 문맥 창 크기, 아키텍처, 지침 품질, 과제 분포 등이 함께 영향을 주는 것으로 관찰됐다.

5. 대표 모델의 정량적 성능

gpt-oss-120b는 기준 TGC 39.9%와 SGC 21.4%에서 선별 검색 적용 후 각각 56.0%와 37.5%로 상승해 두 지표 모두 16.1퍼센트포인트 개선됐다. DeepSeek-V3.2는 전체 지침을 받았을 때 TGC가 79.8%에서 89.3%로 9.5퍼센트포인트, SGC가 64.3%에서 80.4%로 16.1퍼센트포인트 높아졌다. Claude Opus 4.6도 전체 지침에서 TGC가 90.5%에서 94.6%로, SGC가 87.5%에서 94.6%로 상승해 각각 4.1퍼센트포인트와 7.1퍼센트포인트 개선됐다. GPT-5.5는 기준 TGC 92.3%와 SGC 82.1%에서 전체 지침 적용 후 95.2%와 89.3%를 기록해 각각 2.9퍼센트포인트와 7.2퍼센트포인트 올랐다. 반면 GLM-5는 전체 지침을 제공해도 TGC 87.5%와 SGC 80.4%가 기준값과 같아 두 지표 모두 변화가 없었다. 이 수치는 8개 모델 전체가 아니라 세 양상을 보여주기 위해 표에 제시된 대표 모델들의 결과다.

6. TGC와 SGC가 보여주는 신뢰성 차이

TGC는 개별 과제를 완전하고 정확하게 완료한 비율로, 에이전트가 요청된 일을 실제로 끝냈는지를 나타내는 대표 지표다. SGC는 같은 시나리오에 속한 여러 변형을 모두 성공해야만 통과로 계산하는 더 엄격한 지표이며, 데이터, 표현 또는 경계 조건이 달라져도 일관되게 성공하는지를 측정한다. 평가에서는 여러 모델에서 TGC보다 SGC의 개선 폭이 더 크게 나타났고, DeepSeek-V3.2는 TGC가 9.5퍼센트포인트 오를 때 SGC가 16.1퍼센트포인트 상승했다. TGC가 이미 높은 Claude Opus 4.6과 GPT-5.5에서도 SGC가 각각 7.1퍼센트포인트와 7.2퍼센트포인트 개선돼, 높은 평균 성공률을 가진 모델에도 겨냥할 수 있는 실패 양상이 남아 있음을 보여줬다. 즉 적절한 지침은 단순히 더 많은 과제를 평균적으로 해결하게 하는 데 그치지 않고, 한 시나리오의 모든 변형을 통과하는 신뢰성을 높이는 데 특히 유용했다.

7. 토큰 비용과 프롬프트 캐싱

전체 지침은 매 ReAct 단계의 입력에 반복해서 포함되므로 토큰 사용량을 크게 늘릴 수 있으며, DeepSeek-V3.2는 과제당 평균 14만 8천 토큰에서 26만 3천 토큰으로 증가해 78%의 추가 비용이 발생했다. gpt-oss-120b도 전체 지침을 사용하면 11만 토큰에서 16만 6천 토큰으로 늘어 51%의 오버헤드가 생겼지만, 선별 검색에서는 11만 6천 토큰으로 증가해 오버헤드가 5%에 그쳤다. 이 모델은 선별 검색으로 TGC를 16.1퍼센트포인트 높이면서 토큰 증가는 5%로 제한했으므로, 가장 정확한 구성이 동시에 가장 저렴한 메모리 구성이 됐다. DeepSeek-V3.2의 평균 ReAct 단계 수는 메모리 유무와 관계없이 약 18~19회로 비슷해, 비용 증가는 더 긴 실행 궤적보다 각 단계의 입력 토큰 증가에서 비롯된 것으로 관찰됐다. 운영 환경에서는 단계마다 동일한 정적 지침 접두부를 안정적으로 유지해 프롬프트 캐싱 대상으로 만들면 전체 지침 구성의 실효 비용을 상당히 줄일 수 있다. 문맥 창이 큰 모델이 전체 지침을 더 잘 활용할 수 있다는 가설도 제시됐지만, 이 요인은 아직 다른 역량 변수와 분리된 통제 실험으로 검증되지 않았다.

8. 모델별 메모리 조정 원칙

연구가 제안하는 운영 원칙은 학습한 내용을 계속 누적해 모두 제공하는 것이 아니라, 각 모델이 활용할 수 있는 경험의 양을 측정해 조정하는 것이다. 상대적으로 약한 모델에는 고신뢰 핵심 지침과 소수의 과제별 지침을 결합한 선별 검색이 적합하며, 실험에서는 이 방식이 정확도뿐 아니라 토큰 비용에서도 유리했다. 충분한 역량과 개선 여지가 있는 강한 모델에는 드문 사례까지 보존한 전체 지침 집합이 더 효과적이었고, 실제 운영에서는 정적 부분을 캐싱해 비용을 관리할 수 있다. 메모리로 개선되지 않는 포화 모델에는 남은 실패 유형을 더 명확히 이해하기 전까지 추가 문맥을 투입하지 않는 편이 합리적인 전략으로 제시됐다. 결국 최적 구성은 모델 크기만 보고 정하는 고정 규칙이 아니라, 기준 성능과 남은 실패, 전체 주입과 선별 검색의 정확도, 토큰 비용을 함께 측정해 선택해야 한다.

9. 한계와 후속 연구

현재 선별 검색은 코사인 유사도로 지침의 관련성을 정렬하지만, 이 점수가 실제로 특정 과제에 도움이 되는 지침을 완벽하게 예측하지는 못한 것으로 나타났다. 연구진은 과제 결과 신호를 학습해 지침을 고르는 선택기를 자연스러운 다음 단계로 제시했다. 또한 최소 역량 수준보다 약한 모델에서는 자체 궤적에서 추출할 학습 신호가 부족할 수 있어, 매우 약한 모델을 위한 교사 증류 메모리를 별도의 연구 문제로 다루고 있다. 이번 결과는 엄격한 다단계 벤치마크인 AppWorld에서 검증됐지만 하나의 벤치마크에 한정되므로, 다른 에이전트 벤치마크와 실제 배치 환경으로 검증 범위를 넓히는 작업이 필요하다. 문맥 창 크기와 모델의 전반적 역량을 분리하는 통제 실험도 예정된 과제로 제시됐으며, 따라서 현재 결과는 모든 환경에 대한 최종 결론이 아니라 모델별 메모리 투여량을 체계적으로 조정하기 위한 출발점이다.

🧾 핵심 주장 / 시사점

  • 메모리의 가치는 보유한 지침의 총량보다 모델이 그 지침을 소화하고 남은 실패에 적용할 수 있는지에 달려 있으므로, 모델 선택과 메모리 설계는 분리된 문제가 아니다.
  • 엄격한 SGC에서 더 큰 개선이 반복된 결과는 에이전트 메모리의 주요 효용이 단순 평균 성능 상승뿐 아니라 변형 과제와 경계 조건에 대한 일관성 강화에 있음을 시사한다.
  • 선별 검색은 약한 모델에서 불필요한 문맥을 제거해 정확도와 비용을 함께 개선할 수 있고, 전체 지침이 필요한 강한 모델에서는 안정적인 정적 접두부와 프롬프트 캐싱이 핵심 효율화 수단이 된다.

✅ 액션 아이템

  • 모델의 역량과 남은 개선 여지를 기준으로 전체 주입·선별 검색·미사용 중 적정 메모리 용량을 선택한다.
  • 약한 모델에는 선별 검색을, 강한 모델에는 전체 지침을 우선 비교하고 TGC·SGC 개선 폭과 비용을 점검한다.
  • 전체 지침 주입의 비용이 반복되는 입력 토큰에서 발생하는지 점검하고, 정적 지침 접두부에 프롬프트 캐싱을 활용한다.

❓ 열린 질문

  • 모델의 역량과 남은 개선 여지가 다를 때 전체 주입·선별 검색·미사용 중 어떤 메모리 용량을 선택할 것인가?
  • AppWorld의 다단계 과제 585개에서 TGC보다 SGC 개선 폭이 큰 결과가 모델 8개 전반에서도 유지되는가?
  • gpt-oss-120b의 선별 검색에서 토큰 사용량 증가가 5%에 그친 조건이 다른 약한 모델에도 가능한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.