당신의 AI 코딩 에이전트는 20만 토큰 컨텍스트 윈도우를 가졌다. 어쩌면 50만. 어쩌면 100만.

그래서 뭐가 달라졌는가?

솔직히 말하면, 나는 아직 잘 모르겠다. 더 큰 윈도우가 더 나은 결과를 가져다줄 거라고 기대했는데, 현실은 좀 더 복잡했다.


1. 컨텍스트 윈도우는 커졌다. 그런데 뭐가 달라졌나?

내러티브는 달콤하다. “20만 토큰이면 코드베이스 전체를 넣을 수 있겠네.” “100만 토큰? 모든 이슈, 문서, 채팅 로그를 다 넣어버리자.”

이건 “하드 드라이브가 2TB니까 모든 파일을 바탕화면에 두겠다"는 말과 같다. 기술적으로 가능하다. 하지만 실제로 그렇게 쓰는 사람이 있던가?

연구는 일관되게 보여준다. 컨텍스트 윈도우가 커질수록 검색 정확도는 떨어진다. “Lost in the middle” — AI는 컨텍스트의 시작과 끝에 집중하고, 가운데는 흐릿해진다. 건초더미가 커질수록 바늘 찾기는 더 어려워진다.

근데 정작 더 흥미로운 질문은 이것이다: 우리는 이 커진 윈도우를 실제로 어떻게 쓰고 있는가? 모델 스펙 비교는 쉽다. “20만 vs 100만"은 숫자로 비교되니까. 하지만 “내가 이 컨텍스트를 얼마나 잘 관리하고 있는가"는 숫자로 안 된다. 그래서 아무도 안 본다.


2. Claude Code 세션, 실제로 무슨 일이 일어나고 있나

우리 팀에서 Claude Code를 쓰면서 관찰한 걸 공유해본다. 수치화된 데이터는 아니고, 몇 달간의 체험적 관찰이다. 정량화된 분석을 해보신 분이 있다면 오히려 내가 듣고 싶다.

한 세션을 들여다보면 이런 패턴이 보인다:

  • 컨텍스트 재수집에 꽤 많은 시간이 들어간다. 이슈 읽고, 문서 검색하고, “이 코드베이스 어떻게 생겼더라” 파악하는 단계. 세션 시작할 때마다 반복된다.
  • 이미 알고 있는 내용을 다시 확인하는 일이 흔하다. 어제 내 Claude가 발견한 걸 오늘 다시 확인. 혹은 팀원 Claude가 이미 알고 있는 걸 내 Claude가 다시 배운다.
  • 실제 문제 해결에 집중하는 시간은 생각보다 적다. 위의 두 단계를 거치고 나서야 본론으로 들어간다.

이게 중요한 건, AI가 몰라서가 아니라 AI가 기억을 공유하지 못해서 생기는 낭비라는 점이다. 우리 팀은 CI/CD, 코드 리뷰, 문서화에는 엄청난 시스템을 갖추고 있으면서, 정작 AI 에이전트가 팀 전체의 지식을 공유하는 방식에 대해서는 거의 신경을 안 쓰고 있더라.

여러분 팀은 어떤가?


3. 내가 목격한 세 가지 패턴

1. 덤프 트럭

“20만 토큰 있으니까 레포 전체 파일, 이슈 47개, 회사 핸드북까지 전부 넣어.”

마음은 이해한다. 뭐가 관련 있는지 미리 알기 어려우니까. “일단 다 넣고 보자"는 유혹.

그런데 이렇게 하면 AI는 대부분 무관한 정보를 배경 소음으로 깔고 추론한다. 노이즈에서 패턴을 찾는다. 없는 문제에 대한 해결책을 자신 있게 제안한다. 불필요한 노이즈는 결국 AI의 추론 품질을 갉아먹는다.

나도 초반에는 이랬다. 지금은… 솔직히 아직도 가끔 그런다. 완벽한 해결책은 못 찾았다. 하지만 의식하기 시작했다는 것만으로도 좀 나아졌다.

2. 매일 아침 같은 설명

“우리 프로젝트는 pnpm 워크스페이스. auth는 packages/auth. legacy/는 건드리지 마. Alice가 배포 담당.”

인간 개발자들은 이걸 입사 첫날 배운다. 그런데 Claude는 매 세션마다 이걸 다시 배워야 한다.

만약 인간 동료가 매일 아침 출근해서 “우리 프로젝트 구조가 어떻게 되죠?“라고 묻는다면, 그날로 면담이다. 그런데 AI에게는 이게 당연하게 여겨진다. 우리는 왜 이 반복 작업을 ‘자동화’하지 못하고 있을까?

3. 천재 섬 (Genius Silo)

이게 가장 흥미롭고, 가장 무서운 패턴이다.

똑같은 Claude 모델을 쓰는데도, 결과는 극단적으로 갈린다. 프로덕트의 뼈대를 속속들이 아는 시니어가 Claude를 잡으면 ‘천재’가 된다. 코드베이스의 역사, 알려진 지뢰밭, 암묵적 컨벤션 — 이 모든 ‘보이지 않는 맥락’이 Claude의 추론에 녹아든다. 세션은 빠르고 마법 같다.

반면 경험이 얕은 주니어가 같은 Claude를 잡으면 빈 손으로 돌아온다. 시니어 Claude가 이미 몇 달 전에 발견한 인사이트를 다시 처음부터 배운다. 토큰을 태우고, 시간을 태우고, 좌절감을 쌓는다.

이게 무슨 뜻인가? AI라는 도구가 팀 전체의 생산성을 높이는 게 아니라, 개인의 경험치에 갇혀 섬처럼 고립되어 있는 현상이다. 시니어는 점점 더 빨라지고, 주니어는 여전히 제자리걸음이다. Claude가 팀의 도구가 아니라 개인의 비서가 되어버린 셈이다.

그리고 팀 리드는 이걸 모른다. 시니어 Claude가 뭘 알고 있는지, 주니어 Claude가 뭘 다시 배우고 있는지 — 이 ‘보이지 않는 칸막이’가 전혀 보이지 않는다.

여러분 팀에서도 비슷한가? 아니면 다르게 해결하고 있는가?


4. 내가 시도해본 원칙들 (가설 단계)

몇 달간 이것저것 실험하면서 대략 네 가지 정도로 정리가 되더라. 아직 가설에 가깝고, 반례나 더 좋은 아이디어가 있다면 진심으로 듣고 싶다.

1. 양보다 관련성

“얼마나 많이 넣을까"가 아니라 “지금 진짜 뭐가 중요할까"를 먼저 묻기 시작했다.

잘 큐레이션된 적은 양의 컨텍스트가 무작정 큰 덤프보다 나은 결과를 낸다는 건 체험적으로 확신이 섰다. 그런데 “잘 큐레이션"이 구체적으로 뭔지는 아직 실험 중이다.

2. 반복 대신 지속

AI가 가치 있는 걸 발견했을 때 — 패턴, 함정, 인사이트 — 그걸 세션 종료와 함께 버리지 않고 어딘가에 저장해두기 시작했다.

지금은 Claude Code 세션 끝날 때 “이 세션에서 발견한 것 중에, 내일 팀원 Claude도 알았으면 하는 게 뭐지?“라고 스스로 묻는다. 완벽하진 않지만, 다음 세션 첫 부분을 아껴주는 경우가 꽤 있다.

3. 도메인 싱크 (Domain Sync)

시니어의 머릿속에 있는 ‘비즈니스 맥락’을 AI의 기본 전제로 이식하는 것.

시니어가 Claude에게 “이 컴포넌트는 성능 크리티컬하니까 O(n²)은 안 돼"라고 말할 때, 그 판단 이면에는 수개월간 쌓은 도메인 지식이 있다. 이걸 모든 팀원의 Claude가 알게 하는 게 도메인 싱크다.

개인의 노하우를 팀의 프롬프트 자산으로 전환하는 단계라고 생각한다. 어디까지 자동화할 수 있을지는 아직 모르겠다. 하지만 방향은 맞는 것 같다.

4. 결과 검증의 루틴화

AI의 답을 그대로 믿지 않고, 과거의 장애나 히스토리에 비추어 필터링하는 습관을 시스템화하는 것.

시니어 개발자는 Claude가 내놓은 코드를 볼 때 무의식적으로 이렇게 체크한다: “저번에 비슷한 PR에서 테스트 깨졌었는데…” “이 패턴은 작년에 장애 냈던 그거랑 닮았는데…” 이 ‘잘 걸러내는 눈’이 시니어의 진짜 차별점이다.

문제는 이게 지금까지 개인의 암묵지로 남아있다는 것이다. “잘 물어보는 것"보다 “잘 걸러내는 것” — 이 시니어의 눈을 어떻게 팀 전체 Claude의 기본 루틴으로 만들 수 있을까? 이게 내가 요즘 가장 많이 고민하는 지점이다.


5. 내가 진짜 궁금한 것 — 같이 생각해보자

컨텍스트 윈도우가 무한히 커지는 지금, 우리는 ‘양’의 함정에 빠져 ‘질’을 놓치고 있지는 않은가?

모델의 벤치마크 점수보다 실제 생산성을 결정짓는 건 결국 내 프로덕트에 최적화된 컨텍스트의 품질이다. 그런데 이건 벤치마크에 안 나온다. 그래서 아무도 안 본다. 그래서 내가 물어보고 싶다.

네 가지 질문

시니어가 AI를 다루는 ‘노하우’와 ‘비즈니스 맥락’이 팀원들에게도 전수되고 있는가, 아니면 각자의 채팅창 안에 갇혀 있는가? 당신 팀에는 몇 개의 천재 섬이 존재하는가?

윈도우가 커질수록 오히려 AI가 핵심을 놓치고 방황하는(Lost in the Middle) 현상을 해결하기 위해, 어떤 필터링을 하고 있는가? 단순히 컨텍스트를 줄이는 것 말고, 더 똑똑하게 구성하는 방법은 없을까?

“넣어두면 언젠가 쓰겠지"라는 방치 속에, 낡고 오염된 컨텍스트가 AI의 판단을 흐리고 있지는 않은가? “legacy/ 절대 건드리지 마"라는 작년의 규칙이 올해의 “마이그레이션 완료, 이제 안전"을 덮어쓰고 있지는 않은지?

우리 팀의 AI는 시간이 흐를수록 똑똑해지고 있는가, 아니면 매번 ‘매일 아침 같은 설명’을 반복하며 제자리걸음 중인가? 이걸 확인할 방법이 있는가?


6. 마무리

나는 이 문제를 몇 달째 들여다보고 있다. 직접 도구도 만들고 있고, 우리 팀에서 실험도 하고 있다. 하지만 아직 정답은 모른다. 실험 중이다.

그래서 물어보고 싶다. 여러분은 AI 코딩 에이전트의 컨텍스트 윈도우를 어떻게 관리하고 있는가?

아이디어가 있다면 댓글로 알려달라. 반대 의견도 좋다. “그냥 큰 윈도우에 다 넣는 게 최선이더라"라는 경험도 진심으로 듣고 싶다. 이 주제, 같이 생각해보면 좋겠다.


이 문제를 Monet이라는 오픈소스 프로젝트로 직접 실험 중입니다. AI 에이전트들의 지식을 팀 단위로 공유하고 통제하는 플랫폼이에요.

지금 파일럿 파트너 팀을 찾고 있습니다. 여러분 팀에 Monet 세팅을 도와드리고, 여러분 팀 워크플로우에 맞춰 자동화할 지점을 함께 찾아갑니다. 관심 있으시면 댓글이나 GitHub Issue로 알려주세요.


이 글에 등장하는 모든 예제와 상황은 실제 경험을 바탕으로 했으며, 블로그 포스트에 맞게 각색되었습니다.