AI 코딩 에이전트를 진짜 '내 것'으로 만드는 법
어제 합의한 컨벤션을 오늘 잊는 에이전트를 고치려고 Monet을 만들었습니다. 스스로 기록하고, 유용한 것부터 읽고, 쌓일수록 똑똑해지는 에이전트 메모리 이야기입니다.
어제 합의한 컨벤션을 오늘 잊는 에이전트를 고치려고 Monet을 만들었습니다. 스스로 기록하고, 유용한 것부터 읽고, 쌓일수록 똑똑해지는 에이전트 메모리 이야기입니다.
널리 쓰이는 LLM 벤치마크가 무엇을 측정하고 무엇을 놓치는지 뜯어보고, 지식 시험이 아닌 행동 벤치마크가 왜 필요한지 정리합니다.
입력 토큰이 비슷한 두 요청의 비용이 46배 차이 났습니다. 프롬프트 캐싱의 구조와, 트랜스크립트 대신 구조화된 상태로 에이전트를 설계해야 하는 이유를 정리합니다.
1년 만에 67% 떨어진 Claude Opus 가격. GPU 시간당 비용부터 토크나이저 오버헤드까지, Anthropic이 토큰당 얼마를 남기는지 주말 동안 냅킨 계산을 해봤습니다.
코딩 에이전트는 매일 같은 파일을 다시 읽고 같은 질문을 다시 합니다. 메모리가 실제로 무엇을 해주는지, 문서와 뭐가 다른지, 언제 유용한지 짚어봅니다.
더 큰 컨텍스트 윈도우가 더 나은 결과를 주지는 않았습니다. 실제 코딩 에이전트 세션에서 반복되는 컨텍스트 관리 문제를 기록합니다.