LLM 평가의 맹점: 우리는 왜 '행동'이 아니라 '지식'만 보는가?
널리 쓰이는 LLM 벤치마크가 무엇을 측정하고 무엇을 놓치는지 뜯어보고, 지식 시험이 아닌 행동 벤치마크가 왜 필요한지 정리합니다.
널리 쓰이는 LLM 벤치마크가 무엇을 측정하고 무엇을 놓치는지 뜯어보고, 지식 시험이 아닌 행동 벤치마크가 왜 필요한지 정리합니다.
입력 토큰이 비슷한 두 요청의 비용이 46배 차이 났습니다. 프롬프트 캐싱의 구조와, 트랜스크립트 대신 구조화된 상태로 에이전트를 설계해야 하는 이유를 정리합니다.
코딩 에이전트는 매일 같은 파일을 다시 읽고 같은 질문을 다시 합니다. 메모리가 실제로 무엇을 해주는지, 문서와 뭐가 다른지, 언제 유용한지 짚어봅니다.
더 큰 컨텍스트 윈도우가 더 나은 결과를 주지는 않았습니다. 실제 코딩 에이전트 세션에서 반복되는 컨텍스트 관리 문제를 기록합니다.