영상 정리 · AI·개발
Anthropic 공식 블로그 글을 근거로, Claude Code를 쓸 때 돈이 새는 지점 여섯 곳과 막는 법을 짚은 영상
영상의 영어 원어 자막 전체가 근거입니다. 30초 묶음 23개, 13,148자, 끝 시각 12분 13초. 이 영상은 원어가 영어라 원어 자막(en-orig)을 그대로 썼습니다 — 폴더 이름의 "한영자막"은 영상 화면에 업로더가 박아 넣은 자막이고, 유튜브 자막 트랙과는 다른 것입니다.
영상이 소개하는 원 출처(Anthropic 공식 블로그 글)를 직접 열어 대조했습니다. 그래서 이 정리에는 영상에 없는 내용이 꽤 들어 있습니다. 그런 대목은 "영상에 없음"이라고 표시했습니다.
해설자 본인의 이름은 자막으로 확정할 수 없습니다. 채널명과, 설명글에 붙은 외부 링크로 추정한 이름을 나눠서 적었습니다 — 부록 B 참고.
이 영상은 낱말 다섯 개를 안다고 전제하고 말합니다. 하나씩 풀고 갑니다.
/로 시작하는 명령)/clear, /compact처럼 슬래시로 시작해서 치는 특수 명령입니다. 이 영상은 이 중 몇 개를 언제 쓰고 언제 쓰지 말아야 하는지를 다룹니다.영상은 이렇게 시작합니다.
"앤스로픽이 방금 클로드 코드 세션 효율을 최대화하는 방법에 관한 글을 하나 올렸습니다. 글 자체가 꽤 길어서, 저는 거기서 가장 중요한 여섯 가지만 뽑아 왔습니다."
해설자 [00:00]
원 글의 제목은 "Claude Code 세션의 가치를 최대화하기"이고, 쓴 사람은 Anthropic의 리디아 할리(Lydia Hallie), 발행일은 2026년 8월 14일입니다. 이 영상이 올라온 날(8월 19일)보다 닷새 앞섭니다. 이 발행일과 글쓴이 이름은 영상에는 나오지 않습니다 — 정리하며 원문을 직접 열어 확인한 것입니다.
영상이 뽑은 여섯 가지는 크게 세 묶음으로 나뉩니다. 컨텍스트 관리(2~4장), 리소스 효율화(5~6장), 노이즈 억제(7장)입니다. 이 분류도 영상 자신이 나중에 직접 말해 줍니다.
/clear가장 먼저 나오는 팁이자, 영상이 "의외로 사람들이 잘 안 쓴다"고 짚는 것이 /clear입니다.
/clear는 지금까지 쌓인 컨텍스트를 완전히 비웁니다. 방금 하던 작업과 관련 없는 다음 작업으로 넘어갈 때, 이전 작업의 맥락을 다 들고 갈 필요가 없다면 그 자리에서 비우라는 것이 영상의 조언입니다.
"저는 사람들이 클로드 맥스 요금제를 쓰면서 토큰이 계속 바닥난다고 불평하는 걸 보면 항상 의아합니다. 저한테는 그런 일이 없거든요. 그리고 그 이유가 clear를 엄청 많이 쓰기 때문이라고 생각합니다."
해설자 [00:33]
왜 /clear를 자주 써도 괜찮은지에 대해 해설자는 자신의 작업 방식을 예로 듭니다. 각 작업 단계를 결과물(아티팩트) 하나로 따로 저장해 두는 도구를 쓰기 때문에, 굳이 대화창에 맥락을 계속 들고 있지 않아도 필요한 내용은 언제든 다시 꺼낼 수 있다는 것입니다. [00:33]
/compact는 캐시가 살아 있을 때만두 번째 팁은 많은 사람이 반대로 쓰고 있다고 영상이 지적하는 것입니다. /compact는 지금까지의 대화를 요약해서 컨텍스트를 줄여 주는 명령인데, 쓰는 시점을 잘못 잡으면 오히려 토큰을 더 씁니다.
이유는 프롬프트 캐싱 때문입니다. 세션에서 마지막 메시지 이후 한 시간이 지나면 캐시가 사라집니다. 캐시가 이미 사라진 뒤에 /compact를 돌리면, 요약을 만들기 위해 지금까지의 대화 전체를 처음부터 다시 읽어야 합니다. 캐시가 있었다면 공짜에 가까웠을 일을 정가로 치르는 셈입니다.
"세션에 한 시간이 넘게 지난 상태에서 compact 명령을 돌리면, 캐시를 통째로 잃은 것이나 마찬가지입니다. 언어 모델은 여러분이 보낸 메시지를 계속 캐싱해 두는데, 그 캐시가 있어야 같은 내용을 매번 다시 보내지 않아도 됩니다."
해설자 [01:06]
그래서 결론은 "compact를 쓰려면 한 시간이 지나기 전에, 규칙적으로 자주 돌려라"입니다.
"저는 compact를 그렇게 많이 쓰진 않고 clear를 씁니다. 그런데 compact를 쓰는 분이라면 조금 더 규칙적으로 돌려야 합니다. 한 시간이 지나기 전에 끝내야 한다고 생각하시면 됩니다. 이게 엄청난 성능 향상을 주는 건 아니지만, 토큰 비용을 관리하는 데는 훨씬 낫습니다."
해설자 [01:38]~[02:12]
Anthropic 원문은 이 규칙을 "긴 휴식에 들어가기 전에 compact를 돌려라"로 적습니다. 캐시가 아직 살아 있는 동안 요약하면 훨씬 싸게 먹히기 때문입니다. 영상은 이걸 "캐시가 이미 죽은 뒤에 돌리면 손해"라는 반대쪽에서 설명한 것이고, 가리키는 지점은 같습니다 — compact는 캐시가 살아 있을 때(한 시간 이내) 돌려야 값어치를 합니다. 영상에 없음
/context, /memory로 세션 다이어트세 번째 팁은 /context 명령입니다. 이 명령을 돌리면 메시지를 하나도 보내지 않은 시점에, 이미 얼마만큼의 토큰이 깔려 있는지를 보여 줍니다. 해설자가 자기 프로젝트에서 직접 돌려 보인 숫자가 이렇습니다.
"오퍼스 5 컨텍스트 윈도우 기준으로, 제가 아무것도 보내기 전에 이미 4만 7천 토큰이 로드되어 있는 걸 볼 수 있습니다. 초창기 바이브 코딩, 에이전트 코딩을 하던 시절 우리가 컨텍스트 윈도우가 정말 작았을 때는, 이거보다 적은 토큰으로 코드 블록 전체를 짜려고 애썼습니다. 그런데 지금은 이게 아무것도 안 보낸 상태의 기본값입니다."
해설자 [02:45]~[03:20]
이 4만 7천 토큰 안에는 1만 1천 토큰이 메모리 관련으로 잡혀 있었다고 합니다. 이때 이어서 쓰는 것이 /memory 명령입니다. 이걸 돌리면 지금 저장된 메모리가 사용자 메모리인지, 프로젝트 전용 메모리인지, 아니면 다른 무언가인지를 뜯어볼 수 있습니다. 프로젝트와 상관없는 내용이 쌓여 이 숫자를 키우고 있는 경우가 실제로 많다는 것이 요지입니다. [03:20]
메모리 말고 또 하나 부풀리는 범인으로 영상이 지목하는 것이 전역으로 설치된 MCP 서버와 스킬입니다.
"요즘 화제가 되는 AI 도구를 계속 새로 받아 쓰다 보면, 자기가 어떤 MCP 서버를 설치해 뒀는지 잊어버리기 쉽습니다. 요즘 화제인 스킬들도 MCP 서버나 커스텀 에이전트, 커스텀 스킬을 같이 딸려 보내는 경우가 많고, 그게 전역으로 설치되면 세션을 시작하기도 전에 10만 토큰이 로드되는 상황까지 갈 수 있습니다."
해설자 [03:53]~[04:26]
이 세 가지(/clear, /compact, /context·/memory)를 영상은 "컨텍스트 관리" 한 묶음으로 정리합니다. 그리고 /context 점검은 일주일에 한 번 정도는 알림을 맞춰서라도 해 볼 것을 권합니다. 해설자 본인의 예시가 이 조언에 힘을 싣습니다.
"제가 방금 돌려 본 이 프로젝트는 2~3주 전에 한 번 싹 비워서 그때 2만 토큰 정도였는데, 벌써 다시 4만 토큰까지 올라와 있습니다. 그 말은 제가 다시 정리를 해야 한다는 뜻입니다. 그게 그냥 부풀어 오른 군더더기니까요. 그리고 이건 제가 지나가는 모든 세션에 그대로 따라붙게 됩니다."
해설자 [04:59]
여기서부터 영상은 두 번째 묶음인 "리소스 효율화"로 넘어갑니다.
Claude Code 안에는 모델을 고르는 자리와, 사고의 강도(effort level)를 고르는 자리가 따로 있습니다. 모델 고르는 건 다들 알지만, 강도를 조절하는 기능은 초보자들이 잘 안 건드린다고 해설자는 말합니다. 문제는 세션 도중에 이 둘 중 하나라도 바꾸면 지금까지 쌓인 캐시가 통째로 무효화된다는 것입니다.
"예를 들어 세션 안에서 대화를 나누면서 이미 10만 토큰까지 쌓였는데, 거기서 모델을 바꾼다고 해 보죠. Fable에서 Sonic으로, 또는 Opus에서 Fable로 바꾸거나, 강도를 바꾸거나 하면, 캐시가 무효화됩니다. 그 말은 다음 메시지를 보낼 때 그동안 쌓인 걸 처음부터 다 다시 읽어야 한다는 뜻이에요. 그동안 가지고 있던 캐시는 더는 유효하지 않습니다."
해설자 [06:07]
결과는 시간이 갈수록 더 많은 돈이 나가는 것입니다. 그래서 해설자가 실제로 쓰는 대안은, 굳이 지금 세션 안에서 모델을 바꾸는 대신 서브 에이전트를 하나 새로 띄워서 그 작업을 맡기는 것입니다. 서브 에이전트는 별도의 컨텍스트에서 출발하니, 메인 세션의 캐시를 건드리지 않습니다. [06:39]
이 대목에서 자막은 모델 이름으로 "Fable"과 "Sonic"을 언급합니다. "Sonic"은 실제 모델명 "Sonnet"을 자동 자막이 잘못 받아 적었을 가능성이 있습니다. 확정하지 못했습니다 — 부록 B 참고.
@로 직접 붙여라리소스 효율화의 두 번째 팁은 해설자 본인도 "이런 식으로 작동하는 줄은 몰랐다"고 인정하는 것입니다. 파일을 참조시킬 때 @ 기호로 직접 멘션하는 방법입니다.
@로 파일을 멘션하면 그 파일 내용이 요청에 바로 첨부되어 들어갑니다. 반대로 "이런 이름의 파일을 찾아서 봐 줘"라고 말로 시키면, AI가 직접 디렉터리를 뒤지고 검색 결과를 읽어야 합니다.
"예를 들어 이 프로젝트 안에서 스모크 테스트 마크다운 파일을 참조하고 싶다면,
해설자 [06:39]~[07:13]@명령을 쳐서 그 파일을 부르면, 그 파일 자체가 요청에 붙어서 보내집니다. 그러면 결과적으로 도구 호출이 줄어듭니다. 토큰을 잡아먹는 읽기·검색 작업이 줄어드는 거죠."
영상은 이렇게 말로만 시키는 방식을 "게으른 모드"라고 부릅니다. "이런 이름의 파일을 찾아가서 봐" 하고 던져 놓으면, 모델은 모든 디렉터리를 뒤지고 그 검색 결과를 읽어 내야 합니다. 그 검색·읽기 하나하나가 토큰이고, 가능할 때는 직접 @ 멘션을 쓰는 쪽이 자원을 훨씬 아낀다는 것이 결론입니다. [07:47]~[08:20]
같은 대화 안에서 같은 파일을 두 번 @ 멘션하면, 보통 두 번째 사본이 또 통째로 첨부됩니다. 한 번 멘션한 파일을 다시 멘션하면 오히려 중복으로 토큰을 먹을 수 있다는 뜻입니다. 영상에 없음
마지막 묶음은 "노이즈 억제"입니다. 여기에 두 가지가 들어갑니다.
첫째는 명령어 자체를 필터링하는 것입니다. 예를 들어 Git 저장소 안에 추적되지 않은 잡다한 파일이 잔뜩 쌓여 있는 상태에서, 모델에게 아무 CLI 명령이나 마음대로 돌리게 두면 그 출력 전부를 읽어야 합니다.
"git status 같은 명령을 돌렸는데 거기 있을 필요도 없는 잡다한 것들이 잔뜩 있고 그걸 다 읽어야 한다면, 첫째로 컨텍스트 윈도우가 지저분해집니다. 그게 다 캐시에 들어가는 정보가 되는 거니까요. 둘째로 그걸 실제로 읽고 해석해야 하니 돈이 듭니다."
해설자 [08:53]~[09:25]
둘째, 그리고 해설자 본인이 실제로 즐겨 쓰는 방법은 노이즈가 많이 나올 걸 아는 작업은 통째로 서브 에이전트에게 맡기는 것입니다. Sonnet이나 Haiku 서브 에이전트를 하나 띄워서 그 명령을 돌리게 하고, 필요한 부분만 골라내 메인 모델에 돌려주게 합니다.
"터미널에서 이렇게 말할 수 있습니다 — '하이쿠 서브 에이전트를 띄워서 우리 브랜치의 현재 깃 상태를 확인해 줘.' 이런 경우는 좀 과하다고 생각할 수도 있지만, 컨텍스트가 많이 생길 걸 알면서 그중 필요한 건 일부뿐일 상황이 꽤 많습니다. 그럴 때 이 방법이 진짜 값어치를 합니다."
해설자 [09:25]~[09:59]
그렇게 하면 메인 오케스트레이터 창에는 "추적 안 된 변경 사항은 이거고, 최근 커밋 다섯 개는 이거고, 스테이지에 올라간 건 없다" 같은 정리된 요약만 남습니다. 원본 출력 전체를 메인 창에 쏟아붓는 대신입니다. [09:59]
Anthropic 원문은 명령어 출력이 3만 자를 넘으면 자동으로 파일에 저장되고, 대화창에는 미리보기만 표시된다고 적습니다(환경변수 BASH_MAX_OUTPUT_LENGTH). 영상이 말한 "시끄러운 명령을 걸러라"는 조언 뒤에 있는 구체적인 장치입니다. 영상에 없음
영상은 마지막에 이 모든 팁이 중요한 이유를 하나로 묶습니다. 작업 하나를 끝내는 데 드는 비용을 둘러싼 싸움이 실제로 벌어지고 있다는 것입니다.
"지금 우리는 클로드 코드 맥스 요금제나 코덱스 요금제처럼, 모델 제공사가 크게 보조금을 주는 정액제에 익숙해져 있습니다. 그래서 어떤 작업에 토큰이 몇 개가 들든 별로 신경을 안 씁니다. 그런데 오픈소스 모델을 쓸 때는 이게 통하지 않습니다. 쓴 만큼 요금을 내야 하니까요. 모델이 뭘 하든 신경 안 쓰고 그냥 놔두는 건 정말 나쁜 습관이고, 이런 종류의 모델이 점점 더 중요해지는 세상으로 가고 있는 만큼 돈이 훨씬 더 많이 나갈 겁니다."
해설자 [10:33]~[11:07]
즉 지금까지의 여섯 가지 팁은 전부, 구독제라는 안전판이 사라지고 종량제로 넘어갈 미래를 대비하는 습관이라는 것이 영상의 마무리입니다. 해설자는 더 깊게 알고 싶다면 원문을 직접 읽어 보라고 권하며 영상을 맺습니다. 토큰이 실제로 어떻게 만들어지는지, GPU가 이걸 어떻게 처리하는지, 프롬프트 캐싱이 정확히 어떤 원리로 작동하는지가 원문에 더 있다고 말합니다. [11:40]~[12:13]
Anthropic 원문을 직접 열어 보니, 영상이 다루지 않은 내용이 꽤 있었습니다. 특히 왜 캐시가 그렇게 중요한지를 숫자로 뒷받침하는 부분이 원문에는 있는데 영상에는 빠져 있습니다.
| 원문에만 있는 내용 | 무엇 |
|---|---|
| 비용에 영향을 주는 순서 | 원문은 아예 우선순위를 매겨 둡니다 — ① 캐시 무효화를 피하는 것이 가장 크고, 그다음이 ② 컨텍스트 크기, ③ 대화 턴 수, ④ 토큰 단가 순입니다. 이 영상의 팁 4(모델 바꾸지 말기)가 왜 다른 팁보다 먼저 나와야 하는지를 이 순서가 설명해 줍니다. |
| 캐시의 실제 가격표 | 출력 토큰은 입력 토큰보다 약 5배 비쌉니다(GPU를 붙잡는 시간이 다르기 때문). 캐시를 읽으면 일반 입력 가격의 0.1배, 캐시를 새로 쓰면 최대 2배입니다. 캐시 유효기간은 구독 요금제는 1시간, API 키는 5분이고, ENABLE_PROMPT_CACHING_1H 플래그로 API 키도 1시간까지 늘릴 수 있습니다. |
| 긴 세션 자체가 손해인 이유 | 세션 하나를 길게 끄는 것이 여러 개의 짧은 세션보다 비쌉니다. 40번째 대화 턴은 그 앞의 39개 턴을 전부 다시 읽고 시작하기 때문입니다. 영상의 /clear·/compact 조언은 결국 이 사실 하나에서 나옵니다. |
| 추가 명령어 | /rewind(마지막 몇 턴만 제거, 캐시 손실 없음) · /rename(compact 전에 세션 이름 붙여 두면 나중에 찾기 쉬움) · /mcp(MCP 서버 켜고 끄기) · /autocompact 200k(자동 압축 기준선 설정, v2.1.221 이상) |
CLAUDE.md의 "Compact instructions" 항목 |
/CLAUDE.md에 이 섹션을 미리 적어 두면, /compact를 돌릴 때마다 매번 같은 방식으로 요약하게 만들 수 있습니다. |
반대로, 영상이 원문과 정확히 일치했던 부분도 확인됩니다. /clear·/compact·/context의 용법, 모델·강도 변경이 캐시를 무효화한다는 것, @ 멘션이 Read 호출을 줄인다는 것, 서브 에이전트가 메인 세션의 대화를 물려받지 않는다는 것 — 이 다섯은 원문과 그대로 맞습니다.
| 낱말 | 뜻 | 나온 곳 |
|---|---|---|
| 토큰 | AI가 글을 세는 단위. 요금이 여기 걸림 | 0장 |
| 프롬프트 캐싱 | 이미 보낸 대화를 다시 계산하지 않고 재사용하는 것 | 0장, 3장, 5장 |
| 컨텍스트 · 컨텍스트 윈도우 | AI가 지금 기억하고 있는 모든 내용, 그리고 그 최대 크기 | 0장, 4장 |
| 서브 에이전트 | 메인 대화와 별도 컨텍스트로 도는 작은 AI 일꾼 | 0장, 5장, 7장 |
/clear | 지금까지 쌓인 컨텍스트를 완전히 비움 | 2장 |
/compact | 지금까지 대화를 요약해 컨텍스트를 줄임 | 3장 |
/context | 세션 시작 전에 이미 로드된 토큰량을 보여줌 | 4장 |
/memory | 저장된 메모리가 사용자용인지 프로젝트용인지 뜯어봄 | 4장 |
| effort 레벨 | 모델이 얼마나 깊게 생각할지 정하는 강도 설정 | 5장 |
@ 멘션 | 파일을 검색하게 시키지 않고 직접 요청에 첨부하는 방법 | 6장 |
| MCP 서버 | AI에게 바깥 도구를 붙여 주는 규격. 전역 설치 시 매 세션마다 로드됨 | 4장 |
이 영상은 원어가 영어이고, 유튜브 원어 자막(en-orig)이 영상 시간을 거의 다 채웠습니다(23묶음, 13,148자, 12분 13초 시작 지점까지 — 영상 길이 12분 20초). 그래서 en-orig를 그대로 썼습니다. 한국어(ko) 자막도 있었지만 기계번역본이라 쓰지 않았습니다. 폴더 이름의 "[한영자막]"은 업로더가 영상 화면 안에 직접 박아 넣은 자막을 뜻하는 것으로 보이며, 이것과는 별개입니다.
| 자막에 찍힌 것 | 실제로 추정되는 것 | 확인 방법 |
|---|---|---|
| "cash" | cache (캐시)의 동음이의어 오기. 같은 문단에서 뒤로 가면 "cache"로 바르게 찍힌 곳도 있어, 혼용된 것으로 보입니다 | 문맥 |
| "Sonic" | 모델명 Sonnet의 오기일 가능성. 확정하지 못했습니다 — 해설자가 실제로 그렇게 발음했을 수도 있습니다 | 확인 못 함 |
| "spectrum tools" | 해설자가 코딩 작업 단계를 아티팩트로 저장한다며 언급한 도구 이름. 정체를 확인하지 못했습니다 — 특정 제품명의 오기일 수 있습니다 | 확인 못 함 |
| "Opus 5", "Codex plan" | 문맥상 자연스럽게 읽혀 오기로 보이지 않지만, 화면을 직접 보지 못해 실제 표기와 다를 수 있습니다 | 확인 못 함 |
/context·/memory 결과 화면의 정확한 모양 — 소리만 받았으므로 직접 보지 못했습니다.반대로, 이 영상이 정확했던 부분도 적어 둡니다.
/clear는 작업 전환 시, /compact는 캐시 만료(1시간) 전에 — 원문과 일치@ 멘션이 Read 호출을 줄여 준다는 것 — 원문과 일치