0%

영상 정리 · 빌더 조쉬

(오픈소스 제공) 클로드 코드로 긴 영상을 100% 자동으로 만들어보았습니다

텍스트 한 줄을 넣으면 클로드 코드가 대본을 쓰고, 그림을 그리고, 목소리를 녹음하고, 자막을 맞춰 영상 하나로 합칩니다. 다만 발표자 본인도 실제로 돌려보니 세 번을 고쳐야 봐줄 만한 영상이 나왔습니다.

원본 · 이 글의 근거
  • 채널 빌더 조쉬 Builder Josh
  • 20분 57초
  • 2026-01-14 공개
  • 영상 보기
목차 · 14개 장
  1. 0장먼저 알아야 할 것
  2. 1장왜 만들었나 — 팟캐스트를 만들어 주는 서비스에서 얻은 생각
  3. 2장에이전트 팀 구조 — 감독 하나, 작가 하나, 그 아래 스킬 넷
  4. 3장영상 프로덕션 팀 — 그림·목소리·자막·편집 넷
  5. 4장개발 환경 준비 — 커서, 프로젝트 폴더, 프롬프트.md
  6. 5장프롬프트 설계 — "구조부터 잘 짜고, 클로드에게 다시 다듬게 한다"
  7. 6장초기화 — 폴더가 실제로 생기는 것을 확인한다
  8. 7장API 키 발급 — 결제 연동은 필수, 다만 비용 걱정은 그렇게 크지 않다
  9. 8장에셋 준비 — 상업적으로 써도 되는 폰트와 배경 음악
  10. 9장세 번의 테스트 — 찌그러진 이미지에서 싱크 맞는 영상까지
  11. 10장Veo 3 엔진 실험 — 하루 열 번이면 막히는 도구
  12. 11장마무리 — 비용 경고, 유튜브 검열, 그리고 이걸 어디에 쓸 것인가
  13. 부록 A낱말 정리
  14. 부록 B못 믿을 것

무엇을 근거로 썼는지 — 먼저 읽어 주세요

이 정리는 영상의 한국어 원어 자동자막(ko-orig) 전체를 근거로 했습니다. 자막 조각 39개, 30초 묶음 기준 28,818자, 끝 시각 19:45(마지막 문장은 20:52까지 이어집니다)입니다. 영상 길이가 20:57이니 사실상 처음부터 끝까지 받은 셈입니다.

이 영상에서 확인한 특이한 점 하나 — 유튜브가 내려준 ko-orig(한국어 원어) 자막과 ko(한국어) 자막을 파일 단위로 대조해 보니 글자 하나까지 완전히 같았습니다. 다른 정리에서는 ko가 손을 댄 축약본이라 ko-orig를 우선했는데, 이 영상은 애초에 손댄 판이 따로 없어서 어느 쪽을 골라도 잃는 내용이 없습니다.

영상 설명글에 실제로 딸려 있는 오픈소스 저장소(github.com/uxjoseph/quote-video-prompt)를 열어 대조했습니다. 영상 안에서 발표자가 급하게 고친 것들이, 그 저장소의 완성된 프롬프트에는 이미 정리된 값으로 들어가 있었습니다. 그렇게 확인된 것과 영상에는 없고 저장소에만 있는 값은 본문에서 구분해 적었습니다.

사람 이름·도구 이름 일부는 자막에서 소리 나는 대로 깨져 있습니다. 확인된 것만 고쳐 적었고, 무엇이 어떻게 깨져 있었는지는 부록 B에 표로 남겼습니다.

0장먼저 알아야 할 것

이 영상은 클로드 코드(Claude Code)라는 프로그램 안에 "여러 명의 담당자"를 만들어서, 텍스트 한 줄을 긴 영상으로 바꾸는 과정을 보여줍니다. 그 담당자들을 이해하려면 낱말 넷을 먼저 풀어야 합니다.

클로드 코드 (Claude Code)
터미널(컴퓨터에서 글자로 명령을 치는 검은 화면) 안에서 돌아가는 AI 코딩 도구입니다. "이런 프로그램을 만들어 줘"라고 글로 말하면 코드를 직접 짜고 실행까지 해 줍니다. 유료(프로 플랜 기준 월 20달러)로만 쓸 수 있습니다.
서브 에이전트 (subagent)
클로드 코드 안에 만들어 둘 수 있는 별도 역할을 맡은 작은 클로드입니다. "대본을 써라" 같은, 생각이 많이 필요하고 그만큼 값(토큰)을 많이 쓰는 일을 맡깁니다. 이 영상에서는 "영상 감독"과 "작가"가 서브 에이전트입니다.
스킬 (skill)
서브 에이전트와 달리 정해진 순서를 반복하는 일, 값을 적게 쓰는 일에 쓰라고 클로드 팀이 공식적으로 안내한 기능입니다. "그림을 그려라", "자막을 맞춰라"처럼 매번 같은 절차를 도는 일이 여기 해당합니다. [02:13]
오케스트레이션 (orchestration)
원래 뜻은 "관현악단을 지휘한다"입니다. 여기서는 메인 담당자 하나가 나머지 담당자들에게 일을 나눠주고 순서를 맞추는 역할을 가리킵니다. 이 영상에서는 "영상 감독 에이전트"가 이 역할을 맡습니다.

이 넷만 있으면 1장부터 3장까지, 즉 "누가 무엇을 맡는가"를 보여주는 구간이 통째로 이해됩니다. 4장부터는 실제로 손을 움직이는 구간이라, 필요한 낱말은 그때그때 풀고 넘어갑니다.

1장 · 0:00–1:07왜 만들었나 — 팟캐스트를 만들어 주는 서비스에서 얻은 생각

영상은 시작하자마자 완성본부터 보여줍니다. 트럼프를 소재로 한 영상, 쇼펜하우어 명언 영상 두 벌이 차례로 재생됩니다. 그러고 나서 발표자가 오늘 할 일을 설명합니다. [00:00]

텍스트만 입력하면 AI가 대본을 조사하고 일러스트를 그리고 내레이션을 녹음하고, 마지막으론 정확한 자막을 넣어서 동영상 편집까지 다 해보는 워크플로우를 함께 만들어 보겠습니다.

발표자 [00:33]

이게 가능한 이유로 발표자가 꼽는 것이 클로드 코드 안의 서브 에이전트와 스킬 구조입니다. 그리고 이 아이디어가 어디서 왔는지를 밝힙니다.

발표자는 평소 노트북LM(NotebookLM)이라는 구글 서비스를 자주 씁니다. 자료(소스)를 넣기만 하면 그 내용으로 팟캐스트를 만들어 주는 서비스입니다. 발표자는 이걸 보고 "우리가 만든 보고서를 영상 한 편으로 만들어 볼 순 없을까"라는 생각에서 출발했다고 말합니다. [00:33]

그리고 이 시도가 처음이 아니라는 것도 밝힙니다. 지난번에 마케팅 팀 에이전트를 만든 적이 있는데, 그때 딱 하나 빠진 것이 "긴 영상 만들기"였다고 말합니다. [00:33] 오늘 영상은 그 빈칸을 채우는 시도입니다.

2장 · 1:07–2:46에이전트 팀 구조 — 감독 하나, 작가 하나, 그 아래 스킬 넷

발표자는 Whimsical이라는 다이어그램 도구로 미리 그려 온 조직도를 보여줍니다(자막에는 "윈지컬"로 찍혀 있습니다). [01:07] 구조는 이렇습니다.

맨 위에 영상 감독 에이전트가 있습니다. 사람이 이 감독에게 명령을 내리면, 감독이 나머지에게 일을 나눠줍니다.

대본을 만들어 줘. 이미지 팀은 그림 그려. 음향 팀 나레이션 녹음해. 자막 팀 싱크 맞춰. 편집 팀 영상 합쳐 — 이렇게 오케스트레이션 역할을 해주는 그런 역할이다.

발표자 [01:07]

감독이 제일 먼저 일을 넘기는 곳이 작가 팀입니다. 여기 속한 것이 리서치·대본 에이전트인데, 인터넷에서 자료를 스스로 찾아보고 주제에 맞는 명언을 고르는 등, 우리가 원하는 방향으로 대본을 씁니다. 발표자는 자기 테스트에서 쇼펜하우어 철학 명언을 대본 소재로 골랐다고 말합니다. [01:40]

여기서 발표자가 서브 에이전트와 스킬을 가르는 기준을 한 번 더 짚습니다.

서브 에이전트 같은 경우에는 굉장히 고도화된 일, 그러니까 생각이 필요하고 우리가 토큰을 많이 잡아먹는 그런 일들을 하는 게 서브 에이전트다. 스킬 같은 경우에는 클로드에서 공식적으로 발표한 내용 자체가 반복적인 업무 혹은 토큰을 적게 쓰는 그런 업무에 써라라고 얘기해 주고 있다.

발표자 [02:13]

즉 대본을 쓰는 일(생각이 많이 필요함)은 서브 에이전트가, 그림을 그리거나 자막을 맞추는 일(정해진 절차를 반복함)은 스킬이 맡는다는 구분입니다. 그 스킬 담당자 넷이 다음 장의 주제입니다.

3장 · 2:46–4:57영상 프로덕션 팀 — 그림·목소리·자막·편집 넷

감독 아래 두 번째로 있는 것이 영상 프로덕션 팀입니다. 앞 장에서 정한 기준대로, 넷 다 스킬로 만들어집니다.

일러스트 제작 팀 — 구글 제미나이

구글 제미나이(Gemini) API를 불러서 영상에 들어갈 그림을 그립니다. 발표자는 이때 쓰는 모델을 "나노바나나 프로"라고 부릅니다 — 구글의 이미지 생성 모델에 커뮤니티가 붙인 별명으로, 정식 이름은 gemini-3-pro-image-preview입니다. [02:46]

음향 팀 — 같은 제미나이 API로 목소리까지

음향 팀도 같은 제미나이 API를 씁니다. 구글 AI 스튜디오에 제미나이 TTS API가 따로 있어서, API 키 하나로 그림과 목소리를 둘 다 해결할 수 있다고 발표자는 강조합니다. [03:19]

TTS (Text to Speech)
글자를 사람 목소리처럼 들리는 소리로 바꿔주는 기술입니다. 이 영상에서는 대본 텍스트를 넣으면 내레이션 음성 파일이 나옵니다.

자막 생성 팀 — 오픈AI 위스퍼

오픈AI의 위스퍼(Whisper) 엔진을 씁니다. [03:19]

Whisper (위스퍼)
오픈AI가 만든, 소리를 듣고 그대로 글자로 옮겨 적는 음성 인식 AI입니다. 여기서는 방금 만든 내레이션 음성을 듣고 자막(글자와 시간)을 뽑아내는 역할을 합니다.

발표자는 두 가지 방법을 소개합니다. 컴퓨터에 large-v3 모델을 내려받아 로컬(내 컴퓨터 안)에서 돌리는 방법과, 오픈AI API 키를 따로 받아 쓰는 방법입니다. 로컬로 돌리려면 컴퓨터 용량이 2GB 정도 확보돼 있어야 한다고 안내합니다. [03:19]

영상 편집 팀 — FFmpeg

FFmpeg이라는 파이썬 라이브러리로 그림·목소리·자막을 하나의 영상으로 합칩니다. [03:51]

FFmpeg (에프에프엠펙)
영상과 소리를 자르고 합치고 효과를 넣는, 무료로 쓸 수 있는 프로그램입니다. 화면으로 조작하는 도구가 아니라 코드로 명령을 내리는 방식이라, 클로드 코드 같은 AI가 대신 다루기 좋습니다.

발표자는 이 편집 팀에 대해 스스로 선을 긋습니다.

이게 사실 자동으로 돌아가기는 하는데, 사실상 굉장히 퀄리티가 높고 정말 편집을 잘한다 이것까지는 사실은 아니긴 해요. 그런데 전반적으로 일러스트 다섯 개를 입히고 모든 음성을 합성하고 자막을 입히고 효과를 어느 정도 조금 주는 데까지는 그래도 꽤 효과가 있었습니다.

발표자 [03:51]

이렇게 나온 최종 결과물은 스케치된 그림 + 자막 + 내레이션이 함께 흘러가는 영상입니다. 여기까지가 설계도이고, 다음 장부터 실제로 손을 움직입니다. [04:24]

4장 · 4:57–6:34개발 환경 준비 — 커서, 프로젝트 폴더, 프롬프트.md

발표자는 커서(Cursor)라는 코드 편집기 안에서 클로드 코드를 실행합니다. 커서를 쓰면서 클로드 코드를 쓰는 게 비효율 아니냐는 물음에는, 커서의 디자인 모드를 함께 쓰고 싶어서라고 답합니다. 그러면서 최근 화제인 안티그라비티(Antigravity)는 다음 영상에서 다루겠다고 예고합니다. [04:57]

안티그라비티가 뭔가요

구글이 2025년 말에 내놓은 에이전트형 개발 도구(agentic IDE)입니다. 발표자는 "커서보다 안티그라비티에서 활용하는 게 클로드 코드를 쓰는 데 훨씬 더 가성비가 있다고 표현하시더라"고 남의 말을 옮기지만, 누구의 말인지는 자막에 없습니다. [05:30]

이제 순서대로 진행합니다. [05:30]

  1. 커서에서 오픈 프로젝트를 눌러 새 폴더(유튜브 롱폼 에이전트)를 만들고 엽니다.
  2. 터미널을 열어 클로드 코드를 호출합니다.
  3. 사이드바에서 새 파일 프롬프트.md를 만들고, 미리 준비해 둔 프롬프트를 붙여넣습니다.

클로드 코드 설치가 어렵게 느껴지는 사람에게는 최근 나온 클로드 데스크톱 앱을 안내합니다. 발표자 본인은 편의상 커서 안에서 클로드 코드를 쓴다고 밝힙니다. [06:02]

5장 · 6:34–8:12프롬프트 설계 — "구조부터 잘 짜고, 클로드에게 다시 다듬게 한다"

붙여넣은 프롬프트의 이름은 "오디오북 영상 시스템 프롬프트 가이드"입니다. 만들 영상 스타일 자체가 오디오북 형태(글을 목소리로 읽어주는 형식)라서 이렇게 이름 붙였다고 설명합니다. [06:34]

프롬프트의 0단계는 "클로드 코드의 스킬·에이전트 구조를 이해해서 써라"입니다. 즉 아무렇게나 시키는 게 아니라, 클로드 코드가 공식적으로 정해 둔 서브 에이전트 폴더·스킬 폴더 형식을 그대로 따르게 만드는 지시부터 넣습니다. [06:34]

그다음이 아키텍처 설계 지시입니다. "오디오북 영상 자동 시스템을 만들 거야"라고 선언하고, 2~3장에서 본 구조(스킬 팀, 이미지 팀, TTS 팀, 위스퍼 팀, 자막 생성, 편집 팀)를 그대로 따라 만들도록 가이드라인을 적어 뒀다고 말합니다. [07:07]

이 프롬프트, 저장소에서 그대로 받을 수 있습니다

영상 설명글에 github.com/uxjoseph/quote-video-prompt 링크가 걸려 있습니다. 열어 보면 prompt.md 파일 하나에 0단계부터 6단계, 그리고 한 번에 다 시키는 "원샷 프롬프트"까지 들어 있습니다. 영상에서 발표자가 화면으로 보여주는 것과 같은 내용으로 보이며, MIT 라이선스라 그대로 가져다 써도 됩니다. (이 문단은 영상이 아니라 저장소 자체에서 확인한 내용입니다.)

프롬프트 자체는 상당히 깁니다. 발표자는 이걸 처음부터 손으로 따라 쓰기보다 나은 방법을 알려줍니다.

처음에 구조를 이렇게 좀 잘 짜고 시작을 해서, 클로드에게 "프롬프트를 제안해줘"라고 하면 프롬프트를 오히려 클로드가 저희에게 제안을 다시 해주고 그 계획도도 볼 수가 있습니다. 저 같은 경우에도 이 모든 프롬프팅을 제가 직접 손으로 한 번도 쓴 적은 없어요.

발표자 [07:40]

즉 사람이 다 쓰는 게 아니라, 큰 방향만 사람이 정하고 세부 문장은 클로드가 되받아쳐 다듬게 하는 방식입니다. 그렇게 다듬은 결과를 다시 오픈소스로 공유한 것이 앞의 저장소입니다.

6장 · 8:12–9:51초기화 — 폴더가 실제로 생기는 것을 확인한다

프롬프트 내용을 다 넣었으면, 발표자는 제일 먼저 "init"(초기화)부터 하라고 조언합니다. [08:12]

처음에 시작을 할 때는 이니셜라이즈를 하는 게 중요하거든요. 이렇게 해서 init을 먼저 누르고, 폴더 구조를 파악해서 만들라고 시키도록 하겠습니다.

발표자 [08:12]

잠시 뒤, 실제로 에이전트 파일과 스킬 폴더가 생겨난 것을 화면으로 보여줍니다. [08:12]

발표자는 이 생성된 파일들을 사람이 일일이 다 읽을 필요는 없다고 말합니다. "나중에 자연어로 수정하면 되니까요." [08:44]

다만 딱 하나는 반드시 고쳐야 한다고 짚습니다 — 자동으로 지정된 모델입니다.

TTS 같은 경우에는 일단 제미나이 2.5 플래시 TTS를 활용해서 깊고 낮은 목소리의 내레이션을 생성한다고 보시면 좋겠는데, 이거는 지금 프로 모델로 바꿔야 됩니다. 이미지 같은 경우에도 원래는 제미나이 2.0 플래시가 아니고 3.0 프로를 활용하시는 게 훨씬 더 퀄리티가 좋기 때문에, 그 부분 여러분들이 꼭 수정을 잘 하셨으면 좋겠습니다.

발표자 [09:18]

즉 프롬프트를 처음 돌리면 더 값싼 모델(플래시 계열)이 자동으로 들어가 버릴 수 있으니, 그림은 3.0 프로, 목소리는 2.5 프로로 사람이 직접 확인하고 바꿔줘야 한다는 것입니다.

저장소에는 이미 고쳐진 값으로 들어 있습니다

quote-video-prompt 저장소의 완성된 프롬프트를 보면, 이미지는 gemini-3-pro-image-preview, TTS는 gemini-2.5-pro-preview-tts로 처음부터 고정돼 있습니다. 영상에서 발표자가 직접 겪은 "자동으로 값싼 모델이 걸리는" 문제를, 공유용 프롬프트에서는 미리 손봐 둔 것으로 보입니다. (영상에는 없고 저장소에서 확인한 내용입니다.)

7장 · 9:51–11:30API 키 발급 — 결제 연동은 필수, 다만 비용 걱정은 그렇게 크지 않다

모델을 확인했으면 다음은 구글 AI 스튜디오(aistudio.google.com)에서 API 키를 받는 차례입니다. 그림도 목소리도 다 이 키 하나로 돌아가기 때문입니다. [09:51]

여기서 발표자가 꼭 짚고 넘어가는 것이 있습니다.

오늘 쓸 API는 결제 연동이 되어 있으셔야 됩니다. API라고 하는 게 사실 공짜는 아닙니다. 그리고 클로드 코드도, 죄송하지만 공짜는 아직 아니긴 해요. 프로 플랜에서만 동작을 하고요.

발표자 [09:51]
API 키 (API key)
다른 회사의 서비스(여기서는 구글 제미나이)를 내 프로그램에서 불러 쓸 수 있게 해주는 인증 값입니다. 비밀번호처럼 남에게 보이면 안 됩니다.

정리하면 이 워크플로를 그대로 따라 하려면 두 가지 결제가 필요합니다 — 클로드 코드 프로 플랜(월 20달러)과 구글 클라우드 콘솔에 연동된 결제 수단(API 사용량만큼 과금)입니다. 다만 발표자는 이렇게 안심시킵니다.

전체적인 비용이 크지는 않습니다. 요금 폭탄을 맞으실까 봐 걱정하시는 분들이 있는데, 그런 부분들은 사실 그렇게 엄청 큰 위험은 없으니까 API 키 자체를 잘 관리만 하신다면 너무 좋을 것 같아요.

발표자 [10:24]

API 키를 발급받은 뒤에는, 새 파일 .env를 만들고 그 안에 GEMINI_API_KEY=... 형태로 키를 복사해 넣습니다. [10:57]

.env 파일
프로그램이 읽는 비밀 값(API 키 등)을 따로 모아두는 파일입니다. 코드와 분리해 두는 이유는, 이 파일을 남에게 보여주거나 인터넷에 그대로 올리면 내 API 키로 남이 쓰고 그 비용이 나한테 청구될 수 있기 때문입니다.

그리고 클로드에게 "ENV 파일에 제미나이 API 키가 있으니 확인해라"라고 말해 두면, 이후 작업에서 이 키를 자동으로 찾아 쓸 수 있게 됩니다. [11:30]

8장 · 11:30–13:09에셋 준비 — 상업적으로 써도 되는 폰트와 배경 음악

이제 코드가 아니라 소재(에셋)를 챙길 차례입니다. 자막에 쓸 손글씨 폰트와, 영상 뒤에 깔 배경 음악(BGM)입니다.

폰트 — 눈누에서 받은 코트라 손글씨체

발표자가 쓰는 폰트는 코트라(KOTRA) 손글씨체입니다. 대한무역투자진흥공사(코트라)가 무료로 배포하는 서체로, 상업적으로 활용해도 문제없는 형태라고 소개합니다. [11:30]

다운로드는 눈누(noonnu.cc)에서 받습니다.

눈누
상업적으로 이용해도 되는 한글 폰트만 모아서 검색·다운로드할 수 있는 사이트입니다. 사이트에서 "코트라"로 검색하면 코트라 손글씨체를 바로 찾을 수 있습니다.

이렇게 받은 폰트를 폰트 폴더에 저장해 두고, 이후 자막에 계속 쓰이도록 지정해 둡니다. [12:03]

배경 음악 — 저작권 걱정 없는 곳에서

다음으로는 "스튜디오.com"이라고 부르는 사이트의 오디오 보관함에서 배경 음악을 내려받습니다. 발표자는 "여기서 음악을 다운로드하면 저작권이 완전히 무제한으로 해소된다"고 설명합니다. [12:35] (이 사이트의 정확한 이름은 부록 B에서 확인 여부를 밝혀 둡니다.)

이렇게 받은 음악을 BGM 폴더에 저장하면, 에셋 준비가 끝납니다. 폰트와 BGM이 폴더에 자리 잡은 상태에서, 발표자는 드디어 첫 명령을 내립니다.

이 내용 포함해서 테스트 영상 하나 생성해 줘.

발표자 [13:09]

9장 · 13:09–17:32세 번의 테스트 — 찌그러진 이미지에서 싱크 맞는 영상까지

1차 — 이미지도 찌그러지고 자막도 안 맞았다

첫 결과물이 나왔습니다. output 폴더 안에 "쇼펜하워" 폴더가 새로 생기고, 그 안에 오디오·이미지 파일들과 최종 영상 파일이 담겨 있습니다. 재생해 보니 명언 내레이션과 자막이 나오긴 하지만, 발표자는 바로 문제를 짚습니다. [14:16]

지금 뭔가 제가 봤을 때는 이미지가 이렇게 짜부가 돼서 이렇게 늘어나 있고, 그리고 자막도 조금 안 맞습니다. 약간 "관역"이라고 하는 말인데 이거 좀 안 맞고요. 전반적으로 TTS와 자막과 이 내용들은 다 맞기는 한데, 약간 퀄리티가 안 나오고 있습니다.

발표자 [14:16]

해결하는 방법은 새로 다 짜는 게 아니라, 터미널로 돌아가 증상을 구체적으로 말해주는 것이었습니다.

지금 이미지가 깨져 있고 제미나이 3프로를 사용하지 않은 것 같아. 그리고 자막도 음성과 맞지 않아서 문제가 되고 있어. 새로운 버전으로 다시 개선해서 나에게 주길 바래.

발표자가 클로드에게 남긴 지시 [14:49]

2차 — 그림은 좋아졌지만 자막이 여전히 문제

2차 결과물에서는 제미나이 3 프로로 새로 그려진 스케치 이미지가 확인됩니다. 이전과 다르게 비율도 정상입니다. 다만 발표자는 가장 큰 문제로 자막이 여전히 안 맞는 것을 꼽습니다. [15:22]

가끔 이렇게 파이프라인이 안 맞아 가지고, 이 파이프라인이 맞는지 안 맞는지를 테스트해 보는 게 굉장히 필요하긴 하거든요.

발표자 [15:22]
파이프라인 (pipeline)
이 영상에서는 대본 → 그림 → 목소리 → 자막 → 편집으로 이어지는 작업 순서 전체를 가리키는 말입니다. 중간 어느 한 단계가 다음 단계에 데이터를 잘못 넘기면, 최종 영상에서 문제가 나타납니다.

이번에는 문제의 위치까지 짚어서 다시 지시합니다.

자막이 음성에 따라 제대로 나오지 않고 있어. 이 부분 위스퍼 스킬 확인해서 고쳐 줘.

발표자가 클로드에게 남긴 지시 [15:55]

클로드가 원인을 찾아냅니다. 위스퍼가 자막 스킬과 제대로 엮이지 않고 있었던 것입니다. [15:55]

3차 — 그림·자막·배경 음악이 다 맞아떨어졌다

세 번째 결과물에서는 그림과 자막, 배경 음악이 전부 싱크가 맞고, 내용도 충실하게 나왔다고 발표자는 평가합니다. [16:26]

비용은 얼마나 들었나

발표자는 15초짜리 짧은 영상을 만드는 데 든 비용을 실제로 재 봤습니다.

15초 정도의 영상은 제가 또 측정을 해 보긴 해 봤는데, 지금 요거 같은 경우에는 한 100원에서 200원 정도의 비용이 나오고 있습니다. 이게 지금 만약에 분량이 늘어난다든가 이랬을 때는, 뭐 한 30분 영상 같은 경우에는 API 비용만 포함해서 5,000원 정도 혹은 만 원 정도의 비용이 나오지 않을까 예상해 봅니다.

발표자 [16:59]

이 30분 영상 값은 실측이 아니라 예상치입니다. 발표자도 "영상을 이렇게 제작하는 것 자체는 생각보다 비용이 청구될 수 있는 확률이 너무 높기 때문에, 너무 긴 영상을 제작하는 데 있어서는 조금 더 보수적으로 접근했으면 좋겠다"고 덧붙입니다. [16:59]

10장 · 17:32–19:45Veo 3 엔진 실험 — 하루 열 번이면 막히는 도구

마지막으로 발표자는 같은 파이프라인의 영상 생성 엔진만 바꿔서 테스트해 봅니다. 바로 구글의 Veo 3입니다(자막에는 "데오 3", "배우 3", "베어 3"처럼 매번 다르게 찍혀 있습니다).

베어 3는 뭐냐? 구글에서 제공하고 있는 비디오 API인데요, 제미나이 엔진에 잘 탑재되어 있습니다. 근데 베어 3 같은 경우에는 여러분들이 많이 쓸 수가 없습니다. 하루에 제가 알기로 열 번 정도 호출을 하면 거의 종료가 되는 걸로 알고 있어요. 그래서 구글도 잘 열어주지는 않기 때문에, 저는 여러분들에게 이거를 좀 추천드리고 싶지는 않고요.

발표자 [17:32]

"하루 열 번 제한"은 발표자가 "제가 알기로"라고 붙인, 본인의 앎을 근거로 한 말입니다. 공식 문서를 확인한 것은 아닙니다.

그래도 테스트는 해봅니다. "베어 3로 영상을 샘플로 하나 다시 만들어 줘"라고 명령하면, 같은 파이프라인이 Veo 3 엔진으로 바뀌어 다시 돌아갑니다. [18:06] 이때 발표자가 미리 챙긴 설정이 하나 있습니다.

제가 미리 명령한 것 중에 하나는, 베어 3도 스스로 사운드를 생성하거든요. 근데 그 사운드 옵션을 끈다는 것에 대해서 여러분들 꼭 인지해 주셨으면 좋겠고요.

발표자 [18:38]

Veo 3가 알아서 효과음까지 만들어 버리기 때문에, 이미 있는 나레이션·BGM과 겹치지 않도록 그 기능을 꺼 둬야 한다는 뜻입니다. 이렇게 만든 쇼펜하우어 영상에 이어, 트럼프를 소재로 한 다른 샘플도 함께 보여주며 이 실험을 마칩니다. [19:11]

11장 · 19:45–20:52마무리 — 비용 경고, 유튜브 검열, 그리고 이걸 어디에 쓸 것인가

발표자는 마지막으로 세 가지를 당부합니다.

첫째, 비용입니다. "1시간짜리, 2시간짜리 영상을 만드는 데 있어서는 토큰량 그리고 API 비용에 따라서 여러분들이 과금이 많이 될 수 있다는 점을 꼭 인지해 주셨으면 좋겠다"고 말합니다. [19:45]

둘째, 업로드입니다. 발표자는 이렇게 만든 영상을 유튜브에 그대로 올리는 것을 권하지 않습니다.

저는 이런 영상을 사실은 여러분들이 유튜브에 올린다든가 이렇게 하는 것은 사실 그렇게 권장드리고 싶지 않습니다. 왜냐? 일단 앞으로 유튜브 같은 경우에는 AI 영상 가이드라인이 많이 검열이 세질 예정이기 때문에, 이 검열에 대해서 여러분들이 꼭 주의하셨으면 좋겠고요.

발표자 [19:45]

셋째, 그럼 어디에 쓰는가입니다. 발표자가 이걸 만든 동기를 다시 밝힙니다.

제가 이거를 만든 이유는, 제가 뉴스레터 콘텐츠라든가 블로그 콘텐츠 같은 것들을 한번 영상화시켜 볼 수 있지 않을까 하는 동기에서 만들었다는 점을 말씀드리고 싶습니다. 여러분들도 사실 노트북LM에서 팟캐스트 음성 같은 걸 만드시잖아요. 그것을 어느 정도는 자동화할 수 있지 않을까 하는 취지에서 이렇게 영상을 만들었다고 봐 주시면 좋을 것 같습니다.

발표자 [20:19]

즉 1장에서 시작한 "노트북LM처럼 자동으로"라는 질문에, 영상 스스로 답을 하며 끝납니다. 유튜브에 올릴 완성품을 목표로 한 도구가 아니라, 이미 있는 글(뉴스레터·블로그)을 영상 형태로도 갖고 있기 위한 자동화 도구라는 것입니다.

부록 A낱말 정리

본문에서 이미 푼 것들을 한자리에 모았습니다.

낱말뜻나온 곳
클로드 코드터미널 안에서 돌아가는 AI 코딩 도구. 프로 플랜(월 20달러)부터 유료0장
서브 에이전트생각이 많이 필요하고 토큰을 많이 쓰는 일을 맡는, 클로드 코드 안의 별도 역할0장 · 2장 · 6장
스킬반복되는 절차, 토큰을 적게 쓰는 일을 맡는 클로드 코드 기능0장 · 2장 · 3장 · 6장
오케스트레이션메인 담당자가 나머지에게 일을 나눠주고 순서를 맞추는 것0장 · 2장
TTS글자를 목소리 소리로 바꾸는 기술3장
Whisper (위스퍼)소리를 듣고 글자로 옮기는 오픈AI의 음성 인식 AI3장
FFmpeg영상·소리를 코드로 합치고 자르는 무료 프로그램3장
API 키남의 서비스를 내 프로그램에서 불러 쓰게 해주는 인증 값. 비밀번호처럼 관리7장
.env 파일API 키 같은 비밀 값을 코드와 분리해 모아두는 파일7장
눈누상업적으로 써도 되는 한글 폰트를 모아 둔 사이트8장
파이프라인대본→그림→목소리→자막→편집으로 이어지는 작업 순서 전체9장
Veo 3구글의 영상 생성 AI. 하루 호출 횟수 제한이 있다고 발표자는 말함(미확인)10장

부록 B못 믿을 것

1. 왜 이 자막을 골랐나

이 영상은 한국어 영상이고, 유튜브에 ko-orig(한국어 원어) 자동자막이 있었습니다. 이걸 그대로 썼습니다.

다른 정리에서는 같은 영상에 있는 ko 자막이 ko-orig를 손봐서 줄인 판이라 쓰지 않는 경우가 많은데, 이 영상은 두 파일을 바이트 단위로 대조해 보니 완전히 같았습니다. 그러니 이번만큼은 어느 쪽을 받아도 결과가 같았습니다. 영상 길이 20:57 중 20:52까지 한국어 문장이 끊기지 않고 나왔습니다.

2. 깨진 고유명사

자동자막은 처음 듣는 이름을 소리 나는 대로 적습니다. 이 영상에서 확인한 것 전부입니다.

자막에 찍힌 것실제 (추정)확인 방법
윈지컬Whimsical (다이어그램 도구)확인 안 함. "독구"(도구)로 도표를 그렸다는 문맥과 발음이 그나마 가장 가깝습니다. 다른 후보를 찾지 못했습니다
독구도구명백한 표기 오류
나노바나나 프로Nano Banana Pro — 구글 이미지 생성 모델(gemini-3-pro-image-preview)의 별명저장소(quote-video-prompt)의 실제 모델명과 대조해 확인
이니init (초기화 명령)"이니셜라이즈"라는 발표자 본인의 설명과 문맥이 일치. 확정으로 봐도 무방
안티그라비티Antigravity (구글의 에이전트형 개발 도구)확인 안 함. 명칭 자체는 실재하는 제품이 맞으나, 자막의 설명이 발표자 본인 경험인지 남의 말 인용인지는 불분명
겟api"Get API Key" (구글 AI 스튜디오의 버튼 이름)문맥상 명백. 화면의 영어 버튼 이름을 소리 나는 대로 옮긴 것
aistudiogoogle.comaistudio.google.com명백한 표기 오류(마침표 누락)
FFMPGFFmpeg명백한 표기 오류
겟api 키라고 하는 곳"Get API Key" 메뉴문맥상 명백
스튜디오.com미확인정확한 사이트 이름을 특정하지 못했습니다. "오디오 보관함"이 있고 저작권이 해소된 BGM을 받을 수 있다는 설명만 자막에 남아 있습니다. 본문에서는 발표자가 부른 이름 그대로 인용부호를 붙여 적었습니다
배어 3 / 데오 3 / 배우 3Veo 3 (구글의 영상 생성 AI)"구글에서 제공하는 비디오 API", "제미나이 엔진에 탑재"라는 설명과 일치. 확정
관역"관역"이라는 자막 속 발음 그대로. 무엇의 오기인지 확정 못함발표자가 자막 오류의 예시로 직접 언급한 단어라, 원래 대본 단어를 되짚을 수 없습니다

3. 숫자에 붙는 딱지

4. 확정하지 못한 것