0%

영상 정리 · 1인기업

조회수 터지는 쇼츠 영상은 이렇게 만들어집니다

화면에 나오는 사람도, 목소리도 없이 만드는 지식·건축 쇼츠. 구글 Flow와 옴니 플래시로 영상을, 일레븐랩스로 나레이션을 만드는 전체 과정을 실제 화면으로 보여 주고, 마지막엔 이 과정 전체를 클로드 스킬 하나로 묶는 영상

원본 · 이 글의 근거
  • 채널 다움_나답게 일하는 삶
  • 12분 47초
  • 2026-08-22 공개
  • 조회 4,911회 · 좋아요 236 (2026-08-23 기준, 업로드 다음 날)
  • 영상 보기
목차 · 10개 장
  1. 0장먼저 알아야 할 것
  2. 1장사람 손을 안 댄 영상, 그리고 여섯 단계
  3. 2장남의 영상을 뜯어보고, 내 주제·대본을 뽑는다
  4. 3장내 목소리로 나레이션을 만든다
  5. 4장옴니 플래시로 신 하나하나를 채운다
  6. 5장캡컷으로 이어 붙이고 자막을 입힌다
  7. 6장이 순서 전체를 스킬 하나로 묶는다
  8.  무엇이 돈이 되는가
  9.  부록 A · 낱말 정리표
  10.  부록 B · 못 믿을 것

무엇을 근거로 썼는지

영상의 한국어 원어 자막 전체가 근거입니다. 30초 묶음 23개, 6,467자, 끝 시각 12분 20초(영상 길이 12분 47초의 거의 전 구간). 유튜브 원어 자막(ko-orig)과 손본 자막(ko)을 내려받아 비교해 보니 파일 크기가 완전히 같았습니다 — 이 영상은 축약된 다른 판이 따로 없고, ko-orig 그대로가 원어입니다.

이 영상은 논문이나 외부 글을 인용하지 않고, 발표자 본인이 실제로 쓰는 도구와 제작 과정만 보여 줍니다. 그래서 영상 속에서 실명이 나온 도구·모델(구글 Flow, 옴니 플래시, 클로드 비디오/와치 스킬, 일레븐랩스)만 따로 검색해 실재 여부와 설명을 대조했습니다 — 0장과 각 장의 확인 상자 참고.

발표자 본인의 실명은 자막으로 확정할 수 없습니다. 채널명 "다움_나답게 일하는 삶"으로만 표기했습니다 — 부록 B 참고.

0장먼저 알아야 할 것

이 영상은 낱말 세 개를 안다고 전제하고 말합니다. 하나씩 풀고 갑니다.

클로드 스킬 (Claude Skill)
클로드에게 "이 일을 할 땐 이 순서대로 해"라고 미리 적어서 저장해 두는 절차 묶음입니다. 요리 레시피를 한 장에 적어 서랍에 넣어 두면, 다음부터는 "그 요리 해 줘" 한마디로 레시피대로 다 해 주는 것과 같습니다. 이 영상에서는 두 번 나옵니다 — 다른 사람의 영상을 분석하는 "와치" 스킬(1장), 그리고 발표자가 이 영상 전체 과정을 담아 직접 만든 "AI 쇼츠" 스킬(6장)입니다.
구글 Flow와 옴니 플래시 (Gemini Omni Flash)
Flow는 구글이 만든 AI 영상 제작 작업 공간이고, 옴니 플래시는 그 안에서 고를 수 있는 영상 생성 모델 중 하나입니다. 텍스트·이미지·음성을 한꺼번에 이해해서 영상을 만들거나 고치는 모델로, 2026년 5월 구글 I/O에서 공개됐습니다. 즉 이 영상 제목의 "구글 Flow, Omni"는 서로 다른 두 제품이 아니라 작업 공간(Flow) 안에서 쓰는 모델(옴니 플래시) 관계입니다.
신 (scene)
영상 하나를 이루는 낱개 장면·조각을 뜻하는 영상 제작 용어입니다. 이 영상에서는 "신 1", "신 2"처럼 순서를 매기고, 신마다 4초·6초·8초·10초 중 하나의 길이로 따로 만든 다음 이어 붙여 전체 쇼츠를 완성합니다.

1장 · 0:00–2:02사람 손을 안 댄 영상, 그리고 여섯 단계

발표자는 첫마디부터 화면 속 영상을 가리키며 말합니다.

"지금 나오는 영상, 나레이션 모두 사람이 제작한 게 아닙니다. 구글 플로우에 옴니를 활용하면 내가 만들고 싶은 쇼츠를 바로 생성할 수 있습니다."

발표자 [00:00]

요즘 유튜브에 자주 보이는, 로마 콘크리트나 건물 구조 같은 지식·건축 쇼츠(짧은 지식을 그림과 나레이션으로 설명하는 영상 장르)를 예로 들며, 이걸 만드는 전 과정을 공개하겠다는 것이 이 영상의 선언입니다.

본격적인 설명에 들어가기 전에, 발표자는 전체 순서를 한 페이지로 요약합니다. ① 벤치마크 분석(따라 만들고 싶은 기존 영상을 클로드로 뜯어본다) ② 주제·신·나레이션 대본 설계(역시 클로드로) ③ 나레이션 생성(일레븐랩스) ④ 영상 프롬프트 생성(구글 Flow의 옴니 플래시) ⑤ 캡컷 편집(영상+나레이션+자막 합치기) ⑥ 스킬로 저장(이 순서 전체를 다음부터 자동으로). 발표자는 이 여섯 단계로 1~2분짜리 쇼츠 하나를 30분이면 만들 수 있다고 말합니다. 이 시간은 발표자 개인의 체감치이고, 별도로 측정된 값은 아닙니다.

2장 · 2:02–4:58남의 영상을 뜯어보고, 내 주제·대본을 뽑는다

벤치마킹 대상으로 발표자는 "신비한 건축 사전"이라는 채널의 지식·건축 쇼츠를 예로 듭니다. 이 영상을 분석하려면 먼저 클로드 코드(클로드를 터미널에서 직접 돌리는 방식)에 "와치"라는 스킬을 설치해야 합니다. 구글에 "클로드 비디오"라고 검색해서 나오는 깃허브(GitHub, 코드를 올려 두는 사이트) 링크에 들어가면, 이 스킬을 설치하는 명령어 두 줄(플러그인 마켓플레이스 등록, 플러그인 설치)이 있습니다. 이걸 그대로 복사해서 클로드 코드에 붙여넣고 엔터를 누르면 설치가 끝나고, /와치라고 쳤을 때 보라색 표시가 뜨면 잘 설치된 것입니다. [02:14]~[02:48]

"와치" 스킬은 실제로 있는 도구입니다

검색해 보면 유튜브 주소만 주면 화면과 소리를 함께 분석해 주는 이런 종류의 오픈소스 클로드 코드 플러그인이 여러 개 있습니다. 발표자가 검색한 말("클로드 비디오")과 가장 가깝게 맞는 것은 /watch 명령어를 쓰는 bradautomates/claude-video 저장소로 보이지만, 소리로만 받은 자막이라 정확히 어느 저장소인지는 확정할 수 없습니다. 영상에 없음 · 웹 검색으로 대조 — 부록 B 참고.

이 영상 주소를 와치에 넣고 "이 영상은 어떤 프로그램으로 만들었고 왜 이 유튜브가 인기 있는지, 이 쇼츠를 만들 수 있는 프롬프트 기획서를 디테일하게 만들어 줘"라고 요청하면, 10분쯤 뒤 상세한 기획서가 나옵니다. 여기엔 인기 요인 아홉 가지와 함께, 발표자가 특히 강조하는 원칙이 하나 있습니다.

"짧고 일상어가 아니고 따라 하기 쉬운 문구를 매 영상 같은 자리에 박아야 팬텀 각인이 된다. 최소 30편은 우직하게 반복해야 형성됩니다."

클로드가 만든 기획서 (발표자가 화면을 읽어 줌) [03:56]

즉 인기 채널이 매번 같은 자리에 같은 시그니처 문구를 반복해서 넣는 것이, 재미가 아니라 기억되기 위한 설계라는 분석입니다. 그리고 이건 한두 편으로는 안 되고 30편 이상 반복해야 효과가 난다는 단서가 붙습니다.

이 기획서를 바탕으로 "1~2분 쇼츠를 만들 거야. 건축 관련(또는 원하는 소재) 주제 열 가지를 추천해 줘"라고 요청하면 주제 10개가 나옵니다. 발표자는 그중 "로마 콘크리트 자가치유"는 이미 만들어 본 예시로, "아파트 경량 칸막이"는 새 예시로 들어 "3번으로 1분 대본 만들어 줘"라고 요청해 대본을 완성합니다. [04:29]

3장 · 4:58–6:21내 목소리로 나레이션을 만든다

완성된 대본을 그대로 복사해서, 텍스트를 음성으로 바꿔 주는 사이트에 붙여넣고 생성 버튼만 누르면 나레이션(TTS, 글자를 소리로 바꾸는 것)이 끝납니다. 발표자가 쓰는 사이트는 일레븐랩스(ElevenLabs)라는 곳입니다 — 자막에는 "일 랩스", "11 랩스" 등으로 여러 번 다르게 찍혀 있지만 같은 서비스를 가리킵니다. 발표자는 이 사이트를 구독해서 쓰는 이유로, 자기 목소리를 등록해 그 목소리 그대로 나레이션을 뽑을 수 있다는 점을 듭니다. [05:02]

무료 버전으로 계속 올리면 저작권 문제가 됩니다

발표자는 반드시 스타터 요금제 이상으로 올려야 음성·음악의 상업 라이선스를 얻는다고 강조합니다. 상업 라이선스 없이 무료 버전으로 쇼츠를 계속 올리면 저작권 위반이 될 수 있다는 것입니다 [06:09]. 직접 확인해 보니 일레븐랩스의 실제 스타터 요금제(월 5달러)는 상업 라이선스와 목소리 즉시 복제(인스턴트 보이스 클로닝) 기능을 포함합니다 — 발표자의 설명과 일치합니다.

4장 · 6:21–8:47옴니 플래시로 신 하나하나를 채운다

나레이션이 완성되면 그 길이(예: "1분 12초")를 클로드에게 알려주고, "구글 플로우 플러스 옴니 플래시를 활용해 쇼츠 영상을 제작할 거야. 각 신은 4, 6, 8, 10초로 구성해서 만들어 줘"라고 요청합니다. 왜 하필 저 네 가지 초 단위인지도 이유가 있습니다.

"구글 플로우는 4초, 6초, 8초, 10초 이 네 가지만 선택이 가능하기 때문에 그렇게 프롬프트를 입력한 거고요."

발표자 [07:16]

즉 발표자가 임의로 정한 값이 아니라, 구글 Flow 화면에서 고를 수 있는 영상 길이가 이 네 가지뿐이라서 클로드에게도 같은 단위로 프롬프트를 짜 달라고 시킨 것입니다. 여기에 더해 쇼츠이므로 화면 비율은 9:16(세로), 모델은 옴니 플래시로 지정합니다. 클로드가 신마다 프롬프트를 만들어 주면(예: "신 1은 4초로 이런 프롬프트", "신 2는 10초로 이런 프롬프트") 그걸 그대로 복사해 구글 Flow에 붙여넣고, 같은 길이를 체크한 다음 엔터를 누르면 영상 클립 하나가 생성됩니다. [06:44]~[07:50]

마음에 안 드는 신이 있으면 처음부터 다시 만들 필요 없이, "신 11번째 영상이 마음에 들지 않아, (원하는 느낌)으로 다시 프롬프트 기획해 줘"라고 클로드에게 요청해 그 신의 프롬프트만 다듬어 재생성할 수 있습니다. [08:25] 이렇게 완성된 클립은 화면에서 드래그해서 다운로드합니다.

5장 · 8:47–11:34캡컷으로 이어 붙이고 자막을 입힌다

발표자는 여러 영상 편집 프로그램 중 캡컷(CapCut)을 쓰는 이유로 "가장 쉽고 구독료가 생각보다 저렴하기 때문"이라고 말합니다 [08:59]. 새 프로젝트를 만들고, 앞서 만든 영상 클립 11개를 순서대로 드래그해 넣고, 나레이션(TTS) 파일도 그 아래 트랙에 드래그해 넣습니다.

자막도 캡컷 안에서 바로 만들 수 있습니다. TTS 트랙을 클릭하고 상단의 텍스트 메뉴에서 자동 캡션을 고른 뒤 소스 언어를 한국어로 선택해 생성을 누르면 자막이 자동으로 만들어집니다. 이후 글꼴과 글자 크기를 원하는 스타일로 바꿉니다. [09:31]

마지막으로 확인할 것은 영상 길이와 나레이션 길이를 정확히 맞추는 일입니다. 각 클립의 길이를 미세하게 늘리거나 줄여서, 나레이션이 끝나는 시점과 영상의 끝맺음이 어긋나지 않게 맞춰 줍니다. [10:06] 이렇게 완성된 결과물로, 발표자는 로마 콘크리트 자가치유를 다룬 완성본을 재생해 보여 줍니다 — 로마 콘크리트를 깨면 나오는 흰 알갱이가, 금이 가고 빗물이 스며들면 다시 굳어서 갈라진 자리를 스스로 메운다는 내용입니다. [10:39]

6장 · 11:34–끝이 순서 전체를 스킬 하나로 묶는다

여기까지의 과정(벤치마킹 → 주제·대본 → 나레이션 → 영상 → 편집)이 끝나면, 발표자는 이 전체를 매번 손으로 반복하지 말라고 말합니다.

"그러면 이 과정을 계속 똑같이 반복을 해야 되냐? 그렇지 않습니다. 클로드에는 스킬이라는 기술이 있는데, 이 스킬을 활용해서 지금까지 했던 모든 워크플로우를 나만의 스킬로 만든 다음에 추후에는 그 스킬을 꺼내 가지고 사용만 하시면 됩니다."

발표자 [11:11]

클로드에게 "지금까지 한 모든 작업을 정리해서 스킬로 만들고, 스킬을 실행시키면 어떻게 진행하면 되는지 설명해 줘"라고 요청하면, 지금까지 한 작업 순서를 클로드가 기억해서 재사용 가능한 스킬로 만들어 줍니다. 발표자는 이걸 "AI 쇼츠"라는 이름으로 만들었고, 실행하면 "이번 AI 쇼츠 작업은 어느 단계부터 시작할까요?"라고 먼저 물어봅니다. 예를 들어 "소재 선정부터"를 고르면, 새 소재 후보를 뽑는 것부터 대본을 새로 쓰는 것까지 지금까지 배운 순서대로 차근차근 진행됩니다. [11:46]

영상은 "1회성으로 영상을 만들고 또 새롭게 만들지 말고, 꼭 나만의 스킬을 만들어 쓰라"는 당부로 마무리됩니다. 발표자는 오늘 쓴 프롬프트 전체를 자신의 오픈채팅방("단톡방")에 올려 뒀다고 밝히지만, 이 채팅방 내용은 영상 밖의 것이라 이 정리에는 포함돼 있지 않습니다. 처음엔 발표자의 프롬프트를 그대로 써 보고, 익숙해지면 주제만 바꿔 응용하라는 것이 마지막 조언입니다. [12:20]

무엇이 돈이 되는가

이 영상은 제작 과정만 다룹니다. 완성한 쇼츠가 실제로 조회수가 얼마나 나왔고, 그게 얼마의 수익으로 이어졌는지는 영상 안에 없습니다. 제목의 "조회수 터지는"은 벤치마킹한 남의 채널이 인기 있다는 뜻이지, 발표자가 이 방법으로 만든 결과물이 똑같이 성공했다는 증거는 아닙니다 — 이 구분을 놓치면 방법론과 결과를 혼동하게 됩니다.

그럼에도 이 영상이 실제로 보여 준 것에서 돈이 되는 지점 두 가지는 짚을 수 있습니다. 첫째, 설명글이 "얼굴이나 목소리를 공개하지 않고 영상을 제작하고 싶은 분"을 대상으로 명시하듯, 진입 장벽이 낮다는 점입니다. 카메라도, 목소리도, 편집 실력도 없이 프롬프트만으로 쇼츠 한 편이 나온다는 것을 이 영상은 실제 화면으로 증명합니다. 둘째, 마지막 6장의 "스킬로 저장"이 핵심입니다. 30분짜리 1회성 작업을 반복 가능한 절차로 바꾸는 것이 곧 생산 속도를 올리는 일이고, 한 사람이 여러 소재·여러 채널을 동시에 굴릴 수 있게 되는 지점이 여기입니다. 도구가 쌀수록 남는 병목은 "무엇을 만들지 고르는 일"로 옮겨간다는 것은, 이 폴더의 다른 정리(2026-08-12 정리)에서도 같은 방향으로 확인된 관찰입니다. 이건 제 생각입니다.

다만 설명글에는 "무료 프롬프트 가이드 북"을 준다는 카카오톡 오픈채팅 링크가 걸려 있습니다. 영상 본문에서 직접적인 상품 판매 언급은 없지만, 결국 이 영상도 더 깊은 내용(오늘 쓴 프롬프트 전문)은 영상 밖 커뮤니티로 이어진다는 구조입니다. 지식·건축 쇼츠 자체가 돈이 되는 경로(유튜브 쇼츠 수익 프로그램, 조회수 보너스 등)를 이 영상이 직접 설명하지는 않는다는 점도 함께 적어 둡니다.

부록 A · 낱말 정리표

낱말뜻나온 곳
클로드 스킬클로드에게 미리 저장해 두는, 반복 실행 가능한 작업 절차 묶음0장, 1장, 6장
구글 Flow구글의 AI 영상 제작 작업 공간0장, 4장
옴니 플래시(Gemini Omni Flash)Flow 안에서 고르는 영상 생성 모델. 2026년 5월 공개0장, 4장
신(scene)영상을 이루는 낱개 조각. 이 영상에선 4/6/8/10초 단위로 나눔0장, 4장
와치(Watch)유튜브 주소를 넣으면 화면·소리를 함께 분석해 주는 클로드 코드 스킬2장
일레븐랩스(ElevenLabs)글을 목소리로 바꿔 주는 사이트. 자기 목소리 등록(클로닝) 가능3장
캡컷(CapCut)영상·나레이션·자막을 합치는 편집 프로그램5장

부록 B · 못 믿을 것

1. 왜 이 자막을 골랐나

이 영상은 한국어가 원어이고, 유튜브 원어 자막(ko-orig)과 손본 자막(ko)의 파일 크기를 비교한 결과 완전히 동일했습니다. 즉 별도로 축약된 판이 없어 ko-orig를 그대로 쓰는 것이 원어를 그대로 쓰는 것과 같습니다. 자막은 23묶음, 6,467자로 영상 길이(12분 47초)의 거의 전 구간(12분 20초 시작 지점까지)을 덮습니다.

2. 숫자의 출처

3. 깨진 고유명사

자막에 찍힌 것실제 / 확인 방법
"일 랩스", "일дийн랩스", "11 랩스"일레븐랩스(ElevenLabs)로 확인됩니다. 앞뒤 문맥(글을 음성으로 바꾸는 사이트, 요금제 이름 "스타터")이 일치합니다.
"기터브"깃허브(GitHub)의 발음이 잘못 받아 적힌 것으로 보입니다.
"카페 14 단정의 느낌"무료 한글 글꼴을 배포하는 카페24의 "단정체"로 추정되나, 화면을 직접 보지 못해 확정할 수 없습니다.
"신비한 건축 사전"발표자가 벤치마킹했다고 밝힌 유튜브 채널명입니다. 자막에 찍힌 표기 그대로 옮겼고, 채널 자체를 별도로 찾아 대조하지는 않았습니다.

4. 확정 못 한 것