영상 정리 · AI·개발
로봇 없이, 유료 하드웨어 없이, 컴퓨터 한 대와 무료 도구만으로 로봇 팔에게 물건 옮기는 법을 학습시키는 실습 영상. 오픈AI의 2018년 로봇 손 연구부터 강화학습의 기초, 시뮬레이터의 함정, 코랩 실습, 피지컬 AI 사업 기회까지 이어진다
영상의 한국어 원어 자막 전체가 근거입니다. 30초 묶음 50개, 약 3만 자, 끝 시각 27분 31초(영상 길이 27분 38초). 이 영상은 원어가 한국어라 원어 자막(ko-orig)을 그대로 썼습니다. 유튜브가 별도로 제공하는 ko 트랙과 대조해 보니 글자 하나까지 완전히 같은 파일이었습니다 — 자동 생성 자막을 그대로 복사해 둔 것으로 보입니다.
영상이 언급하는 오픈AI의 2018년 로봇 손 연구, Gymnasium(옛 OpenAI Gym), PPO 알고리즘 원 논문을 직접 찾아 대조했습니다. 영상에 없는 내용은 "영상에 없음"이라고 표시했습니다.
해설자는 자기 이름을 "제이"라고만 밝힙니다. 성이나 풀네임은 자막으로 확정할 수 없습니다 — 부록 B 참고.
이 영상은 낱말 여섯 개를 안다고 전제하고 말합니다. 하나씩 풀고 갑니다.
영상은 선언으로 시작합니다.
"저는 지금부터 피지컬 AI의 두뇌를 만드는 1인 기업을 만들 겁니다. 그리고 그 과정을 여러분들에게 모두 공유하도록 하겠습니다. 이 과정을 통해서 여러분은 피지컬 AI의 학습 방법인 강화학습의 기초부터 시뮬레이션, 그리고 사업으로의 확장, 수익 창출까지 이 모든 것을 자연스럽게 배우실 수 있을 겁니다."
제이 (CONNECT AI LAB) [00:00]
이 영상 하나를 다 들으면 로봇 팔을 움직이는 인공지능 두뇌를 직접 만들어 볼 수 있다고 말합니다. 조건은 하나입니다. 하드웨어(실제 로봇)는 필요 없고, 컴퓨터 한 대만 있으면 됩니다. [00:00]
해설자는 자신을 "커넥트 AI랩(CONNECT AI LAB)의 AI 멘토 제이"라고 소개합니다. [00:35]
영상이 가장 먼저 꺼내는 것은 2018년 연구입니다.
"가장 먼저 우리가 봐야 될 건 요겁니다. 2018년도에 나온 연구인데, 여러분들이 알고 있는 챗GPT를 만든 오픈AI가 사실은 이 로봇, 피지컬 AI의 두뇌를 만드는 그런 연구를 아주 깊게 했습니다."
제이 [00:53]
이 연구는 오픈AI가 2018년 7월 30일에 공개한 "Learning Dexterity"(별명 Dactyl)입니다. 사람 손처럼 다섯 손가락이 달린 섀도 덱스터러스 핸드(Shadow Dexterous Hand)라는 로봇 손을 썼고, 관절 자유도가 24개였습니다. 훈련은 전부 시뮬레이터 안에서만 이뤄졌고, 그렇게 학습한 정책을 실제 로봇 손에 그대로 옮겨도 작동했습니다. 영상에 없음 — 영상은 뒤에서 이걸 "로봇 암"이라 부르지만(3장), 원문 기준으로는 팔이 아니라 손 하나를 다루는 연구입니다. 참고: Learning dexterity (OpenAI), Learning Dexterous In-Hand Manipulation (arXiv:1808.00177)
피지컬 AI, 특히 로봇의 학습 방법 중 가장 핵심이 강화학습이라고 설명합니다.
"강화학습이라고 하는 거는 시뮬레이션이라는 가상의 세상을 만들어 놓고, 그 세상에서 여러 개의 인공지능 에이전트들을 넣어서 실험도 하고 경험도 하고, 그 경험을 통해서 데이터를 쌓고 그것으로 학습을 하는 방법입니다."
제이 [01:08]
해설자는 강화학습이 자신의 전공이며, 이 방법만으로 논문 두 편을 썼다고 밝힙니다. 그가 처음 인공지능을 공부한 것은 2012년인데, 그때는 학습 방법이 아직 정착되지 않아 교과서도 거의 없었고 가르쳐 줄 사람도 없어 혼자 고생했다고 말합니다. [01:42]
"지금 이렇게 피지컬 AI 시대가 왔고 산업이 엄청나게 커지고 있고 돈이 막 들어오고 있는데, 여기에 참여자는 별로 없단 말이에요. 그래서 아, 내가 그렇게 고생을 했었던 게 바로 여러분들에게 이런 걸 교육하기 위함이었구나라는 생각이 듭니다."
제이 [01:42]
그리고 겉핥기로 배우면 안 되고 뿌리부터 흐름을 알아야 지금의 강화학습과 피지컬 AI를 쉽게 이해할 수 있다며, 그 뿌리로 다시 앞서 본 오픈AI의 로봇 손 연구로 돌아갑니다. [02:17]
2018년 연구 화면을 자세히 설명합니다. 로봇 손 주위에 여러 대의 카메라가 있고, 손안에 큐브가 하나 있습니다. 화면 오른쪽에는 목표(골)로 삼을 큐브 모양이 나와 있고, 로봇 손이 손가락 관절을 움직여 지금 쥔 큐브를 그 목표 모양과 똑같이 맞추는 것이 과제입니다. [02:50]
해설자는 실제로 뉴립스(NeurIPS, AI 학회) 현장에서 이 연구를 직접 봤다고 말합니다.
"손가락에 관절이 하나 둘 셋 넷 다섯, 굉장히 많은 관절들이 있어서 우리가 이렇게 손 까딱까딱 하는 거, 뭐를 풀고 잡고 하는 거. 아직까지도 가장 어려운 과제가 뭐냐면 로봇이 수건을 잡고 물병을 잡고 무언가를 접고 이렇게 하는 걸 가장 어려워합니다."
제이 [03:22]
사람 손은 이걸로 키보드도 치고 머리도 만지는데, 그만큼 손은 로봇에게 아주 어려운 과제라는 것입니다. [03:56]
그다음 해설자는 화면 속 시뮬레이터의 색깔이 계속 바뀌는 이유를 짚습니다.
"강화학습이라고 하는 거는 학습을 할 때 완전히 똑같은 상황에서만 학습을 해 버리면은, 이게 거기서 조금만 환경이 벗어나도 완전히 다른 걸로 인식을 합니다."
제이 [03:56]
오픈AI 원문은 이 색깔 변화의 정체를 도메인 랜덤화(domain randomization)라고 부릅니다. 마찰 계수나 물체 표면처럼 물리적 특성을 시뮬레이터마다 무작위로 바꿔 가며 훈련시키는 방법입니다. 한 가지 환경에만 익숙해지면 조금만 달라져도 못 알아보는 문제(영상이 4장에서 설명하는 문제, 그리고 5장의 슈퍼마리오 비유)를 미리 막기 위한 장치입니다. 영상에 없음 — 용어 자체는 영상에 나오지 않지만, 영상이 설명하는 원리는 정확히 이것입니다.
해설자는 2018년 9월 3일 자신이 발표했던 강화학습 튜토리얼을 예로 듭니다. 그때 슈퍼마리오를 강화학습으로 학습시켰는데, 1탄을 잘 깨는 에이전트를 만드는 데는 성공했습니다 — 점프도 잘하고, 적이 나타나면 피하고, 불꽃도 쏘았습니다. [04:30]
"1탄과 2탄의 큰 차이점은 낮과 밤입니다. 1탄에서 잘하는 인공지능 에이전트를 만들어도 2탄에 가면 완전히 못 해요. 완전히 그냥 똥멍청이가 되어 버립니다."
제이 [05:04]
여기서 해설자는 이 영상 전체를 관통하는 핵심 문장을 말합니다.
"피지컬 AI 두뇌에서 가장 중요한 점은 다양한 형태, 다양한 환경, 다양한 상황들을 주면서 얘가 그 상황에서도 잘할 수 있도록 만드는 게, 피지컬 AI 두뇌의 가장 큰, 엄청나게 중요한 부분입니다."
제이 [05:04]
그래서 시뮬레이터 안에 여러 에이전트를 두고 다양한 상황을 학습시킨 뒤, 그 결과의 평균치를 실제 하드웨어에 넣는다고 설명합니다. 그리고 이 과정에서 발생하는 문제가 여러 개 있다며, 첫 번째로 "시뮬레이터를, 가상 환경을 얼마나 실제처럼 잘 만들 수 있느냐"를 꼽습니다. [05:37]
문제의 두 번째는 어떤 학습 방법을 쓸 것인가입니다. 강화학습 안에서도 갈래가 여럿인데, 영상은 두 가지를 짚습니다.
"DQN이라는 것과 PPO라고, 이 두 개로 나눠져 있는데, DQN은 디스크리트 액션이라고 해서, 예를 들면 슈퍼마리오처럼 점프, 불꽃을 쏜다, 앞으로 간다, 뒤로 간다, 이렇게 명확하게 행동이 있는 것들에서 사용하는 알고리즘이고, PPO라는 건 확률적으로 접근을 하는 건데 이런 로봇처럼 여러 개의 근육이 한 번에 움직일 때 PPO를 씁니다."
제이 [06:11]
정리하면 DQN은 "점프한다/안 한다"처럼 선택지가 딱 정해진 행동에 쓰고, PPO는 로봇 관절처럼 힘의 세기를 이어진 범위 안에서 정해야 하는 행동에 씁니다.
오픈AI 원문에 따르면 2장에서 본 로봇 손(Dactyl)은 오픈AI Five(도타2를 학습시킨 AI)와 같은 범용 강화학습 알고리즘과 코드를 그대로 썼습니다. 오픈AI Five가 쓴 알고리즘이 바로 PPO입니다. 즉 영상이 6장에서 "관절 많은 로봇에는 PPO"라고 말한 규칙이, 2장에서 본 실제 로봇 손 연구에도 그대로 적용된다는 뜻입니다. 영상에 없음 — 영상은 이 연결을 직접 말하지 않습니다.
문제의 세 번째는 시뮬레이터에서 아무리 잘 학습해도 실제 로봇에 넣으면 잘 안 되는 경우입니다. 시뮬레이터가 아무리 정교해도 실제 로봇과는 다르기 때문입니다(이 영상 0장에서 설명한 시뮬레이션-투-리얼 갭입니다). [06:45]
세 가지를 정리하면 이렇습니다.
"이걸 얼마나 잘하느냐, 이 자체가 성공을 좌지우지할 정도로 굉장히 중요한 겁니다."
제이 [07:20]
해설자는 청소하기, 사람과 손잡고 횡단보도 건너기, 강아지 산책시키기 같은 과제가 이때(2018년)도 큰 목표였다며, 앞으로 3~4년 안에 피지컬 AI·로봇 분야가 크게 발전할 것이고, 지금 참여자가 적기 때문에 지금 뛰어드는 사람이 높은 성공 확률을 가질 것이라고 전망합니다. [07:54]
해설자는 스스로 질문을 던집니다. "이걸 왜 혼자만 알지 않고 알려 주나요?"
"이런 공부를 여러분들에게 알려 드리고, 여러분들이 이 기회를 찾아서 뭐 회사를 만들건 아니면 수익 창출을 하건, 이 과정을 통해서 굉장히 많은 아이디어가 생길 거고 수익화 방법들이 생겨나게 될 텐데, 이 방법을 통해서 여러분들이 공부하고 사업화하고 돈도 벌고, 또 돈뿐만 아니라 꿈과 희망을 찾고 삶을 더 잘 사는 이 과정을 보는 것 자체가 제가 피지컬 AI로 성공하는 것보다 더 행복하고 더 의미가 있기 때문에 이걸 하는 겁니다."
제이 [08:28]
그리고 오늘 다룰 범위를 정리합니다. 앞서 나온 성공의 세 가지 조건 — 시뮬레이터, 학습 방법, 갭 줄이기 — 중에서 세 번째(갭 줄이기)는 실제 하드웨어가 있어야 해 볼 수 있으므로, 오늘은 첫 번째와 두 번째만 다룬다고 밝힙니다. [09:02]
오픈AI가 강화학습에 진심이었던 회사였다는 것을 보여주는 도구가 나옵니다. 오픈AI가 만든 시뮬레이터 모음입니다.
"원래는 오픈AI 짐(Gym)이라고 했습니다. 여기 깃허브가 있어서 코드들이 쭉 있는데, 짐에서 2021년부터 짐나지움(Gymnasium)이라는 걸로 바뀌었습니다."
제이 [09:34]
OpenAI Gym은 2021년 초 Farama Foundation이라는 비영리 단체로 유지·보수가 넘어갔고, 이때 이름이 Gymnasium으로 바뀌었습니다. 오픈AI는 그 이후 Gym을 더 이상 관리하지 않습니다. 영상이 말한 "2021년"은 이 사실과 일치합니다. 참고: Farama-Foundation/Gymnasium (GitHub)
짐나지움은 환경(environment)을 제공합니다. AI 에이전트가 학습할 수 있는 가상의 놀이터 같은 것으로, 클래식 컨트롤·박스2D·토이 텍스트·무조코(MuJoCo)·아타리 등 여러 갈래가 있습니다. 오늘은 그중 무조코를 씁니다. [10:08]
무조코 안에는 개미, 치타, 호퍼, 휴머노이드 같은 여러 캐릭터 환경이 있는데, 오늘은 2장에서 본 로봇 팔과 가장 비슷한 "푸셔(Pusher)" 환경을 다룹니다. [10:41]
이 환경을 이해하는 데 필요한 두 낱말이 나옵니다.
해설자는 이 모든 걸 다 알려면 10년 이상 강화학습을 공부해야 하니, 중요한 것만 뽑아서 바로 실습해 보자고 제안합니다. [11:50]
실습이 시작됩니다. 짐나지움을 불러와서 Pusher-v5 환경을 만드는 코드를 오른쪽 버튼으로 복사합니다. [12:25]
이 코드를 어디서 돌릴지가 문제인데, 해설자는 좋은 컴퓨터가 없어도 되는 방법을 제시합니다.
"구글의 코랩으로 들어가면, 구글이 빌려주는 컴퓨터를 우리가 사용해 볼 수가 있습니다. 여기서 연결 오른쪽 아래 있는 걸 누르면 런타임 유형 변경이라고 있고, 여기에 GPU를 사용할 수 있어요."
제이 [12:59]
코랩(Google Colab)에 복사한 코드를 붙여넣고, AI에게 이렇게 지시합니다 — "환경은 Pusher-v5, 행동은 익스플로레이션(탐험), 에피소드 50회로 학습해 줘." 여기서 익스플로레이션(탐험)이란, 시뮬레이터가 처음부터 잘 되지 않기 때문에 이렇게도 해 보고 저렇게도 해 보면서 경험을 쌓는 과정을 말합니다. [14:03]
실행하니 No module named mujoco라는 오류가 났습니다. 필요한 패키지가 설치되어 있지 않았던 것입니다. AI가 스스로 원인을 찾아 pip install gymnasium[mujoco]로 무조코를 설치하라고 코드를 고쳐 줍니다. 다시 실행하니 "50회의 에피소드 탐색이 완료되었습니다"라는 결과가 나왔지만, 학습이 실제로 어떻게 되었는지는 눈에 보이지 않았습니다. [14:57]
그래서 "시뮬레이션 시각화를 추가해 달라"고 요청합니다. 코랩은 별도의 시각화 창을 띄울 수 없어서, 50번 학습한 과정을 녹화한 영상으로 보여줍니다. 결과는 좋지 않았습니다.
"봅봅 돌면서 이 목표 자체를, 얘를 여기다가 놓는 걸 이제 학습을 해야 되는데 전혀 하지 못하고 있습니다."
제이 [15:45]
여기서 해설자는 PPO(Proximal Policy Optimization) 알고리즘을 적용해 보자고 제안합니다.
"이 PPO라는 논문인데, 인간을 휘온드는(능가하는) 오픈AI가 만든 그 PPO라고 불리는 알고리즘이에요. 어려워 보이는 수식들이 있지만 별건 아닙니다. 관절뿐만 아니라 여러 개의 근육들이 한 번에 움직이거든요. 이렇게 액션들의 스페이스가 많은 것들을 할 때 쓰는 방법입니다."
제이 [15:45]
PPO의 원 논문은 "Proximal Policy Optimization Algorithms"(Schulman 외, 오픈AI, 2017)입니다. 기존 방법(TRPO)만큼 성능이 좋으면서도 구현이 훨씬 간단하다는 것이 이 논문의 핵심 주장입니다. 로봇 시뮬레이션과 아타리 게임 양쪽에서 실험했습니다. 영상에 없음 — 발표 연도와 저자는 영상에 나오지 않습니다.
AI에게 "PPO 방법을 사용해서 재학습해서 조금 더 잘 만들어 보자"고 지시하니, 코드가 pip install stable-baselines3를 실행합니다. 이건 누군가 이미 PPO 알고리즘을 구현해서 올려 둔 파이썬 도구로, 이걸 설치해서 바로 가져다 쓰는 것입니다. [16:52]
코드는 Pusher-v5 환경에 PPO 모델을 만들고, 10만 번(timesteps) 행동을 반복하며 학습하도록 짜여 있었습니다. 학습이 끝나면 모델을 압축해 저장하고, 그 모델을 다시 로봇 팔 환경에 불러와 실제로 잘 되는지 테스트합니다. [17:28]
실행 시간이 오래 걸렸습니다. 해설자는 이 환경이 작아서 GPU가 크게 필요하지 않고 대부분 CPU를 쓰는데, 코랩이 무료로 빌려주는 컴퓨터라 속도가 느린 것 같다고 짐작합니다. [18:37]
코랩이 계속 학습하는 동안, 해설자는 다른 방법을 하나 더 보여줍니다. 구글 안티그래비티(Google Antigravity)입니다.
"구글의 안티그래비티 자체는 바이브 코딩 툴인데, 여기에서 이 코드를 싹 가지고 와서 구글이 아닌 내 컴퓨터에서 학습을 시키고 환경도 만들고, 웹서비스처럼 만들어서 정말 멋있게 시각화할 수 있습니다."
제이 [19:11]
안티그래비티는 구글이 2025년 말 출시한 AI 코딩 도구(IDE)로, 자연어로 지시하면 AI 에이전트가 직접 코드를 짜고 실행하고 결과를 보여주는 방식으로 동작합니다. 학습 코드를 붙여넣고 "학습 과정을 시각화하고, 모델을 저장·압축하고, 특징을 최대화해서 과정을 모두 볼 수 있게 해 줘"라고 지시하자, 웹사이트 형태의 학습 상황판을 만들어 줍니다. [19:44]
상황판에는 5,000/2,000/500 에피소드 중 고를 수 있는 옵션이 있습니다. 500번은 약 12초, 2,000번은 약 45초, 5,000번은 약 1분 8초가 걸린다고 표시됩니다. 해설자는 5,000번을 선택해 학습을 시작합니다. [20:52]
학습 목표는 흰색 물체를 빨간색 위치까지 옮기는 것입니다. 로봇 팔이 이 동작을 여러 번 반복하면서, 목표까지의 거리가 0에 가까워지도록 일곱 개 관절의 모터값(액션 스페이스)을 찾아갑니다. [21:26]
화면에는 에피소드 누적 보상 곡선이 함께 뜨는데, 학습이 진행될수록 조금씩 높아지는 것이 보입니다. 해설자는 강화학습에서 보상 설정이 왜 중요한지를 이렇게 풀어 설명합니다.
"흰색의 목표물이 빨간색에 가깝게 가면 갈수록 보상을 더 많이 줄 겁니다. 로봇 팔이 여러 개를 이렇게 해보면서, 지금 빨간색에 가장 가깝게 오브젝트를 놓을 때마다 칭찬을 받는 거죠. '아, 너 잘했어, 더 가깝게 놔봐' 이렇게 하니까, '아, 이 근처에다 놓게 되면 내가 칭찬을 받는구나, 더 잘해야지' 그러면서 보상 자체를 점점 늘리는 행동들을 학습하고 선택을 하게 됩니다."
제이 [22:35]
중간중간 저장된 "학습 성장 마일스톤" 영상을 보면 변화가 뚜렷합니다. 학습하지 않았을 때는 로봇 팔이 아예 움직이지 않다가, 50번 정도 학습하면 팔을 조금씩 움직이고, 조금 더 지나면 물체를 살짝 밀어 보고, 그다음엔 잡으려고 시도하고, 더 지나면 목표에 더 가깝게 밀게 됩니다. [23:08]
"로봇 팔이 한 번도 움직이지 못하는 상태였었는데, 조금조금씩 팔도 꼬물꼬물하면서 배우다가, 이제는 한 1분 정도 2분 정도 학습을 하니까 얘가 이제 살짝 옮길 수 있게 되었네, 빨간색으로 조금 더 가까이 갈 수 있게 되었네."
제이 [23:40]
완전히 잘하려면 몇 시간은 더 학습해야 한다며, 교육용으로는 이 정도까지만 보여주고 다음으로 넘어갑니다. [23:40]
학습된 PPO 모델을 저장하면 압축된 모델 파일(폴리시)이 나오고, 이 파일을 다운로드해서 실제 로봇에 넣을 수 있다고 설명합니다. 또는 허깅페이스(Hugging Face) — AI 모델을 모아 두는 커뮤니티 — 에 "강화학습(Reinforcement Learning)" 태스크로 분류해서 이 모델을 업로드할 수도 있습니다. [24:14]
해설자는 코랩이 10만 번 학습을 여전히 돌리고 있다며, 직접 따라 할 사람은 10만 대신 1 정도의 작은 숫자로 바꿔서 실행하면 훨씬 빠르게 테스트해 볼 수 있다고 조언합니다. 컴퓨터에 여유가 있다면 앞서 보여준 안티그래비티 방식을 쓰라고도 덧붙입니다. [24:46]
영상은 오늘 다룬 범위를 정리합니다 — 오픈AI의 2018년 연구부터 시뮬레이터·강화학습 기초, 그리고 시뮬레이터에서 실제로 학습해 보는 것까지 전부 해 봤다고 요약합니다. 그리고 피지컬 AI 산업은 계속 커지는 중이고 참여자는 여전히 적다고 다시 강조합니다. [25:18]
마지막으로 사업 기회를 구체적으로 나열합니다.
"이 과정에서 인공지능 두뇌만 하더라도 되게 많은 사업들이 있습니다. 데이터 사업도 있고요, 그리고 에이전트가 로봇 팔뿐만 아니라 휴머노이드도 있을 거고, 청소하는 것도 있을 거고, 자동차도 있을 거고, 굉장히 여러 가지로 나눠지게 되는데, 여기서 특화된 인공지능 모델을 만드는 것도 있고, 특화된 데이터셋을 만드는 것도 있고, 사람이 휴머노이드를 구입했는데 내 집에 맞게, 내 성향에 맞게 커스터마이즈 하는 일도 필요하게 될 겁니다."
제이 [25:52]~[26:26]
즉 이 영상이 직접 짚는 돈이 되는 지점은 네 갈래입니다. ① 로봇 학습에 쓸 데이터를 만들어 파는 사업, ② 특정 작업(청소·자동차 등)에 특화된 AI 모델을 만드는 사업, ③ 특정 용도에 맞춘 학습 데이터셋을 만드는 사업, ④ 이미 팔린 로봇·휴머노이드를 구매자의 환경에 맞게 재학습·커스터마이즈해 주는 서비스업입니다. 오늘 실습한 "시뮬레이터에서 로봇 팔을 학습시키는 것" 자체가 이 네 갈래 전부의 밑바탕 기술이라는 것이 영상의 논리입니다.
"제가 여러분들에게 이걸 알려 드려도 전혀 손해 될 게 없습니다. 같이 성장하면 되고, 그 과정을 모두 공유할 거고, 여러분들이 성장하면 저 또한 즐겁게 더 열심히 일하고 교육할 수 있으니까요."
제이 [26:26]
영상은 "지식과 경험은 다 드릴 테니, 여러분이 그걸 잡아서 여러분의 것으로 만들라"는 당부로 끝납니다. [26:59]
영상이 언급한 세 원 출처 — 오픈AI 로봇 손 연구, Gymnasium, PPO 논문 — 를 직접 찾아본 결과, 영상이 말하지 않은 내용이 몇 가지 더 있었습니다.
| 원문에만 있는 내용 | 무엇 |
|---|---|
| 연구 대상은 로봇 "손" | 2장에서 다룬 2018년 연구는 로봇 팔이 아니라, 다섯 손가락에 24개 관절 자유도를 가진 섀도 덱스터러스 핸드를 다룬 연구입니다. 영상은 이를 "로봇 암"이라 부르지만(3장), 정확히는 손 하나입니다. |
| 같은 알고리즘 계보 | 이 로봇 손 연구(Dactyl)는 오픈AI Five(도타2 AI)와 같은 강화학습 코드를 썼고, 오픈AI Five는 PPO를 씁니다. 영상이 6장에서 "관절 많은 로봇에는 PPO"라고 설명한 규칙이 2장의 실제 사례에도 적용되는데, 영상은 이 둘을 직접 연결해서 말하지 않습니다. |
| 도메인 랜덤화라는 용어 | 4장에서 영상이 "환경이 조금만 달라져도 다른 걸로 인식한다"며 설명한 원리의 정식 명칭입니다. 마찰 계수·물체 외형 등을 훈련마다 무작위로 바꾸는 기법입니다. |
| 실제 성능 수치 | 오픈AI 원문에 따르면, 이 로봇 손은 실제 하드웨어에서 물체를 떨어뜨리기 전까지 평균 50회의 회전에 성공했습니다. 영상에는 이 수치가 나오지 않습니다. |
| PPO 논문의 정확한 저자·연도 | "Proximal Policy Optimization Algorithms", Schulman 외, 오픈AI, 2017년 발표. 기존 방법(TRPO)과 성능은 비슷하지만 구현이 훨씬 간단하다는 것이 핵심입니다. |
반대로, 영상이 원문과 정확히 일치했던 부분도 확인됩니다. 2018년이라는 연구 시점, Gymnasium이 2021년에 이름을 바꾼 것, DQN은 이산적 행동에·PPO는 연속적 행동에 쓴다는 구분 — 이 셋은 원문·공식 자료와 그대로 맞습니다.
| 낱말 | 뜻 | 나온 곳 |
|---|---|---|
| 피지컬 AI | 몸을 갖고 실제 세상에서 움직이는 AI의 두뇌 | 0장 |
| 강화학습 | 시도와 상벌을 반복하며 스스로 잘하는 법을 찾는 학습 방식 | 0장, 3장 |
| 에이전트 | 직접 행동하고 그 결과로 배우는 AI 주체 | 0장 |
| 시뮬레이터 | 실제 로봇 대신 컴퓨터 안에 만든 가짜 세상 | 0장, 5장 |
| 시뮬레이션-투-리얼 갭 | 시뮬레이터에서 학습한 것이 실제 로봇에서는 안 통하는 차이 | 0장, 6장 |
| 에피소드 | 시작부터 성공·실패까지의 한 판 | 0장, 10장 |
| 도메인 랜덤화 | 훈련마다 시뮬레이터의 물리적 특성을 무작위로 바꾸는 기법(영상에서는 "색깔이 계속 바뀌는 이유"로 설명) | 4장 |
| DQN | 점프·정지처럼 선택지가 정해진(이산적) 행동에 쓰는 강화학습 알고리즘 | 6장 |
| PPO | 로봇 관절처럼 힘의 세기가 이어진 범위(연속적) 행동에 쓰는 강화학습 알고리즘 | 6장, 9장 |
| 액션 스페이스 | 로봇이 할 수 있는 행동의 종류를 정의한 정보 | 8장 |
| 옵저베이션 스페이스 | 로봇이 지금 보고 있는 것에 대한 관찰 정보 | 8장 |
| Gymnasium (옛 OpenAI Gym) | 오픈AI가 만든 강화학습용 시뮬레이터 모음. 2021년 Farama Foundation으로 이관되며 개명 | 8장 |
| MuJoCo | Gymnasium 안의 물리 시뮬레이션 갈래. 로봇 팔·다리 등을 다룸 | 8장 |
| 익스플로레이션(탐험) | 시뮬레이터가 처음부터 잘 안 되므로 여러 행동을 시도하며 경험을 쌓는 과정 | 9장 |
| stable-baselines3 | PPO 등 강화학습 알고리즘을 이미 구현해 둔 파이썬 도구 | 9장 |
| Google Antigravity | 자연어 지시로 AI 에이전트가 코드를 짜고 실행하는 구글의 AI 코딩 도구 | 10장 |
| 보상(reward) | 목표에 가까운 행동을 할 때마다 에이전트에게 주는 점수. 이 점수를 최대화하는 방향으로 학습이 진행됨 | 10장 |
| Hugging Face | AI 모델을 모아 두고 공유하는 커뮤니티 | 11장 |
이 영상은 원어가 한국어이고, 유튜브 원어 자막(ko-orig)이 30초 묶음 50개·약 3만 자로 영상 시간(27분 38초)의 거의 전부(27분 31초 시작 지점까지)를 채웠습니다. 그래서 ko-orig를 그대로 썼습니다. 유튜브가 별도로 주는 ko 트랙과 바이트 단위까지 비교해 봤는데 완전히 같은 파일이었습니다 — 손보지 않은 자동 생성 자막을 그대로 복사해 올려 둔 것으로 보입니다.
| 자막에 찍힌 것 | 실제로 추정되는 것 | 확인 방법 |
|---|---|---|
| "커넥트 AR앱" | CONNECT AI LAB(채널명)의 오기 | _정보.tsv의 채널명 |
| "뮤지컬 AI" | 피지컬 AI의 오기. 같은 문장 앞뒤에서 "피지컬 AI"로 바르게 찍힌 곳도 있어 혼용된 것으로 보임 | 문맥 |
| "로보트 8" | 정체 불명. 문맥(손가락 다섯, 관절 여러 개, 큐브를 쥐는 물체)과 원문 대조 결과 "로봇 핸드"를 가리키는 것으로 추정되지만, 확정하지 못했습니다 | 확인 못 함 |
| "GM" | Gym(오픈AI 짐)의 오기. 뒤 문장에서 "짐나지움"으로 이어지는 것으로 보아 발음이 뭉개진 것으로 추정 | 문맥 |
| "제학습" | 재학습의 오기 | 문맥 |
| "휘온드는" | 불명확. "능가하는" 정도의 뜻으로 짐작되나 원래 단어를 확정하지 못했습니다 | 확인 못 함 |
jay@connexionai.kr)에서 "Jay"라는 영문 표기를 짐작할 수 있지만, 성이나 본명은 확인하지 못했습니다.