유튜브 정리 · 폴더 안내
피지컬 AI 두뇌를 만드는 1인 기업, 오늘 시작합니다
로봇도 비싼 하드웨어도 없이, 컴퓨터 한 대와 무료 도구만으로 로봇 팔에게 물건 옮기는 법을 학습시키는 강화학습 실습 영상입니다. 오픈AI가 챗GPT 이전에 몰두했던 2018년 로봇 손 연구를 뿌리로 삼아, 강화학습의 기초·시뮬레이터의 함정(도메인 랜덤화)·DQN과 PPO의 차이를 짚은 다음, 짐나지움(Gymnasium)과 무조코(MuJoCo)로 실제 코랩 실습까지 이어집니다.
흐름은 이렇습니다.
- 왜 지금인가 — 오픈AI의 2018년 로봇 손 연구, 강화학습의 기본 원리, 슈퍼마리오 1탄·2탄 비유로 본 시뮬레이터의 함정
- 무엇으로 학습하나 — DQN vs PPO, 짐나지움(옛 OpenAI Gym)과 무조코가 제공하는 연습장
- 어떻게 실습하나 — 구글 코랩에서 Pusher 환경 첫 실행 → 오류 해결 → PPO 재학습 → 안티그래비티로 학습 상황판 만들기
- 어디로 이어지나 — 허깅페이스에 모델 올리기, 피지컬 AI의 사업 기회 네 갈래
이 폴더에 있는 것
- 정리.html
본문. 0장(먼저 알아야 할 것) → 본문 11장 → 원문에서 더 확인한 것 → 부록 A 낱말표 → 부록 B 못 믿을 것
- 실행계획.html
코랩 첫 실행부터 PPO 재학습, Hugging Face 업로드까지 — 영상이 실제로 밟은 순서를 그대로 따라가는 8단계
- 자막-ko-orig-30초묶음.txt
근거 자막. 한국어 원어 자막을 30초 단위로 묶고 시각을 붙인 것 (50묶음 · 약 3만 자 · 27분 31초 시작 지점까지)
- 원본자막/
받은 그대로 (ko-orig · ko 두 트랙, 두 파일이 완전히 동일해 ko-orig를 그대로 씀)
이 정리에서 영상보다 더 들어간 것
영상이 언급한 오픈AI의 2018년 로봇 손 연구(Learning Dexterity), Gymnasium, PPO 원 논문을 직접 찾아 대조했습니다. 세 가지가 더 있습니다.
① 그 연구는 로봇 "팔"이 아니라 다섯 손가락 24개 관절의 로봇 "손"이었다는 것
② 그 로봇 손이 실제로는 오픈AI Five와 같은 PPO 계열 알고리즘을 썼다는 것 — 영상이 뒤에서 "관절 많은 로봇엔 PPO"라 설명한 것과 정확히 들어맞습니다
③ 영상이 "색깔이 계속 바뀐다"고만 설명한 현상의 정식 이름 — 도메인 랜덤화
해설자의 풀네임, "로보트 8"이라는 깨진 표현의 정체는 확정하지 못했습니다 — 부록 B에 전부 적었습니다.