유튜브 정리 · 폴더 안내

피지컬 AI 두뇌를 만드는 1인 기업, 오늘 시작합니다

로봇도 비싼 하드웨어도 없이, 컴퓨터 한 대와 무료 도구만으로 로봇 팔에게 물건 옮기는 법을 학습시키는 강화학습 실습 영상입니다. 오픈AI가 챗GPT 이전에 몰두했던 2018년 로봇 손 연구를 뿌리로 삼아, 강화학습의 기초·시뮬레이터의 함정(도메인 랜덤화)·DQN과 PPO의 차이를 짚은 다음, 짐나지움(Gymnasium)과 무조코(MuJoCo)로 실제 코랩 실습까지 이어집니다.

흐름은 이렇습니다.

  1. 왜 지금인가 — 오픈AI의 2018년 로봇 손 연구, 강화학습의 기본 원리, 슈퍼마리오 1탄·2탄 비유로 본 시뮬레이터의 함정
  2. 무엇으로 학습하나 — DQN vs PPO, 짐나지움(옛 OpenAI Gym)과 무조코가 제공하는 연습장
  3. 어떻게 실습하나 — 구글 코랩에서 Pusher 환경 첫 실행 → 오류 해결 → PPO 재학습 → 안티그래비티로 학습 상황판 만들기
  4. 어디로 이어지나 — 허깅페이스에 모델 올리기, 피지컬 AI의 사업 기회 네 갈래

이 폴더에 있는 것

이 정리에서 영상보다 더 들어간 것

영상이 언급한 오픈AI의 2018년 로봇 손 연구(Learning Dexterity), Gymnasium, PPO 원 논문을 직접 찾아 대조했습니다. 세 가지가 더 있습니다.

① 그 연구는 로봇 "팔"이 아니라 다섯 손가락 24개 관절의 로봇 "손"이었다는 것
② 그 로봇 손이 실제로는 오픈AI Five와 같은 PPO 계열 알고리즘을 썼다는 것 — 영상이 뒤에서 "관절 많은 로봇엔 PPO"라 설명한 것과 정확히 들어맞습니다
③ 영상이 "색깔이 계속 바뀐다"고만 설명한 현상의 정식 이름 — 도메인 랜덤화

해설자의 풀네임, "로보트 8"이라는 깨진 표현의 정체는 확정하지 못했습니다 — 부록 B에 전부 적었습니다.