로드맵 — 다음에 해볼 수 있는 것들

00~18편을 마친 시점(2026-09-02)에서, 시리즈 곳곳에 흩어져 있던 “다음 과제”들을 한곳에 모은 문서입니다. 각 항목에 왜 하는지(어느 편에서 나온 숙제인지), 난이도, 선행 조건을 붙였습니다. 난이도: ●(반나절, 설정·스크립트 수준) ●●(하루, 재학습 1~2회) ●●●(며칠+, 새 구성요소 필요).


1. 걸음 품질 마저 다듬기

과제 왜 (출처) 난이도 메모
속도 적응 위상 클록 16편: 클록이 0.8초 고정이라 속도를 보폭으로만 낸다(1.0m/s에 보폭 79cm). 사람은 빠르면 박자도 빨라짐 ●● 클록 주기를 명령 속도의 함수로(예: T=0.9−0.25·vx). 관측의 sin/cos는 그대로, 재학습 1회
회전 추종 잔여 오차 해소 13편: 회전 게이트로 저하 20%→12%까지만 회복 게이트를 0.3rad/s부터 열거나 tracking_ang_vel 0.5→0.75. 재학습 1회로 검증
옆걸음·후진·제자리 회전 8편 이후 옆걸음 범위가 ±0.2m/s로 좁고, 후진(vx<0)은 학습 분포에 없음 ●● 명령 범위 확대 + 대칭 보상의 옆걸음 처리(게이트에 vy 추가) 검토
모방학습(AMP)으로 스타일 입히기 14편: 팔 스윙이 기능적으론 맞지만 진폭이 절약형(±6°). R01 대응책 ③ ●●● 사람 모션캡처 데이터 필요(AMASS/CMU 등 공개 데이터 변환). 판별기(discriminator) 구현 — 시리즈 최초의 새 학습 구조

2. 지형과 인지(perception)

과제 왜 (출처) 난이도 메모
~~blind 계단 한계 실측(14~16cm)~~ 완료(R02): 16cm까지 전부 성공 — 사람 계단급 도달, 추정했던 벽은 없었음 18cm+는 기구학 한계 영역으로 보류
계단 내려가기 17~18편은 오르기만. 내려가기는 균형 논리가 다름(체중 낙하 제어) ●● step_height 부호 반전 + 시작 위치를 가장자리로. 판정 도구는 그대로
높이맵 관측(로봇의 ‘눈’) 18편 결론: 17cm 실계단·불규칙 단차는 감각만으론 불가 ●●● 로봇 주변 지형 높이 샘플을 관측에 추가(수십 차원). Genesis 지형에서 높이 질의 구현 필요. 다음 시즌의 본편 후보
다양한 지형 믹스 Genesis가 지원 확인됨: 경사(pyramid_sloped), 장애물(discrete_obstacles), 물결(wave), 징검다리(stepping_stones) ●● n_subterrains로 여러 지형을 한 판에 깔고 커리큘럼. 징검다리는 높이맵 관측과 병행 권장
능력 통합 정책 현재 최종 정책이 계열별로 분리됨: 평지 18관절(g1-fast) vs 지형 12관절(g1-stairs) ●● 지형 계열에 팔 6관절+고속 명령을 얹어 하나의 정책으로. 이어 학습 체인 재활용

3. 강건성과 현실성(sim-to-real 준비)

과제 왜 (출처) 난이도 메모
도메인 랜덤화 확대 9편 각주 + R03 실측 근거: 관측 노이즈 σ=0.05→0.1 사이 붕괴 절벽 발견 (지연 20ms는 이미 강건) ●● 관측 노이즈 랜덤화가 최우선, 이어 마찰·질량·kp/kd. sim-to-real의 표준 준비물
~~에너지 실측(cost of transport)~~ 완료(R03): 셔플 2.37 → 정상 0.80 → 빠른 걸음 0.31(사람 수준) 자연스러움=에너지 효율의 실측 확인
sim-to-real (실물 로봇으로 이전) 시리즈의 최종 목적지 ●●● 실물 G1 필요. 준비된 것: 토크 예산 내 보행(12편), 스폰·검증 절차, 랜덤화 일부. 필요한 것: 모터 모델 보정, 안전 정지, 위 랜덤화 확대

4. 인프라·검증 (조용하지만 가치 큰 것)

과제 왜 (출처) 난이도 메모
회귀 테스트 일괄 실행기 11편 교훈: 개선 하나가 다른 능력을 퇴보시킴. 지금은 시나리오를 수동으로 돌림 python g1_regression.py -e <exp> 하나로 조종·밀치기·걸음지표·(지형이면)등반 판정을 일괄 실행·표로 출력
측정 도구 자가 검증을 정기 절차로 17편 교훈: 잰 도구가 틀리면 다 틀림 새 측정 스크립트는 ‘답을 아는 환경(평지)’에서 먼저 돌리는 체크리스트 문서화
쇼케이스 영상 v2 outputs/00_showcase.mp4는 06편까지만 반영 08~18 하이라이트(조종→밀치기→교정 전후→계단 12cm)로 재편집. 한글 자막은 나눔/Noto CJK 폰트

5. 콘텐츠

과제 난이도 메모
블로그 발행 (19편 + R01) WordPress REST API로 초안 업로드 → 태그·발행은 수동 검토. 서버가 느려 여러 회에 나눠 진행
연구 노트 R02 후보 “커리큘럼과 이어 학습”(15·18편) 또는 “측정의 신뢰성”(10·13·17편)을 R01처럼 깊게

추천 우선순위 (개인 의견)

  1. 회귀 테스트 일괄 실행기 — 앞으로 뭘 하든 검증 비용을 크게 줄여줌 (반나절)
  2. 블로그 발행 — 19편이 쌓여 있고, 발행 후 피드백이 다음 방향에 도움
  3. 높이맵 관측 — 다음 시즌의 본편. 18편이 그 필요성을 숫자로 증명해 둔 상태
  4. 능력 통합 정책 + 속도 적응 클록 — ‘최종 데모 정책’ 만들기

이 시리즈의 전체 글 목록 → 시리즈 목차

댓글 남기기

이 사이트는 Akismet을 사용하여 스팸을 줄입니다. 댓글 데이터가 어떻게 처리되는지 알아보세요.