00~18편을 마친 시점(2026-09-02)에서, 시리즈 곳곳에 흩어져 있던 “다음 과제”들을 한곳에 모은 문서입니다. 각 항목에 왜 하는지(어느 편에서 나온 숙제인지), 난이도, 선행 조건을 붙였습니다. 난이도: ●(반나절, 설정·스크립트 수준) ●●(하루, 재학습 1~2회) ●●●(며칠+, 새 구성요소 필요).
1. 걸음 품질 마저 다듬기
| 과제 | 왜 (출처) | 난이도 | 메모 |
|---|---|---|---|
| 속도 적응 위상 클록 | 16편: 클록이 0.8초 고정이라 속도를 보폭으로만 낸다(1.0m/s에 보폭 79cm). 사람은 빠르면 박자도 빨라짐 | ●● | 클록 주기를 명령 속도의 함수로(예: T=0.9−0.25·vx). 관측의 sin/cos는 그대로, 재학습 1회 |
| 회전 추종 잔여 오차 해소 | 13편: 회전 게이트로 저하 20%→12%까지만 회복 | ● | 게이트를 0.3rad/s부터 열거나 tracking_ang_vel 0.5→0.75. 재학습 1회로 검증 |
| 옆걸음·후진·제자리 회전 | 8편 이후 옆걸음 범위가 ±0.2m/s로 좁고, 후진(vx<0)은 학습 분포에 없음 | ●● | 명령 범위 확대 + 대칭 보상의 옆걸음 처리(게이트에 vy 추가) 검토 |
| 모방학습(AMP)으로 스타일 입히기 | 14편: 팔 스윙이 기능적으론 맞지만 진폭이 절약형(±6°). R01 대응책 ③ | ●●● | 사람 모션캡처 데이터 필요(AMASS/CMU 등 공개 데이터 변환). 판별기(discriminator) 구현 — 시리즈 최초의 새 학습 구조 |
2. 지형과 인지(perception)
| 과제 | 왜 (출처) | 난이도 | 메모 |
|---|---|---|---|
| ~~blind 계단 한계 실측(14~16cm)~~ | → 완료(R02): 16cm까지 전부 성공 — 사람 계단급 도달, 추정했던 벽은 없었음 | — | 18cm+는 기구학 한계 영역으로 보류 |
| 계단 내려가기 | 17~18편은 오르기만. 내려가기는 균형 논리가 다름(체중 낙하 제어) | ●● | step_height 부호 반전 + 시작 위치를 가장자리로. 판정 도구는 그대로 |
| 높이맵 관측(로봇의 ‘눈’) | 18편 결론: 17cm 실계단·불규칙 단차는 감각만으론 불가 | ●●● | 로봇 주변 지형 높이 샘플을 관측에 추가(수십 차원). Genesis 지형에서 높이 질의 구현 필요. 다음 시즌의 본편 후보 |
| 다양한 지형 믹스 | Genesis가 지원 확인됨: 경사(pyramid_sloped), 장애물(discrete_obstacles), 물결(wave), 징검다리(stepping_stones) | ●● | n_subterrains로 여러 지형을 한 판에 깔고 커리큘럼. 징검다리는 높이맵 관측과 병행 권장 |
| 능력 통합 정책 | 현재 최종 정책이 계열별로 분리됨: 평지 18관절(g1-fast) vs 지형 12관절(g1-stairs) | ●● | 지형 계열에 팔 6관절+고속 명령을 얹어 하나의 정책으로. 이어 학습 체인 재활용 |
3. 강건성과 현실성(sim-to-real 준비)
| 과제 | 왜 (출처) | 난이도 | 메모 |
|---|---|---|---|
| 도메인 랜덤화 확대 | 9편 각주 + R03 실측 근거: 관측 노이즈 σ=0.05→0.1 사이 붕괴 절벽 발견 (지연 20ms는 이미 강건) | ●● | 관측 노이즈 랜덤화가 최우선, 이어 마찰·질량·kp/kd. sim-to-real의 표준 준비물 |
| ~~에너지 실측(cost of transport)~~ | → 완료(R03): 셔플 2.37 → 정상 0.80 → 빠른 걸음 0.31(사람 수준) | — | 자연스러움=에너지 효율의 실측 확인 |
| sim-to-real (실물 로봇으로 이전) | 시리즈의 최종 목적지 | ●●● | 실물 G1 필요. 준비된 것: 토크 예산 내 보행(12편), 스폰·검증 절차, 랜덤화 일부. 필요한 것: 모터 모델 보정, 안전 정지, 위 랜덤화 확대 |
4. 인프라·검증 (조용하지만 가치 큰 것)
| 과제 | 왜 (출처) | 난이도 | 메모 |
|---|---|---|---|
| 회귀 테스트 일괄 실행기 | 11편 교훈: 개선 하나가 다른 능력을 퇴보시킴. 지금은 시나리오를 수동으로 돌림 | ● | python g1_regression.py -e <exp> 하나로 조종·밀치기·걸음지표·(지형이면)등반 판정을 일괄 실행·표로 출력 |
| 측정 도구 자가 검증을 정기 절차로 | 17편 교훈: 잰 도구가 틀리면 다 틀림 | ● | 새 측정 스크립트는 ‘답을 아는 환경(평지)’에서 먼저 돌리는 체크리스트 문서화 |
| 쇼케이스 영상 v2 | outputs/00_showcase.mp4는 06편까지만 반영 | ● | 08~18 하이라이트(조종→밀치기→교정 전후→계단 12cm)로 재편집. 한글 자막은 나눔/Noto CJK 폰트 |
5. 콘텐츠
| 과제 | 난이도 | 메모 |
|---|---|---|
| 블로그 발행 (19편 + R01) | ● | WordPress REST API로 초안 업로드 → 태그·발행은 수동 검토. 서버가 느려 여러 회에 나눠 진행 |
| 연구 노트 R02 후보 | ● | “커리큘럼과 이어 학습”(15·18편) 또는 “측정의 신뢰성”(10·13·17편)을 R01처럼 깊게 |
추천 우선순위 (개인 의견)
- 회귀 테스트 일괄 실행기 — 앞으로 뭘 하든 검증 비용을 크게 줄여줌 (반나절)
- 블로그 발행 — 19편이 쌓여 있고, 발행 후 피드백이 다음 방향에 도움
- 높이맵 관측 — 다음 시즌의 본편. 18편이 그 필요성을 숫자로 증명해 둔 상태
- 능력 통합 정책 + 속도 적응 클록 — ‘최종 데모 정책’ 만들기
이 시리즈의 전체 글 목록 → 시리즈 목차