19편에서 데이터 공장을 차리고 보기 좋게 실패한 뒤, 열일곱 번째 정책까지 왔습니다. 이 편은 23편 끝에 약속한 먼 쪽 실험의 결과로 시작해서, 시즌 3가 무엇을 풀었고 무엇을 못 풀었는지, 그리고 다음에 무엇을 하면 좋을지를 정리합니다.
먼 쪽에도 같은 처방을
23편에서 로봇 몸통 앞 구역에 데이터를 더 넣자 그 구역만이 아니라 전체 성적이 올랐습니다. 그때 적어 둔 의심이 하나 있었습니다. 데이터가 1,000편에서 2,500편으로 늘었으니, 오른 것이 “몸통 앞 밀도” 덕인지 “데이터 총량” 덕인지 섞여 있다는 것입니다. 가르는 방법은 반대쪽에 같은 처방을 따로 거는 것입니다.
로봇에서 먼 쪽 띠(큐브 x 0.58~0.68m)에서 장면 300개, 지시문 다섯 개씩 1,500편을 더 모았습니다. 시간을 아끼려고 기존 데이터와 합치지 않고 새 데이터만으로 23편의 v15에서 조금만 더 배우게 했습니다. 이 정책이 v16입니다. 결과는 전체 30시행 중 4, 더 배운 먼 쪽 구역조차 60장면 중 25로 v15의 48보다 나빴습니다. 몸통 앞은 0이었습니다.
두 번 넘어졌습니다
첫 번째는 눈금이었습니다. 학습 라이브러리는 데이터셋마다 입력의 평균과 표준편차를 새로 계산해 정책 앞에 붙입니다. 먼 쪽만 모은 데이터셋은 큐브 x좌표의 표준편차가 0.028로, v15가 배운 데이터셋(0.076)의 3분의 1입니다. 같은 좌표가 정책에는 세 배 큰 숫자로 들어갑니다. v15의 가중치는 옛 눈금으로 배운 것이니, 미세조정이 아니라 눈금이 바뀐 채로 5,000스텝을 돈 셈입니다. 몸통 앞 구역이 0이었던 이유도 이것입니다. 새 눈금에서 몸통 앞 좌표는 평균에서 일곱 표준편차 밖입니다.
눈금을 v15의 것으로 되돌려 다시 배우게 했습니다. 이 정책이 v16b입니다. 전체는 4에서 16으로, 먼 쪽은 25에서 50으로 돌아왔습니다. 그런데 몸통 앞이 48에서 12로 떨어졌습니다.
두 번째는 망각이었습니다. 먼 쪽 데이터만 5,000스텝 더 보는 동안 정책은 몸통 앞에서 배운 것을 잊었습니다. 23편의 v15가 됐던 이유는 앞 구역 데이터를 기존 데이터와 합쳐서 배웠기 때문이었습니다. 새 구역을 더할 때는 새 데이터만 이어 배우면 안 되고, 전부 합쳐서 같은 출발점에서 다시 배워야 합니다.
| v15 | v16 (눈금 어긋남) | v16b (눈금 맞춤) | |
|---|---|---|---|
| 먼 쪽 구역 60장면 | 48 | 25 | 50 |
| 몸통 앞 구역 60장면 | 48 | 0 | 12 |
| 경계 3cm 안쪽 60장면 | 54 | 10 | 38 |
| 전체 작업공간 30시행 | 25 | 4 | 16 |
| 지시문을 바꿨을 때 행동 변화 | 77배 | 38배 | 56배 |
그래서 세 번째 시도는 처음부터 제대로 했습니다. 기존 1,000편, 몸통 앞 1,495편, 먼 쪽 1,500편을 전부 합쳐 3,995편으로, 22편의 v12에서 출발해 v15와 똑같은 방식으로 배우게 했습니다. 이 정책이 v17입니다.
| v15 (몸통 앞만 증량) | v17 (두 구역 증량) | |
|---|---|---|
| 먼 쪽 구역 60장면 | 48 | 54 |
| 몸통 앞 구역 60장면 | 48 | 54 |
| 경계 3cm 안쪽 60장면 | 54 | 56 |
| 전체 작업공간 30시행 | 25 | 24 |
| 지시문을 바꿨을 때 행동 변화 | 77배 | 59배 |
두 구역이 같은 폭으로 올랐고, 앞 구역을 잊지도 않았습니다. 구역 안에서 학습 조합은 50번 중 49번과 48번입니다. 전체 작업공간 30시행의 24는 v15의 25와 흔들림 안입니다. 남은 실패 6건은 전부 큐브를 못 집은 것이고, 지시문 읽기는 59배로 그대로입니다.
23편의 의심에도 답이 나왔습니다. 먼 쪽 데이터만 1,500편 더한 v16b는 먼 쪽이 2 올랐고, 합본으로 3,000편 더한 v17은 두 구역이 6씩 올랐습니다. 총량보다 데이터가 어디에 있느냐가 컸습니다. “어느 자리가 어려운지 재서 거기에 데이터를 더 넣는다”는 처방은 로봇 앞쪽과 뒤쪽에서 똑같이 들었습니다.

시즌 3가 푼 것
환경에서 평가까지 전부 집에서 돌아가는 루프. 시뮬레이터에서 3초에 한 편씩 시연을 찍고, 학습 라이브러리 포맷으로 옮기고, 5억 파라미터짜리 VLA를 16GB GPU에서 파인튜닝하고, 같은 시뮬레이터에서 채점합니다. 19편에서 만든 이 공장이 시즌 내내 열일곱 번 돌았습니다.
지시문을 읽는 정책. 좌표 열 개와 지시문을 주면 “red cube”에서 빨간 큐브의 칸을, “purple pad”에서 보라 받침의 칸을 고릅니다. 집으러 갈 때는 큐브 칸을, 옮길 때는 받침 칸을 봅니다. 학습에 없던 “노란 큐브를 보라 받침에”도 편한 구역에서 10번 중 7번 해냅니다. 언어를 읽는지는 성공률이 아니라 입력을 바꿔 넣어 재는 시험으로 확인했습니다.
어디서 실패하는지 아는 정책. 실패를 지도에 찍어 몸통 앞과 먼 쪽 띠를 찾았고, 학습 장면 주변 몇 cm까지 맞는지를 재서 그 구역의 일반화 반경이 짧다는 것을 알았고, 거기에 데이터를 더 넣어 반경을 늘렸습니다.
시즌 3가 못 푼 것
눈. 정책은 여전히 이미지를 보지 않습니다. 이미지를 보여 주면 팔 자세를 따라 하는 지름길이 지시문 읽기를 이깁니다(v8, v9, v13). 나중에 붙이면 해롭지는 않지만 파지를 다듬는 데 쓰지도 않습니다(v14). 큐브 위치는 별도의 지각망이 읽어서 숫자로 넘겨줍니다. 눈과 언어를 한 모델 안에서 같이 쓰는 것, VLA라는 이름이 약속하는 바로 그것은 이 시즌에서 이루지 못했습니다.
손. 정책은 처음 읽은 좌표만 믿고 끝까지 갑니다. 큐브가 4cm이고 그리퍼가 8cm까지 벌어져서 성립하는 방식이지, 작은 물건이나 미끄러지는 물건에는 통하지 않을 겁니다.
조합 다섯 개짜리 언어. 큐브 세 색과 받침 두 색, 문장 틀 하나입니다. “yellow”와 “purple”을 따로 읽어 합치는 것까지는 확인했지만, 그 이상의 언어를 시험할 어휘가 없습니다.
시즌 3에서 배운 것
- loss는 아무 말도 해 주지 않았습니다. 전멸한 정책 다섯 개(v1~v4, v8, v9)의 loss는 모두 성공한 정책과 같거나 더 낮았습니다. 시즌 1~2의 “영상은 검증이 아니다”가 시즌 3에서는 “loss는 검증이 아니다”가 됐습니다.
- 진단 도구와 배관부터 의심해야 했습니다. 결정계수 −37이 나온 선형 회귀, 한 번만 재고 추세를 그린 접지 시험, 평균 풀링으로 위치를 뭉갠 지각망, 상태 종류를 덮어써 죽은 평가기, 데이터셋마다 새로 계산되는 정규화 눈금, 부분 데이터로 이어 배울 때의 망각. 판정이 뒤집힌 순간의 절반은 로봇이 아니라 도구나 배관을 고친 뒤였습니다.
- 지름길이 데이터 안에 있으면 데이터를 흔들어도 소용없습니다. 장면당 지시문을 다섯으로 늘려도 정책은 팔 자세를 따라 했습니다. 지름길 자체를 없애야(이미지를 지워야) 지시문 읽기를 배웠고, 배운 뒤에 지름길을 다시 보여 줘도 되돌아가지 않았습니다. 순서가 답이었습니다.
- 실패의 자리를 지도에 찍는 것이 처방을 정합니다. 성공률 하나로는 “눈이 부족하다”와 “그 자리가 어렵다”를 구분할 수 없었고, 지도를 찍은 뒤에야 눈이 아니라 데이터가 답이라는 것이 보였습니다.
- 판정 기준은 학습 전에 적어야 합니다. 22편의 v8은 “지시문을 무시하면 5/25쯤”이라고 미리 적어 두었기에 0/30이 그보다도 이상하다는 것을 바로 알았습니다.
다음에 할 수 있는 것
- 눈을 지름길 없이 주는 구조. 이미지에서 팔을 지우고 렌더하거나, 이미지를 좌표 예측 뒤의 “잔차 보정”에만 쓰는 2단 구조. 손목 카메라만 남기는 것은 부족했습니다.
- 어휘 늘리기. 색 다섯, 받침 셋이면 조합 15개. 홀드아웃을 여러 개 두면 조합 일반화를 제대로 잴 수 있습니다.
- 체급 올리기. 시즌 3를 시작할 때 미뤄 둔 것으로, 70억 파라미터 VLA를 16GB GPU에서 LoRA로 돌려 보는 것. 더 큰 눈이 지각망 없이 좌표를 읽어 내는지가 질문입니다.
- 월드 모델. 역시 시작할 때 미뤄 둔 것으로, 시연 데이터로 “다음 장면”을 예측하는 작은 모델을 만들어 상상이 물리와 어디서부터 어긋나는지 재는 것.

전체 영상:
로봇은 시키는 대로 집습니다. 눈을 감은 채, 편한 자리에서, 다섯 문장 안에서요. 세 조건이 전부 다음 시즌의 제목 후보입니다.
이 시리즈의 전체 글 목록 → 시리즈 목차