deney · olgun
Eğitim
SmolVLA'ya Colab A100'de 20 000 adımlık ince ayar, sonra koldan önce Mac'te üç kontrol.
Politika, robotun gördüğünü bir sonraki hareketine çeviren fonksiyon.
SmolVLA bunların küçük bir örneği; kamera görüntülerini ve bir cümleyi alıyor.
Onu sıfırdan eğitmedim. lerobot/smolvla_base modelinden başladım ve 45
bölümümle, LeRobot'un varsayılan ayarıyla ince ayar yaptım: yalnızca eylem
üreten kısım eğitiliyor, görüntü-dil modeli dondurulmuş kalıyor.
Sayılar: batch boyutu 64, 20 000 adım, Colab'da bir A100 üzerinde yaklaşık 3 saat 45 dakika. Loss, 100. adımdaki 0,479'dan 0,077'ye indi. Defter bunların hepsini yapıyor ve her 5 000 adımda bir checkpoint yüklüyor; bağlantı koparsa bütün eğitim boşa gitmiyor.
Model kola dokunmadan önce Mac'te üç şeye baktım:
- Mac'in GPU'suna yükleniyor ve 50 adımlık hareketi 0,35 saniyede hesaplıyor.
- Kayıtlı karelerde tahmini, benim kayıttaki hareketimden ortalama 0,4–1° kadar ayrılıyor. Bunlar eğitim kareleri; yani bu yalnızca verisini öğrendiğini gösteriyor.
- Aynı karede cümleyi başka bir hücreyle değiştirince tahmin 50°'ye kadar değişiyor. Model cümleyi dinliyor.
Bunların hiçbiri kolun başaracağını söylemiyor. Yalnızca ucuz hataları, motorlar açılmadan önce eliyor.