kaynak · olgun

SmolVLA mı, ACT mi; kaç bölüm?

SmolVLA daha az veri istemez: taban 50 bölüm, 25 yetmedi, 30 başarısız. Kazandırdığı şey başarı ve dil.

Soru: SmolVLA ile eğitirsek daha az veriyle olur mu? Kaynaklı cevap: hayır. SmolVLA'nın kazandırdığı şey az veri değil; aynı veriyle daha yüksek başarı, ışığa ve arka plana dayanıklılık ve dil komutu.

KaynakBulgu
LeRobot SmolVLA dokümanı~50 bölüm, 5 konum × 10; 25 bölüm "yetmedi"
lerobot issue #123930 bölümle SmolVLA başarısız, aynı veriyle ACT çalıştı
ggando.com, 2026-0350 bölüm / 30 cm alan başarısız; 75 bölüm / 10 cm başarılı; SmolVLA %60–80, ACT %80
SmolVLA makalesi, SO-101SmolVLA %90 eğitim konumlarında, %50 yeni konumda; ACT %70 / %40
SO-101 VLA benchmark, 2026-06, 100 gösterimπ0.5 %56, ACT %34, SmolVLA %32,5
SEVO, 2026-05ışık, arka plan ve dikkat dağıtıcıyı kayıtta çeşitlendirmek genellemenin en önemli faktörü
veri sayısı: taban ve tavan
bizim ring-center-v210 bölüm
LeRobot docs tabanı50 bölüm
ggando, başarılı koşu75 bölüm

Konum çeşitliliği pahalı: konum başına 10 gösterim, alan büyüdükçe daha fazla. Küçük alan + çok tekrar, büyük alan + az tekrardan iyi.

Kararımız: SmolVLA, ama 50 bölüm tabanıyla. Sebep az veri değil; XOX'un 18 görevini tek politikada cümleyle ayırt etmesi ve Hashtag reçetesinin bu olması.

Kaynaklar: LeRobot SmolVLA · issue #1239 · ggando · SmolVLA makalesi · benchmark

#smolvla #act #veri

Bu notu beyaz tahtada gör →