İçeriğe geç
Robotlar
Sektörel Rehber

TrackEverything: Videodaki Her Noktayı 3B İzlemek ve Robotlarla Uyumluluğu

UNITREE Türkiye Hub & Yetkinlik Merkezi
Bir robotun kamerasından gelen videoda neyin hareket ettiğini, nereye gittiğini ve arkasında ne bıraktığını nokta nokta bilmek, taklit öğrenmeden dinamik haritalamaya kadar birçok işin ham maddesi. Carnegie Mellon Üniversitesi ve Meta araştırmacılarının Eylül 2026'da yayımladığı TrackEverything, 1000 kareyi aşan videolarda sahnedeki tüm noktaları 3B dünya koordinatlarında izleyen ilk yoğun takipçi olduğunu söylüyor. Çalışmayı Türkiye'deki robot ekipleri gözüyle okuduk ve asıl soruyu sorduk: bugün satın alınabilen robotlarla ne kadar uyumlu?

İlgili modeller

TrackEverything nedir?

TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations (arXiv:2609.30222, cs.CV). Yazarlar: Ayush Jain, Sreeharsha Paruchuri, Ishita Gupta, Fan Zhang, Tanner Schmidt, Jakob Engel, Katerina Fragkiadaki ve Adam W. Harley; Carnegie Mellon Üniversitesi ve Meta.

Nokta takibi (point tracking) şu soruyu cevaplar: videonun bir karesindeki bir yüzey noktası sonraki karelerde nerede? Bugüne kadar iki yol vardı. Seyrek takipçiler seçilen birkaç bin noktayı uzun süre izler. Yoğun takipçiler her pikseli izler ama ya yalnız ilk karede görünen noktalarla sınırlıdır ya da 48-64 karelik kısa kliplerin ötesine geçemez. TrackEverything bu ödünleşimi kaldırmayı hedefliyor: bir nokta videoda ilk göründüğü anda takibe alınıyor ve 1000+ kare boyunca izleniyor. 30 kare/sn bir kamerada 1000 kare yaklaşık 33 saniye eder.

Nasıl çalışıyor: üç fikir

Çıkış noktası basit bir gözlem: video, kalıcı bir 3B dünyanın 2B izdüşümü. Piksel uzayında çalışan takipçiler aynı yüzeyi her karede yeniden temsil ediyor. TrackEverything bunun yerine sahneyi dünya koordinatlarında kalıcı 3B iz olarak tutuyor. Yöntemin üç parçası var:

  • 3B sahne içeriği uzayında takip: aynı yüzeyin tekrar eden gözlemleri tek noktada birleşiyor; örtülen (occluded) noktalar kaybolmadan saklanıyor.
  • Tekrarlı (recurrent) mimari: hareket tahminleri adım adım iyileştiriliyor ve kayan pencereler boyunca zincirleniyor. Uzun video bu sayede parça parça işleniyor.
  • Pencere başına statik/dinamik sınıflandırma: yörünge çözümleme yalnız hareket eden noktalara ayrılıyor. Duvar, zemin, raf gibi sabit yüzeyler için boşuna yörünge üretilmiyor.

Her pencere sınırında 3B temsil voksellere bölünerek tekrarlar ayıklanıyor. Sonuç: modelin yükü videonun uzunluğuyla değil, sahnedeki farklı içerik miktarıyla büyüyor. Yazarların belirttiği iki sayı: model 61 milyon parametre ve yalnız kamuya açık veri kümeleriyle eğitilmiş; 1000+ karelik videoyu 40 GB'ın altında GPU belleğiyle işliyor. Kamera hareketi hesaba katılıyor, yani kameranın kendisi hareket ederken de sahne tutarlı kalıyor.

Sonuçlar: rakamlar ne söylüyor?

Değerlendirme TAPVid-3D üzerinde, üç alt kümede yapılmış: ADT (Aria Digital Twin, giyilebilir kamerayla çekilmiş iç mekan videoları), DriveTrack (sürüş) ve Panoptic Studio (insan hareketi). Proje sayfasındaki tablodan seçtiğimiz değerler (APD-P / APD-M, yüksek olan iyi):

YöntemADT, ilk 48 kareADT, videonun tamamıDriveTrack, videonun tamamı
TrackEverything (yoğun)40,0 / 89,130,5 / 81,623,7 / 39,6
TAPIP-3D + Pi3 (seyrek)39,6 / 88,532,7 / 82,025,0 / 40,9
SpatialTracker-v2 + Pi3 (seyrek)39,9 / 88,132,1 / 82,426,2 / 43,5
Any4D + Pi3 (yoğun)5,1 / 61,5bellek yetmedibellek yetmedi

Tabloyu dürüst okumak gerekiyor. Tam uzunluktaki videolarda çalışabilen tek yoğun yöntem TrackEverything; öteki açık yoğun yöntem bellek sınırına takılıyor. Seyrek takipçiler ise uzun videoda birkaç puan önde. Ama seyrek takipçiler yalnız sorgulanan noktaları izliyor, TrackEverything sahnenin tamamını. Yazarların iddiası da bu çerçevede: "büyüklük mertebesi olarak daha fazla nokta izlerken seyrek takipçilerle rekabetçi" ve açık kaynak yoğun 3B takipçilerin %20'den fazla önünde. Kapalı kaynak, 1 milyar parametreli D4RT 48 karelik kliplerde daha yüksek APD-P alıyor, fakat 48 karenin ötesinde değerlendirilmemiş.

Robotlarla uyumluluk: dört soru

Bir görme modelinin "robot uyumlu" olup olmadığı tek bir cevaba sığmaz. Dört ayrı soru sorduk.

1. Girdi: robot bu modele veri verebilir mi? Evet. Proje sayfası girdiyi sıradan bir video olarak gösteriyor; ayrı bir derinlik sensörü şartı belirtilmiyor. Kamerası olan her robot, hatta robotun yanında tutulan bir telefon, video kaynağı olabilir. Derinlik kamerası olan platformlar (Unitree G1 EDU'daki Intel RealSense D435i gibi) ileride derinlikle doğrulama yapmak için ek avantaj sağlar, ama modelin kendisi için zorunlu görünmüyor.

2. Hesaplama: robotun üstünde çalışır mı? Bugünkü haliyle çoğu robotta hayır. Yazarların verdiği bellek bütçesi 40 GB'ın altı; Unitree G1 EDU'nun geliştirme bilgisayarı Jetson Orin NX 16 GB bellekle geliyor, Go2 EDU'nun Jetson Orin modülü de en fazla 16 GB. İstisna, 128 GB birleşik belleğe sahip Jetson Thor taşıyan platformlar (Unitree H2 Plus, opsiyonel olarak H2 EDU): bellek kağıt üzerinde yetiyor, ama modelin Thor üzerinde derlenip ne hızda çalıştığı doğrulanmış değil ve kod henüz yayımlanmadı.

3. Gerçek zaman: kontrol döngüsüne girer mi? Hayır, ve bu bir kusur değil, tasarım tercihi. Model uzun videoyu kayan pencerelerle geriye dönük işliyor; proje sayfası kare hızı vermiyor. Yani TrackEverything robotun anlık engel algılama veya kavrama döngüsü için değil, kaydedilmiş videoyu sonradan analiz etmek için bir araç. Doğru kullanım şekli: robot kaydeder, iş istasyonu işler.

4. Hareket koşulları: robotun kamerası bu modele uygun mu? Kısmen. Model kamera hareketini hesaba katıyor ve değerlendirmedeki ADT alt kümesi giyilebilir, yani kafa hareketli bir kamerayla çekilmiş; bu, insansı robotun kafa kamerasına yakın bir senaryo. Ama yazarların açıkça yazdığı hata durumları robotlar için kritik: hızlı ve büyük yer değiştirmeli hareket ile tekrarlı ya da dokusuz arka planlar. Koşan bir dört ayaklının sarsılan kamerası, boş beyaz duvarlar, aynı raflarla dolu depo koridorları ve düz renkli zeminler tam bu sınıfa giriyor.

Platform bazında uyumluluk tablosu

Aşağıdaki tablo, portföyümüzdeki araştırma platformlarının resmi bilgisayar ve bellek değerleriyle yazarların verdiği 40 GB bütçesini karşılaştırıyor. "Video kaynağı" sütunu robotun modele veri üretip üretemeyeceğini, "Robot üstünde çalıştırma" sütunu modelin robotun kendi bilgisayarında koşup koşamayacağını gösteriyor.

PlatformGeliştirme bilgisayarıVideo kaynağıRobot üstünde çalıştırma
Unitree G1 EDUJetson Orin NX, 16 GBUygun (RealSense D435i, kafa hareketli)Hayır: bellek 40 GB bütçesinin altında
Unitree Go2 EDUJetson Orin, en fazla 16 GBUygun, yavaş yürüyüşte; koşuda sarsıntı hata sınıfına girerHayır
Unitree B2Jetson Orin NX (en fazla 3 modül)UygunHayır: modüllerin belleği tek havuzda birleşmez
Unitree H2 PlusJetson Thor (T5000), 128 GB birleşik bellekUygunBellek yetiyor; hız ve derleme doğrulanmadı
İş istasyonu / sunucu48 GB veya daha fazla belleğe sahip veri merkezi ya da iş istasyonu GPU'suRobot kayıtlarını işlerÖnerilen yol

Pudu'nun servis ve temizlik robotları üreticinin kendi yazılımıyla çalışan ticari ürünler; bu çalışmanın hedeflediği araştırma akışının parçası değiller. Bu robotların sahasında TrackEverything ancak ayrı bir kamerayla çekilen video üzerinden, örneğin insan ve robot trafiğini sonradan incelemek için kullanılabilir.

Robotikte nerede işe yarar?

Proje sayfası robotik bir deney içermiyor; bu bölüm bizim mühendislik okumamız. Yöntemin üç özelliği (tüm noktalar, uzun video, 3B dünya koordinatı) robotikte şu işlere denk geliyor:

  • İnsan videosundan öğrenme: bir insanın masa üstünde yaptığı bir işi kaydedip nesnelerin ve elin 3B yörüngesini çıkarmak. Nokta izini politika girdisi olarak kullanan çalışmalar (örneğin ATM ve Track2Act) bu tür izlerle besleniyor; tüm noktaları ve sonradan görünen yüzeyleri de izleyen bir takipçi, bu hattın veri tarafını zenginleştirir.
  • Robot veri kümelerini zenginleştirme: G1 ile unitree_lerobot akışında toplanan teleoperasyon kayıtlarına yoğun 3B hareket etiketi eklemek. Etiket elle değil, kayıttan sonra otomatik üretiliyor.
  • Dinamik sahne ayrımı: statik/dinamik sınıflandırma, bir kayıtta neyin sabit neyin hareketli olduğunu ayırıyor. Bu, SLAM ile çıkarılan haritalarda hareketli nesneleri temizlemek ya da sahadan dijital ikiz kurmak için sonradan kullanılabilir.
  • Uzun kayıt analizi: devriye veya saha denetimi videolarında, dakikalar süren bir kayıtta hangi nesnenin nereye taşındığını görmek.

Sınırlar ve açık sorular

  • Kod henüz yok. Proje sayfası ve GitHub deposu "yakında" diyor. Bu sayfanın yazıldığı 25 Eylül 2026 itibarıyla ağırlıklar ve eğitim kodu yayımlanmadı.
  • Lisans belli değil. Kod yayımlanana kadar ticari kullanım koşulları bilinmiyor. Meta ve üniversite ortaklı çalışmalar zaman zaman ticari olmayan lisansla yayımlanıyor; bir ürüne gömmeden önce lisans dosyasını okuyun.
  • Hata durumları robot sahalarıyla örtüşüyor. Hızlı hareket ve dokusuz ya da tekrarlı arka plan, depo ve koridor gibi tipik robot ortamlarında sık görülüyor. Kendi sahanızda küçük bir deneme yapmadan performans varsaymayın.
  • Gerçek zaman değil. Kontrol döngüsü için tasarlanmadı; hız verisi yayımlanmadı.

Türkiye'deki ekipler için öneri

Bu tür yöntemleri denemek isteyen bir laboratuvarın ihtiyacı iki parçalı: iyi video üreten, geliştirici erişimi açık bir robot ve 40 GB bütçesini karşılayan bir GPU. Robot tarafında G1 EDU kafa hareketli bir insansı bakış açısı ve derinlik kamerası, Go2 EDU ise daha düşük bütçeli bir hareketli kamera platformu sunar. Modeli robotun üstünde denemek isteyen ekipler için 128 GB belleğiyle H2 Plus tek aday, ama bu kullanım henüz doğrulanmış değil.

Kod yayımlanana kadar yapılabilecek en verimli iş, kendi sahanızdan kayıt biriktirmek: hazır olduğunda doğrudan kendi verinizle deneyebilirsiniz. Üniversite alımlarında BAP ve TÜBİTAK süreçleri için kurumsal alım rehberimize bakın.

Robotlar.org notu

TrackEverything, Carnegie Mellon Üniversitesi ve Meta araştırmacılarının bağımsız akademik çalışmasıdır; Robotlar.org'un çalışmayla veya yazarlarıyla bir bağı yoktur ve makaledeki sonuçlar burada yeniden üretilmemiştir. Uyumluluk tablosu, yazarların verdiği bellek bütçesi ile üreticilerin yayımladığı donanım değerlerinin karşılaştırmasıdır. Robotlar.org Unitree Robotics'in Türkiye partneridir; platform seçimi ve araştırma konfigürasyonu için bize ulaşın. Kaynaklar: proje sayfası, arXiv:2609.30222 ve GitHub deposu.

Size Özel Çözüm Sunalım

Robotik sistem maliyetleri; seçilen donanım platformu, ilave sensör/yük konfigürasyonları ve sahanıza özel entegrasyon senaryolarına göre optimize edilmektedir. İhtiyaçlarınızı paylaşın, uzman mühendislik ekibimiz kurumunuza özel fizibilite raporu ve proforma teklifi oluştursun.