Segmentasyon Modelleri
Segmentasyon için en iyi AI modellerini keşfet
Segment Anything 2 (SAM 2)
Segment Anything 2 (SAM 2), Meta AI tarafından geliştirilen ve görüntü ile video segmentasyonunu streaming bellek modülüyle güçlendirilmiş tek bir Transformer tabanlı mimaride birleştiren evrensel bir segmentasyon modelidir. Orijinal SAM'in çığır açıcı başarısını video alanına taşıyan SAM 2, kullanıcıların tek bir karede nokta, sınırlayıcı kutu veya maske gibi basit promptlar sağlayarak herhangi bir nesneyi video kareleri boyunca segmente etmesine olanak tanır. Model, bellek dikkat mekanizması sayesinde segmentasyonu tüm video boyunca otomatik olarak yayar ve oklüzyonlar ile nesne yeniden görünmeleri sırasında bile zamansal tutarlılığı korur. Yaklaşık 300 milyon parametreyle SAM 2, çeşitli segmentasyon kıyaslamalarında son teknoloji doğruluk sunarken gerçek zamanlı performans sağlar. Mimari, hem görüntüleri hem de tek tek video karelerini paylaşımlı bir görüntü kodlayıcı aracılığıyla işleyerek statik ve dinamik içerik için çok yönlü bir çözüm sunar. SAM 2, 50.000 video üzerinde 600.000'den fazla masklet açıklaması içeren bugüne kadarki en büyük video segmentasyon veri seti olan SA-V üzerinde eğitilmiştir. Apache 2.0 lisansı altında yayınlanan model tamamen açık kaynaklıdır ve önceden eğitilmiş ağırlıklarla GitHub üzerinden erişilebilir. Video düzenleme, görsel efektler, otonom sürüş algısı, tıbbi görüntüleme, artırılmış gerçeklik ve robotik gibi geniş bir uygulama yelpazesine hizmet eder.
GroundingDINO
Grounding DINO, IDEA Research tarafından geliştirilen ve doğal dil metin açıklamalarına dayalı olarak bir görüntüdeki herhangi bir nesneyi bulan ve tanımlayan güçlü bir açık küme nesne algılama modelidir. Sabit kategori algılamadan dile dayalı görsel anlamaya doğru bir paradigma değişimini temsil eder. 172 milyon parametresiyle model, DINO algılama mimarisini metin grounding yetenekleriyle birleştirerek eğitim sırasında hiç görülmemiş nesneleri basitçe kelimelerle tanımlayarak algılamayı mümkün kılar. COCO'nun 80 sınıfı gibi sabit kategoriler üzerinde eğitilmiş geleneksel nesne algılayıcılardan farklı olarak Grounding DINO, 'raftaki kırmızı ayakkabılar' veya 'binadaki çatlamış pencere' gibi serbest biçimli metin sorguları kabul ederek rastgele nesneleri, parçaları, malzemeleri veya görsel kavramları bulabilir. Mimari, çapraz modalite dikkat katmanları aracılığıyla görüntü kodlayıcıdan görsel özellikleri metin kodlayıcıdan metinsel özelliklerle birleştirir ve görsel bölgeleri semantik açıklamalarıyla hizalamayı öğrenir. Grounding DINO, sıfır atış nesne algılama kıyaslamalarında son teknoloji sonuçlar elde eder ve SAM (Segment Anything Model) ile birleştirildiğinde herhangi bir görsel kavramın metin güdümlü segmentasyonu için güçlü bir boru hattı oluşturur. Apache 2.0 lisansı altında tamamen açık kaynaklı olan model, bilgisayarlı görü araştırma ve üretim sistemlerinde yaygın olarak kullanılır. Temel uygulamalar arasında otomatik görüntü açıklama ve etiketleme, görsel arama motorları, sözlü komutları anlayan robotik manipülasyon sistemleri, içerik moderasyon sistemleri ve görüntü içeriklerini tanımlayan erişilebilirlik araçları yer alır.