Nesne Algılama Modelleri

Nesne Algılama için en iyi AI modellerini keşfet

2 model bulundu
YOLOv10 icon

YOLOv10

Tsinghua University|8M-68M

YOLOv10, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen YOLO (You Only Look Once) gerçek zamanlı nesne algılama serisinin onuncu büyük iterasyonudur. Model, önceki tüm YOLO sürümlerinde bulunan son işleme darboğazını ortadan kaldıran, NMS gerektirmeyen (Non-Maximum Suppression free) temelden yeniden tasarlanmış bir mimari sunarak tutarlı gecikme ile gerçek uçtan uca nesne algılama sağlar. YOLOv10, eğitim sırasında bire-çok ve bire-bir etiket atamalarını birleştiren çift atama eğitim stratejisi kullanır ve gereksiz tahminler olmadan verimli çıkarım sürdürürken zengin denetim sinyalleri elde eder. Geliştirilmiş özellik birleştirmeli CSPNet omurgası üzerine inşa edilen model, Nano'dan (8M parametre) Ekstra Büyük'e (68M parametre) kadar altı ölçek varyantında sunularak uç cihazlar, mobil platformlar ve yüksek performanslı sunucularda dağıtıma olanak tanır. Her varyant hedef donanım profili için optimize edilmiştir ve kendi sınıfında en iyi doğruluk-gecikme dengesini sunar. YOLOv10, COCO kıyaslamasında son teknoloji performans elde ederek önceki YOLO sürümlerini ve RT-DETR gibi rakip modelleri önemli ölçüde düşük hesaplama maliyetiyle geride bırakır. AGPL-3.0 lisansı altında açık kaynak olarak yayınlanan model, eğitim, doğrulama ve dağıtım için Ultralytics ekosistemiyle sorunsuz entegre olur. Otonom sürüş, endüstriyel kalite kontrol, güvenlik gözetleme, perakende analitik ve robotik gibi alanlarda yaygın olarak kullanılır.

Açık Kaynak
4.7
GroundingDINO icon

GroundingDINO

IDEA Research|172M

Grounding DINO, IDEA Research tarafından geliştirilen ve doğal dil metin açıklamalarına dayalı olarak bir görüntüdeki herhangi bir nesneyi bulan ve tanımlayan güçlü bir açık küme nesne algılama modelidir. Sabit kategori algılamadan dile dayalı görsel anlamaya doğru bir paradigma değişimini temsil eder. 172 milyon parametresiyle model, DINO algılama mimarisini metin grounding yetenekleriyle birleştirerek eğitim sırasında hiç görülmemiş nesneleri basitçe kelimelerle tanımlayarak algılamayı mümkün kılar. COCO'nun 80 sınıfı gibi sabit kategoriler üzerinde eğitilmiş geleneksel nesne algılayıcılardan farklı olarak Grounding DINO, 'raftaki kırmızı ayakkabılar' veya 'binadaki çatlamış pencere' gibi serbest biçimli metin sorguları kabul ederek rastgele nesneleri, parçaları, malzemeleri veya görsel kavramları bulabilir. Mimari, çapraz modalite dikkat katmanları aracılığıyla görüntü kodlayıcıdan görsel özellikleri metin kodlayıcıdan metinsel özelliklerle birleştirir ve görsel bölgeleri semantik açıklamalarıyla hizalamayı öğrenir. Grounding DINO, sıfır atış nesne algılama kıyaslamalarında son teknoloji sonuçlar elde eder ve SAM (Segment Anything Model) ile birleştirildiğinde herhangi bir görsel kavramın metin güdümlü segmentasyonu için güçlü bir boru hattı oluşturur. Apache 2.0 lisansı altında tamamen açık kaynaklı olan model, bilgisayarlı görü araştırma ve üretim sistemlerinde yaygın olarak kullanılır. Temel uygulamalar arasında otomatik görüntü açıklama ve etiketleme, görsel arama motorları, sözlü komutları anlayan robotik manipülasyon sistemleri, içerik moderasyon sistemleri ve görüntü içeriklerini tanımlayan erişilebilirlik araçları yer alır.

Açık Kaynak
4.6