YOLOv10
YOLOv10, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen YOLO (You Only Look Once) gerçek zamanlı nesne algılama serisinin onuncu büyük iterasyonudur. Model, önceki tüm YOLO sürümlerinde bulunan son işleme darboğazını ortadan kaldıran, NMS gerektirmeyen (Non-Maximum Suppression free) temelden yeniden tasarlanmış bir mimari sunarak tutarlı gecikme ile gerçek uçtan uca nesne algılama sağlar. YOLOv10, eğitim sırasında bire-çok ve bire-bir etiket atamalarını birleştiren çift atama eğitim stratejisi kullanır ve gereksiz tahminler olmadan verimli çıkarım sürdürürken zengin denetim sinyalleri elde eder. Geliştirilmiş özellik birleştirmeli CSPNet omurgası üzerine inşa edilen model, Nano'dan (8M parametre) Ekstra Büyük'e (68M parametre) kadar altı ölçek varyantında sunularak uç cihazlar, mobil platformlar ve yüksek performanslı sunucularda dağıtıma olanak tanır. Her varyant hedef donanım profili için optimize edilmiştir ve kendi sınıfında en iyi doğruluk-gecikme dengesini sunar. YOLOv10, COCO kıyaslamasında son teknoloji performans elde ederek önceki YOLO sürümlerini ve RT-DETR gibi rakip modelleri önemli ölçüde düşük hesaplama maliyetiyle geride bırakır. AGPL-3.0 lisansı altında açık kaynak olarak yayınlanan model, eğitim, doğrulama ve dağıtım için Ultralytics ekosistemiyle sorunsuz entegre olur. Otonom sürüş, endüstriyel kalite kontrol, güvenlik gözetleme, perakende analitik ve robotik gibi alanlarda yaygın olarak kullanılır.
Öne Çıkan Özellikler
NMS-Free Algilama
Non-Maximum Suppression gerektirmeden dogrudan nesne algilama ile daha hizli ve verimli inference
Gercek Zamanli Performans
Milisaniyeler icinde nesne algilama yapabilen, gercek zamanli uygulamalar icin optimize edilmis mimari
Olceklenebilir Model Ailesi
Nano'dan Extra-Large'a kadar farkli boyutlarda modeller sunarak farkli donanim ihtiyaclarina uyum
Ustun Dogruluk-Hiz Dengesi
Onceki YOLO versiyonlarina gore daha az hesaplama ile ayni veya daha yuksek dogruluk elde eder
Hakkında
YOLOv10, gerçek zamanlı nesne algılama alanındaki YOLO (You Only Look Once) serisinin onuncu büyük sürümüdür. Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen bu model, NMS-free (Non-Maximum Suppression gerektirmeyen) mimarisiyle önceki sürümlerden temelden ayrılır ve hem hız hem doğruluk açısından yeni standartlar belirler. YOLO serisinin on yılı aşan evriminde, YOLOv10 gerçek anlamda uçtan uca nesne algılama sunarak mimarinin olgunlaşmasında kritik bir dönüm noktasını temsil eder ve önceki sürümlerin mimari sınırlamalarını aşar.
NMS'nin kaldırılması, YOLOv10'un en önemli yeniliklerinden biridir. Geleneksel nesne algılama modellerinde, çakışan tespit kutularını filtrelemek için kullanılan NMS adımı ek gecikme yaratır ve uçtan uca eğitimi zorlaştırır. YOLOv10, tutarlı ikili atama stratejisi (consistent dual assignment) ile bu adımı tamamen ortadan kaldırarak, gerçek anlamda uçtan uca nesne algılama sunar. Bu yenilik, eğitim sürecini sadeleştirirken çıkarım hızını da önemli ölçüde artırır ve son işleme adımlarından kaynaklanan gecikmeleri tamamen ortadan kaldırır. Eğitim ve çıkarım arasındaki tutarsızlık sorununu çözerek daha kararlı ve öngörülebilir performans sağlar.
Model, Nano'dan Extra-Large'a kadar altı farklı boyutta sunulur: YOLOv10-N, S, M, B, L ve X. Bu çeşitlilik, mobil cihazlardaki gerçek zamanlı uygulamalardan sunucu taraflı yüksek doğruluklu analizlere kadar her senaryo için uygun bir seçenek sunar. En küçük varyant saniyede 100+ kare işleyebilirken, en büyük varyant COCO veri kümesinde en yüksek doğruluğu yakalar. Nano ve Small varyantlar, gömülü sistemler ve IoT cihazları için optimize edilmişken, Large ve Extra-Large varyantlar maksimum doğruluk gerektiren sunucu uygulamaları için tasarlanmıştır. Bu geniş model yelpazesi, tek bir mimari aileden tüm dağıtım hedeflerinin karşılanmasını mümkün kılar.
Mimari olarak YOLOv10, gelişmiş bir omurga ağı, özellik piramit ağı (FPN) ve çift etiket atama stratejisi içerir. Eğitim sırasında hem bire bir hem de bire çok etiket atama kullanılır: bire çok atama zengin denetim sinyali sağlarken, bire bir atama NMS'ye ihtiyaç duymadan doğrudan sonuç üretir. Bu ikili strateji, eğitim verimliliğini artırırken çıkarım basitliğini korur. Ayrıca büyük çekirdekli konvolüsyon ve kendi kendine dikkat mekanizmaları, modelin geniş alıcı alanı gerektiren nesneleri daha iyi algılamasını sağlar. Verimli kanal genişletme ve kısmi kendi kendine dikkat mekanizmaları, hesaplama maliyetini kontrol altında tutar.
Otonom sürüş, güvenlik kamerası analizi, endüstriyel denetim, perakende sayım ve spor analitiği gibi alanlarda yaygın olarak kullanılmaktadır. Trafik yönetiminde araç ve yaya tespiti, üretim hatlarında kalite kontrol ve kusur algılama, perakende mağazalarda envanter yönetimi ve raf takibi, spor müsabakalarında oyuncu takibi ve hareket analizi gibi çeşitli gerçek dünya uygulamalarında tercih edilmektedir. Drone ve insansız hava araçlarında gerçek zamanlı nesne algılama için de sıklıkla kullanılır.
PyTorch ve ONNX formatlarında kullanılabilir ve edge cihazlara kolayca dağıtılabilir. TensorRT optimizasyonu ile NVIDIA GPU'larda maksimum performans elde edilir. OpenVINO desteği Intel donanımlarında verimli çalışma sağlar. CoreML dönüşümü ile iOS cihazlarda, TFLite ile Android cihazlarda doğrudan çalıştırılabilir. Ultralytics kütüphanesi aracılığıyla eğitim, değerlendirme ve dağıtım süreçleri standartlaştırılmıştır ve bu geniş platform desteği YOLOv10'u buluttan uca kadar her ortamda kullanılabilir hale getirir.
Güvenlik ve savunma alanında YOLOv10, gerçek zamanlı tehdit tespiti ve izleme sistemleri için kullanılmaktadır. Tarım sektöründe drone görüntülerinden bitki sağlığı analizi, zararlı böcek tespiti ve mahsul sayımı gibi uygulamalar için adapte edilmiştir. Sağlık alanında ise tıbbi görüntülerden anomali tespiti ve cerrahi alet takibi gibi özel kullanım durumlarında ince ayar yapılarak uygulanmaktadır. Bu geniş uygulama yelpazesi, YOLOv10'un genel amaçlı nesne algılama alanındaki üstünlüğünü kanıtlamaktadır.
Kullanım Senaryoları
Guvenlik Kamerasi Analizi
Guvenlik kamerasi goruntuleinde gercek zamanli insan, arac ve nesne algilama ve takip sistemi
Otonom Suruş
Arac, yaya, trafik isareti ve engel algilama icin gercek zamanli nesne tanima sistemi
Kalite Kontrol
Uretim hatlarinda kusurlu urunlerin otomatik algilanmasi icin gorsel denetim sistemi
Perakende Analitigi
Magaza icinde musteri hareketleri, raf durumu ve urun yerlesimi analizi icin gorsel algilama
Artılar ve Eksiler
Artılar
- NMS-free (Non-Maximum Suppression olmadan) yaklaşımı ile post-processing hızında önemli avantaj
- YOLOv8'e kıyasla daha az parametre ve FLOP ile daha yüksek mAPval; %25 daha az parametre ve %46 daha düşük gecikme
- Küçük nesne tespitinde belirgin avantaj; parametreleri daha verimli kullanır
- Kalabalık sahne analizi ve düşük güçlü edge cihazlara dağıtım için özellikle uygun
- 120+ fps'ye kadar gerçek zamanlı performans ile anlık nesne tespiti
Eksiler
- Bazı veri setlerinde daha küçük boyutuna rağmen YOLOv8'den önemli ölçüde düşük doğruluk gösterebilir
- YOLOv8'in sunduğu instance segmentasyon, poz tahmini ve OBB gibi çoklu görev desteğinden yoksun
- YOLOv8'in devasa açık kaynak topluluğu ve kapsamlı belgelendirmesine kıyasla daha az olgun ekosistem
- Performans kullanım durumuna göre değişir; her senaryoda üstünlük garantisi yoktur
Teknik Detaylar
Parametre
8M-68M
Mimari
CNN (CSPNet backbone)
Eğitim Verisi
COCO
Lisans
AGPL-3.0
Özellikler
- NMS-ücretsiz Detection
- Gerçek zamanlı Inference
- Scalable Architecture
- Multi-Size Models
- ONNX dışa aktarma
- Edge Deployment
Benchmark Sonuçları
| Metrik | Değer | Karşılaştırma | Kaynak |
|---|---|---|---|
| mAP (COCO val, YOLOv10-X) | 54.4% | YOLOv9-E: 55.6%, YOLOv8-X: 53.9% | YOLOv10 Paper (Tsinghua, 2024) |
| Hız (T4 GPU, YOLOv10-S) | 2.49ms (FP16) | YOLOv8-S: 4.03ms | YOLOv10 Paper (Tsinghua, 2024) |
| Parametre Sayısı (YOLOv10-S) | 7.2M | YOLOv8-S: 11.2M | YOLOv10 Paper (Tsinghua, 2024) |
| Desteklenen Sınıf Sayısı (COCO) | 80 sınıf | — | COCO Dataset / YOLOv10 GitHub |