YOLOv10 icon

YOLOv10

Açık Kaynak
4.7
Tsinghua University

YOLOv10, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen YOLO (You Only Look Once) gerçek zamanlı nesne algılama serisinin onuncu büyük iterasyonudur. Model, önceki tüm YOLO sürümlerinde bulunan son işleme darboğazını ortadan kaldıran, NMS gerektirmeyen (Non-Maximum Suppression free) temelden yeniden tasarlanmış bir mimari sunarak tutarlı gecikme ile gerçek uçtan uca nesne algılama sağlar. YOLOv10, eğitim sırasında bire-çok ve bire-bir etiket atamalarını birleştiren çift atama eğitim stratejisi kullanır ve gereksiz tahminler olmadan verimli çıkarım sürdürürken zengin denetim sinyalleri elde eder. Geliştirilmiş özellik birleştirmeli CSPNet omurgası üzerine inşa edilen model, Nano'dan (8M parametre) Ekstra Büyük'e (68M parametre) kadar altı ölçek varyantında sunularak uç cihazlar, mobil platformlar ve yüksek performanslı sunucularda dağıtıma olanak tanır. Her varyant hedef donanım profili için optimize edilmiştir ve kendi sınıfında en iyi doğruluk-gecikme dengesini sunar. YOLOv10, COCO kıyaslamasında son teknoloji performans elde ederek önceki YOLO sürümlerini ve RT-DETR gibi rakip modelleri önemli ölçüde düşük hesaplama maliyetiyle geride bırakır. AGPL-3.0 lisansı altında açık kaynak olarak yayınlanan model, eğitim, doğrulama ve dağıtım için Ultralytics ekosistemiyle sorunsuz entegre olur. Otonom sürüş, endüstriyel kalite kontrol, güvenlik gözetleme, perakende analitik ve robotik gibi alanlarda yaygın olarak kullanılır.

Nesne Algılama

Öne Çıkan Özellikler

NMS-Free Algilama

Non-Maximum Suppression gerektirmeden dogrudan nesne algilama ile daha hizli ve verimli inference

Gercek Zamanli Performans

Milisaniyeler icinde nesne algilama yapabilen, gercek zamanli uygulamalar icin optimize edilmis mimari

Olceklenebilir Model Ailesi

Nano'dan Extra-Large'a kadar farkli boyutlarda modeller sunarak farkli donanim ihtiyaclarina uyum

Ustun Dogruluk-Hiz Dengesi

Onceki YOLO versiyonlarina gore daha az hesaplama ile ayni veya daha yuksek dogruluk elde eder

Hakkında

YOLOv10, gerçek zamanlı nesne algılama alanındaki YOLO (You Only Look Once) serisinin onuncu büyük sürümüdür. Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen bu model, NMS-free (Non-Maximum Suppression gerektirmeyen) mimarisiyle önceki sürümlerden temelden ayrılır ve hem hız hem doğruluk açısından yeni standartlar belirler. YOLO serisinin on yılı aşan evriminde, YOLOv10 gerçek anlamda uçtan uca nesne algılama sunarak mimarinin olgunlaşmasında kritik bir dönüm noktasını temsil eder ve önceki sürümlerin mimari sınırlamalarını aşar.

NMS'nin kaldırılması, YOLOv10'un en önemli yeniliklerinden biridir. Geleneksel nesne algılama modellerinde, çakışan tespit kutularını filtrelemek için kullanılan NMS adımı ek gecikme yaratır ve uçtan uca eğitimi zorlaştırır. YOLOv10, tutarlı ikili atama stratejisi (consistent dual assignment) ile bu adımı tamamen ortadan kaldırarak, gerçek anlamda uçtan uca nesne algılama sunar. Bu yenilik, eğitim sürecini sadeleştirirken çıkarım hızını da önemli ölçüde artırır ve son işleme adımlarından kaynaklanan gecikmeleri tamamen ortadan kaldırır. Eğitim ve çıkarım arasındaki tutarsızlık sorununu çözerek daha kararlı ve öngörülebilir performans sağlar.

Model, Nano'dan Extra-Large'a kadar altı farklı boyutta sunulur: YOLOv10-N, S, M, B, L ve X. Bu çeşitlilik, mobil cihazlardaki gerçek zamanlı uygulamalardan sunucu taraflı yüksek doğruluklu analizlere kadar her senaryo için uygun bir seçenek sunar. En küçük varyant saniyede 100+ kare işleyebilirken, en büyük varyant COCO veri kümesinde en yüksek doğruluğu yakalar. Nano ve Small varyantlar, gömülü sistemler ve IoT cihazları için optimize edilmişken, Large ve Extra-Large varyantlar maksimum doğruluk gerektiren sunucu uygulamaları için tasarlanmıştır. Bu geniş model yelpazesi, tek bir mimari aileden tüm dağıtım hedeflerinin karşılanmasını mümkün kılar.

Mimari olarak YOLOv10, gelişmiş bir omurga ağı, özellik piramit ağı (FPN) ve çift etiket atama stratejisi içerir. Eğitim sırasında hem bire bir hem de bire çok etiket atama kullanılır: bire çok atama zengin denetim sinyali sağlarken, bire bir atama NMS'ye ihtiyaç duymadan doğrudan sonuç üretir. Bu ikili strateji, eğitim verimliliğini artırırken çıkarım basitliğini korur. Ayrıca büyük çekirdekli konvolüsyon ve kendi kendine dikkat mekanizmaları, modelin geniş alıcı alanı gerektiren nesneleri daha iyi algılamasını sağlar. Verimli kanal genişletme ve kısmi kendi kendine dikkat mekanizmaları, hesaplama maliyetini kontrol altında tutar.

Otonom sürüş, güvenlik kamerası analizi, endüstriyel denetim, perakende sayım ve spor analitiği gibi alanlarda yaygın olarak kullanılmaktadır. Trafik yönetiminde araç ve yaya tespiti, üretim hatlarında kalite kontrol ve kusur algılama, perakende mağazalarda envanter yönetimi ve raf takibi, spor müsabakalarında oyuncu takibi ve hareket analizi gibi çeşitli gerçek dünya uygulamalarında tercih edilmektedir. Drone ve insansız hava araçlarında gerçek zamanlı nesne algılama için de sıklıkla kullanılır.

PyTorch ve ONNX formatlarında kullanılabilir ve edge cihazlara kolayca dağıtılabilir. TensorRT optimizasyonu ile NVIDIA GPU'larda maksimum performans elde edilir. OpenVINO desteği Intel donanımlarında verimli çalışma sağlar. CoreML dönüşümü ile iOS cihazlarda, TFLite ile Android cihazlarda doğrudan çalıştırılabilir. Ultralytics kütüphanesi aracılığıyla eğitim, değerlendirme ve dağıtım süreçleri standartlaştırılmıştır ve bu geniş platform desteği YOLOv10'u buluttan uca kadar her ortamda kullanılabilir hale getirir.

Güvenlik ve savunma alanında YOLOv10, gerçek zamanlı tehdit tespiti ve izleme sistemleri için kullanılmaktadır. Tarım sektöründe drone görüntülerinden bitki sağlığı analizi, zararlı böcek tespiti ve mahsul sayımı gibi uygulamalar için adapte edilmiştir. Sağlık alanında ise tıbbi görüntülerden anomali tespiti ve cerrahi alet takibi gibi özel kullanım durumlarında ince ayar yapılarak uygulanmaktadır. Bu geniş uygulama yelpazesi, YOLOv10'un genel amaçlı nesne algılama alanındaki üstünlüğünü kanıtlamaktadır.

Kullanım Senaryoları

1

Guvenlik Kamerasi Analizi

Guvenlik kamerasi goruntuleinde gercek zamanli insan, arac ve nesne algilama ve takip sistemi

2

Otonom Suruş

Arac, yaya, trafik isareti ve engel algilama icin gercek zamanli nesne tanima sistemi

3

Kalite Kontrol

Uretim hatlarinda kusurlu urunlerin otomatik algilanmasi icin gorsel denetim sistemi

4

Perakende Analitigi

Magaza icinde musteri hareketleri, raf durumu ve urun yerlesimi analizi icin gorsel algilama

Artılar ve Eksiler

Artılar

  • NMS-free (Non-Maximum Suppression olmadan) yaklaşımı ile post-processing hızında önemli avantaj
  • YOLOv8'e kıyasla daha az parametre ve FLOP ile daha yüksek mAPval; %25 daha az parametre ve %46 daha düşük gecikme
  • Küçük nesne tespitinde belirgin avantaj; parametreleri daha verimli kullanır
  • Kalabalık sahne analizi ve düşük güçlü edge cihazlara dağıtım için özellikle uygun
  • 120+ fps'ye kadar gerçek zamanlı performans ile anlık nesne tespiti

Eksiler

  • Bazı veri setlerinde daha küçük boyutuna rağmen YOLOv8'den önemli ölçüde düşük doğruluk gösterebilir
  • YOLOv8'in sunduğu instance segmentasyon, poz tahmini ve OBB gibi çoklu görev desteğinden yoksun
  • YOLOv8'in devasa açık kaynak topluluğu ve kapsamlı belgelendirmesine kıyasla daha az olgun ekosistem
  • Performans kullanım durumuna göre değişir; her senaryoda üstünlük garantisi yoktur

Teknik Detaylar

Parametre

8M-68M

Mimari

CNN (CSPNet backbone)

Eğitim Verisi

COCO

Lisans

AGPL-3.0

Özellikler

  • NMS-ücretsiz Detection
  • Gerçek zamanlı Inference
  • Scalable Architecture
  • Multi-Size Models
  • ONNX dışa aktarma
  • Edge Deployment

Benchmark Sonuçları

MetrikDeğerKarşılaştırmaKaynak
mAP (COCO val, YOLOv10-X)54.4%YOLOv9-E: 55.6%, YOLOv8-X: 53.9%YOLOv10 Paper (Tsinghua, 2024)
Hız (T4 GPU, YOLOv10-S)2.49ms (FP16)YOLOv8-S: 4.03msYOLOv10 Paper (Tsinghua, 2024)
Parametre Sayısı (YOLOv10-S)7.2MYOLOv8-S: 11.2MYOLOv10 Paper (Tsinghua, 2024)
Desteklenen Sınıf Sayısı (COCO)80 sınıfCOCO Dataset / YOLOv10 GitHub

Mevcut Platformlar

GitHub
HuggingFace
Ultralytics

Sıkça Sorulan Sorular

İlgili Modeller

GroundingDINO icon

GroundingDINO

IDEA Research|172M

Grounding DINO, IDEA Research tarafından geliştirilen ve doğal dil metin açıklamalarına dayalı olarak bir görüntüdeki herhangi bir nesneyi bulan ve tanımlayan güçlü bir açık küme nesne algılama modelidir. Sabit kategori algılamadan dile dayalı görsel anlamaya doğru bir paradigma değişimini temsil eder. 172 milyon parametresiyle model, DINO algılama mimarisini metin grounding yetenekleriyle birleştirerek eğitim sırasında hiç görülmemiş nesneleri basitçe kelimelerle tanımlayarak algılamayı mümkün kılar. COCO'nun 80 sınıfı gibi sabit kategoriler üzerinde eğitilmiş geleneksel nesne algılayıcılardan farklı olarak Grounding DINO, 'raftaki kırmızı ayakkabılar' veya 'binadaki çatlamış pencere' gibi serbest biçimli metin sorguları kabul ederek rastgele nesneleri, parçaları, malzemeleri veya görsel kavramları bulabilir. Mimari, çapraz modalite dikkat katmanları aracılığıyla görüntü kodlayıcıdan görsel özellikleri metin kodlayıcıdan metinsel özelliklerle birleştirir ve görsel bölgeleri semantik açıklamalarıyla hizalamayı öğrenir. Grounding DINO, sıfır atış nesne algılama kıyaslamalarında son teknoloji sonuçlar elde eder ve SAM (Segment Anything Model) ile birleştirildiğinde herhangi bir görsel kavramın metin güdümlü segmentasyonu için güçlü bir boru hattı oluşturur. Apache 2.0 lisansı altında tamamen açık kaynaklı olan model, bilgisayarlı görü araştırma ve üretim sistemlerinde yaygın olarak kullanılır. Temel uygulamalar arasında otomatik görüntü açıklama ve etiketleme, görsel arama motorları, sözlü komutları anlayan robotik manipülasyon sistemleri, içerik moderasyon sistemleri ve görüntü içeriklerini tanımlayan erişilebilirlik araçları yer alır.

Açık Kaynak
4.6

Hızlı Bilgi

Parametre8M-68M
TipCNN
LisansAGPL-3.0
Yayınlanma2024-05
MimariCNN (CSPNet backbone)
Versiyon10
Puan4.7 / 5
GeliştiriciTsinghua University

Bağlantılar

Etiketler

yolo
object-detection
real-time
edge
Siteyi Ziyaret Et