MODNet icon

MODNet

Açık Kaynak
4.3
ZHKKKe

MODNet (Matting Objective Decomposition Network), ZHKKKe tarafından geliştirilen, önceden tanımlanmış trimap veya ek kullanıcı girdisi gerektirmeden gerçek zamanlı insan portresi arka plan kaldırma için tasarlanmış açık kaynaklı bir portre matlama modelidir. Manuel trimap gerektiren geleneksel matlama yaklaşımlarının aksine MODNet, karmaşık matlama hedefini üç alt göreve ayrıştırarak tam otomatik portre matlaması gerçekleştirir: kişi bölgesini tanımlayan anlamsal tahmin, saç ve giysi sınırlarındaki kenar kalitesini iyileştiren detay tahmini ve her iki sinyali yüksek kaliteli alfa matına birleştiren anlamsal-detay füzyonu. Bu ayrıştırma, gerçek zamanlı hızlarda verimli tek geçişli çıkarım sağlayarak gecikmenin kritik olduğu video konferans, canlı yayın ve mobil fotoğrafçılık uygulamaları için pratik kılar. Model, segmentasyon tabanlı yaklaşımlar için zorlayıcı olan saç telleri, kumaş kenarları ve ince sınır detaylarını ele almada güçlü, pürüzsüz ve doğru alfa matlar üretir. Hem görsel hem video girişini destekleyen MODNet, titreşim olmadan kararlı video matlama için zamansal tutarlılık optimizasyonları sunar. Mobil cihazlarda ve kenar donanımda çalışacak kadar hafiftir; ONNX dışa aktarma desteğiyle iOS, Android ve WebAssembly aracılığıyla web tarayıcılarında dağıtım mümkündür. Yaygın uygulamalar video görüşme arka plan değiştirme, portre modu fotoğrafçılık, sosyal medya içerik oluşturma, sanal deneme sistemleri ve film post-prodüksiyonunda yeşil ekran alternatifleridir. Apache 2.0 lisansıyla yayınlanan MODNet, hem araştırma hem üretim portre matlama uygulamalarında yaygın biçimde benimsenmiş ücretsiz ve verimli bir çözüm sunar.

Arka Plan Kaldırma

Öne Çıkan Özellikler

Gercek Zamanli Performans

Modern GPU'da 30+ FPS hizinda video karelerini isleyerek canli uygulamalar icin uygun gercek zamanli matlama

Trimap Gerektirmez

Geleneksel matlamanin aksine kullanicidan trimap girisi gerektirmeden otomatik portre segmentasyonu yapar

Hafif Mimari

Yaklasik 25MB boyutuyla mobil cihazlar ve kaynak kisitli ortamlar icin uygun son derece hafif model

Hedef Ayristirma Stratejisi

Matlama gorevini semantik, detay ve fuzyon alt gorevlerine ayirarak daha iyi performans ve dogruluk saglar

Hakkında

MODNet, trimap girişi gerektirmeden gerçek zamanlı portre matlama için tasarlanmış hafif bir derin öğrenme modelidir. City University of Hong Kong ve SenseTime araştırmacıları tarafından geliştirilen MODNet, matlama görevini aynı anda öğrenilen üç alt hedefe ayrıştırarak verimli ve doğruluklu insan portre segmentasyonu elde eder. Bu yaklaşım, geleneksel matlama yöntemlerinin gerektirdiği karmaşık ön işleme adımlarını ortadan kaldırarak kullanım kolaylığını büyük ölçüde artırmıştır. Trimap oluşturma zorunluluğunun kaldırılması, modeli son kullanıcılar ve otomatik sistemler için çok daha erişilebilir kılmıştır.

Modelin temel yeniliği, hedef ayrıştırma stratejisinde yatmaktadır. MODNet, matlamayı tek bir uçtan uca görev olarak ele almak yerine üç birbirine bağlı alt göreve böler: semantik tahmin (kişinin ne olduğunu anlama), detay tahmini (saç gibi ince kenar detaylarını yakalama) ve semantik-detay füzyonu (her ikisini nihai alfa matte için birleştirme). Bu ayrıştırma, her alt ağın bilgi paylaşırken uzmanlaşmasına olanak tanır ve daha düşük hesaplama maliyetiyle daha iyi genel performans sağlar. Semantik dal kaba sınırları belirlerken, detay dalı piksel düzeyinde kenar hassasiyetini yakalamakta uzmanlaşır. Bu ikili yapı, hız ve kalite arasındaki dengeyi optimal noktada tutar.

MODNet, özellikle portre ve insan segmentasyonu senaryoları için optimize edilmiştir, bu da hedef alanında yüksek kaliteyi korurken son derece hızlı olmasını sağlar. Model, standart donanım üzerinde gerçek zamanlı performans elde eder, modern GPU'da 30+ FPS hızında video kareleri işler ve mobil cihazlarda bile kullanılabilir hızları korur. Yaklaşık 25MB boyutundaki hafif mimarisi, onu kaynak kısıtlı ortamlarda konuşlandırma için pratik kılar. Bu kompakt boyut, özellikle mobil uygulamalar ve tarayıcı tabanlı çözümler için büyük bir avantaj sağlar ve model indirme süresini minimumda tutar.

Model hem görsel hem de video matlamayı destekler ve video uygulamalarında titremeyi azaltan zamansal tutarlılık özellikleri sunar. Video modunda ardışık kareler arasındaki geçişleri düzgünleştiren özel bir zamansal filtreleme mekanizması, profesyonel kalitede video segmentasyonu sağlar. Bu özellik, canlı yayın, video konferans ve gerçek zamanlı içerik üretimi senaryolarında özellikle değerlidir. Kararlı ve tutarlı maske çıktıları, video içeriklerde titreme ve yanıp sönme sorunlarını ortadan kaldırarak izleyici deneyimini iyileştirir.

MODNet, video konferans uygulamalarında sanal arka plan sistemlerinin temelini oluşturmaktadır. Zoom, Teams ve benzeri platformlarda kullanıcıların arka planlarını bulanıklaştırma veya değiştirme özelliği, büyük ölçüde MODNet benzeri hafif matlama modellerine dayanmaktadır. İçerik üretimi alanında, YouTube ve TikTok içerik üreticileri yeşil perde kullanmadan profesyonel arka plan efektleri oluşturmak için bu teknolojiyi kullanır. Fotoğraf düzenleme uygulamaları, portre modunda arka plan bulanıklaştırma ve arka plan değiştirme özellikleri için MODNet'i tercih etmektedir. Ayrıca e-öğrenme platformlarında sunum yapan kişilerin arka planlarının temizlenmesi için de yaygın olarak kullanılmaktadır.

Açık kaynaklı olan MODNet, GitHub'da mevcuttur ve topluluk katkıları PyTorch, ONNX ve mobil konuşlandırma için TensorFlow Lite dahil birden fazla çerçevede yeteneklerini genişletmektedir. WebAssembly desteği sayesinde doğrudan tarayıcıda çalıştırılabilir, bu da sunucu taraflı işleme ihtiyacını ortadan kaldırır ve veri gizliliğini artırır. Modelin eğitim kodu ve veri hazırlama araçları da paylaşılmıştır, araştırmacıların ve geliştiricilerin kendi veri setleriyle özel modeller eğitmesine olanak tanır. Kapsamlı dokümantasyon ve örnek projeler, hızlı başlangıç için güçlü bir temel sağlar.

Kullanım Senaryoları

1

Video Konferans

Zoom, Teams gibi video konferans uygulamalarinda gercek zamanli sanal arka plan degistirme ve bulaniklastirma

2

Mobil Fotograf Uygulamalari

Akilli telefon uygulamalarinda aninda portre modu, arka plan degistirme ve gorsel efektleri

3

Icerik Olusturma

YouTube, TikTok ve sosyal medya icerik ureticileri icin hizli arka plan kaldirma ve degistirme

4

Canli Yayin

Canli yayin platformlarinda gercek zamanli arka plan degistirme ve yesil perde efekti simüle etme

Artılar ve Eksiler

Artılar

  • Gerçek zamanlı portre matting — video akışlarında arka plan kaldırma
  • Trimap gerektirmeden otomatik segmentasyon
  • Hafif model — mobil ve edge cihazlarda çalışabilir
  • Açık kaynak ve araştırma topluluğunda yaygın

Eksiler

  • Yalnızca portre/insan segmentasyonuna odaklı — genel nesne desteği yok
  • Karmaşık saç ve aksesuarlarda kenar kalitesi düşebiliyor
  • Arka plan ile benzer renklerde hatalı segmentasyon
  • Oturarak veya kısmen görünen figürlerde zorluk

Teknik Detaylar

Parametre

N/A

Mimari

Lightweight encoder-decoder with multi-branch optimization (S, D, F branches)

Eğitim Verisi

PPM-100 (portrait matting benchmark) and proprietary video portrait datasets

Lisans

Apache 2.0

Özellikler

  • Gerçek zamanlı Matting
  • Trimap-ücretsiz
  • Objective Decomposition
  • Video destek
  • Mobile Deployment
  • ONNX dışa aktarma

Benchmark Sonuçları

MetrikDeğerKarşılaştırmaKaynak
IoU Score (PPM-100)0.91U2-Net: 0.89MODNet Paper (AAAI 2022)
İşleme Hızı (512x512, GPU)~0.06s (63 FPS)RemBG: ~0.5sMODNet GitHub
Kenar Kalitesi (MAE, PPM-100)0.015MODNet Paper (AAAI 2022)
Parametre Sayısı6.5MSAM: 632MMODNet Paper (AAAI 2022)

Mevcut Platformlar

hugging face
replicate

Sıkça Sorulan Sorular

İlgili Modeller

Segment Anything (SAM) icon

Segment Anything (SAM)

Meta|636M

Segment Anything Model (SAM), Meta AI'nin noktalar, sınırlayıcı kutular, maskeler veya metin açıklamaları dahil giriş promptlarına dayalı olarak herhangi bir görseldeki herhangi bir nesneyi segmente etmek için tasarlanmış yönlendirilebilir görsel segmentasyon temel modelidir. Nisan 2023'te 11 milyon görselden 1 milyardan fazla maske içeren SA-1B veri setiyle birlikte yayınlanan SAM, göreve özel ince ayar gerektirmeden çeşitli görevleri ele alan genel amaçlı segmentasyon modeli oluşturur. Mimari üç bileşenden oluşur: giriş görsellerini gömmelere işleyen Vision Transformer görsel kodlayıcı, farklı prompt türlerini ele alan esnek prompt kodlayıcı ve gerçek zamanlı segmentasyon maskeleri üreten hafif maske çözücü. SAM'ın sıfır atışlı aktarım yeteneği, eğitim sırasında görmediği nesneleri segmente edebileceği anlamına gelir ve onu tıbbi görüntülemeden uydu fotoğrafçılığına, yaratıcı içerik düzenlemeye kadar her görsel alana uygulanabilir kılar. Model, görseldeki her şeyi segmente eden otomatik maske üretimi, hassas nesne seçimi için etkileşimli nokta tabanlı segmentasyon ve bölge hedefleme için kutu yönlendirmeli segmentasyonu destekler. SAM, video desteğiyle SAM 2, kenar dağıtımı için EfficientSAM ve daha hızlı çıkarım için FastSAM dahil türev çalışmalara ilham vermiştir. Uygulamalar arka plan kaldırma, tıbbi görsel açıklama, otonom sürüş algısı, tarımsal izleme, CBS haritalama ve etkileşimli düzenleme araçlarını kapsar. Apache 2.0 lisansıyla tamamen açık kaynaklı olan SAM, PyTorch implementasyonları ve Meta'nın depolarından ücretsiz erişilebilir modelleriyle segmentasyon yaklaşımını temelden değiştiren en etkili bilgisayar görüşü modellerinden biri haline gelmiştir.

Açık Kaynak
4.8
RemBG icon

RemBG

Daniel Gatis|N/A

RemBG, Daniel Gatis tarafından geliştirilen, görsellerden otomatik arka plan kaldırma için basit ve verimli bir çözüm sunan, manuel seçim veya profesyonel düzenleme becerisi gerektirmeden ön plan öğelerini izole eden popüler bir açık kaynak araçtır. Araç, genel nesneler, insan figürleri, anime karakterleri ve kıyafetler gibi farklı kullanım alanları için optimize edilmiş U2-Net, IS-Net, SAM ve çeşitli özelleşmiş varyantlar dahil birden fazla önceden eğitilmiş segmentasyon modelinden yararlanır. RemBG, anlamsal segmentasyon uygulayarak ön plan öğelerini belirler ve öğeleri arka planlarından temiz biçimde ayıran hassas alfa mat maskeleri üreterek hemen kullanıma hazır şeffaf PNG çıktıları oluşturur. Uçuşan saçlar, yarı saydam kumaşlar, ince takılar ve düzensiz sınırlara sahip nesneler gibi karmaşık kenar durumlarını başarıyla ele alır. Pip ile kurulabilen Python kütüphanesi, toplu işleme için komut satırı arayüzü ve üretim dağıtımı için API entegrasyonları olarak sunulur. Verileri harici sunuculara göndermeden yerel olarak işleyebildiğinden gizlilik duyarlı uygulamalar için uygundur. Yaygın kullanım alanları e-ticaret ürün fotoğrafı hazırlama, sosyal medya içerik oluşturma, vesikalık fotoğraf işleme, grafik tasarım kompozitleme, emlak fotoğrafçılığı ve pazarlama materyali oluşturmadır. JPEG, PNG ve WebP formatlarını destekler ve tekli görseller ile toplu dizin işleme yapabilir. GitHub'da milyonlarca indirmeyle en çok yıldız alan arka plan kaldırma depolarından biri olan RemBG, MIT lisansıyla ücretli servislere ücretsiz ve ticari olarak uygulanabilir bir alternatif sunar.

Açık Kaynak
4.6
BRIA RMBG icon

BRIA RMBG

BRIA AI|N/A

BRIA RMBG, sorumlu ve ticari olarak lisanslı üretken yapay zeka çözümlerinde uzmanlaşmış İsrailli startup BRIA AI tarafından geliştirilen son teknoloji arka plan kaldırma modelidir. Model, ince saç detayları, saydam nesneler, karmaşık kenarlar, duman ve cam dahil zorlu senaryoları dikkat çekici hassasiyetle ele alarak ön plan öğelerini arka planlardan olağanüstü doğrulukla ayırır. BRIA RMBG, münhasıran lisanslı ve etik olarak temin edilmiş veriler üzerinde eğitilmiş tescilli bir mimari üzerine inşa edilmiştir ve internet'ten toplanan verilerle eğitilen modellerden farklılaşarak tam ticari güvenlik ve fikri mülkiyet uyumluluğu sağlar. İnce kenar detaylarını ve doğal saydamlık gradyanlarını koruyan yüksek kaliteli alfa matlar üreterek profesyonel iş akışlarına uygun temiz kesimler sağlar. RMBG 1.4 ve RMBG 2.0 sürümlerinde sunulan model, DIS5K ve HRS10K dahil arka plan kaldırma benchmark'larında sürekli en iyi performans gösterenler arasında yer alır. Hem araştırma hem ticari kullanım için izin verici lisansla Hugging Face üzerinden ve BRIA'nın ölçeklenebilir bulut işleme sunan ticari API platformu aracılığıyla erişilebilir. Python SDK, REST API ve popüler görsel işleme pipeline'larıyla uyumluluk dahil entegrasyon seçenekleri mevcuttur. Uygulamalar e-ticaret ürün fotoğrafçılığı, grafik tasarım kompozitleme, video konferans sanal arka planları, otomotiv ve emlak fotoğrafçılığı, sosyal medya içerik oluşturma ve belge sayısallaştırmayı kapsar. Modern GPU'larda milisaniyeler içinde işlem yapan model, gerçek zamanlı uygulamalar ve yüksek hacimli toplu işleme için uygundur. BRIA RMBG, mevcut en ticari güvenilir ve teknik açıdan gelişmiş arka plan kaldırma çözümlerinden biri olarak kendini kanıtlamıştır.

Açık Kaynak
4.7
BiRefNet icon

BiRefNet

ZhengPeng7|N/A

BiRefNet (Bilateral Reference Network), ZhengPeng7 tarafından geliştirilen, ince yapısal detaylarda piksel düzeyinde doğrulukla ön plan nesnelerini arka planlardan hassas biçimde ayırmak için tasarlanmış yüksek çözünürlüklü ikili görsel segmentasyonu için gelişmiş açık kaynaklı segmentasyon modelidir. Model, çift dallı mimari aracılığıyla hem global anlamsal bilgiyi hem yerel detay özelliklerini kullanan ikili referans çerçevesi sunarak geleneksel segmentasyon yaklaşımlarına kıyasla üstün kenar kalitesi sağlar. BiRefNet, çok ölçekli özellikler çıkarmak için omurga kodlayıcıdan görselleri işler, ardından global bağlamı yerel sınır bilgisiyle çapraz referanslayan ikili referans modülleri uygulayarak saç telleri, dantel desenleri, zincir halkaları ve saydam malzemeler gibi karmaşık yapılar etrafında temiz kenarlara sahip net segmentasyon maskeleri üretir. DIS5K dahil birden fazla benchmark'ta son teknoloji sonuçlar elde eder ve geleneksel modelleri zorlayan karmaşık sınırlara sahip nesneleri ele almada güç gösterir. BiRefNet, olağanüstü kenar kalitesi sayesinde arka plan kaldırma çözümü olarak popülerlik kazanmış ve zorlu görsellerde birçok özel arka plan kaldırma aracını geride bırakmıştır. Yüksek çözünürlüklü giriş işlemeyi destekler ve profesyonel kompozitleme için uygun alfa matlar üretir. Farklı kalite-hız dengeleri için optimize edilmiş çeşitli varyantlarla Hugging Face üzerinden sunulan BiRefNet, Python tabanlı pipeline'lara kolayca entegre olur. Ürün fotoğrafçılığı için hassas arka plan kaldırma, grafik tasarım için nesne izolasyonu, tıbbi görsel segmentasyon ve görsel efekt çalışmaları için yüksek kaliteli kesimler başlıca uygulama alanlarıdır. Açık kaynak lisansıyla yayınlanan BiRefNet, ticari segmentasyon servislerine ücretsiz ve teknik açıdan sofistike bir alternatif sunar.

Açık Kaynak
4.5

Hızlı Bilgi

ParametreN/A
Tiphybrid
LisansApache 2.0
Yayınlanma2020-11
MimariLightweight encoder-decoder with multi-branch optimization (S, D, F branches)
Puan4.3 / 5
GeliştiriciZHKKKe

Bağlantılar

Etiketler

modnet
matting
portrait
background-removal
Siteyi Ziyaret Et

Daha Fazla Kesfet