ControlNet
ControlNet, kenar haritaları, derinlik haritaları, insan poz iskeletleri, segmentasyon maskeleri ve normal haritalar gibi çeşitli koşullandırma girdileri aracılığıyla görsel üretim sırasında hassas yapısal rehberlik sağlayan Stable Diffusion modelleri için koşullu bir kontrol çerçevesidir. Stanford Üniversitesi'nde Lvmin Zhang ve Maneesh Agrawala tarafından geliştirilen ControlNet, donmuş difüzyon modeli kodlayıcılarına eğitilebilir kopya dalları ekleyerek modelin orijinal yeteneklerini değiştirmeden uzamsal koşullandırmayı öğrenmesini sağlar. Bu mimari, üretilen görsellerin kompozisyonu, yapısı ve uzamsal düzeni üzerinde ince ayarlı kontrol eklerken temel modelin üretim kalitesini korur. ControlNet birden fazla koşullandırma türünü eş zamanlı destekler ve kullanıcıların poz, derinlik ve kenar bilgisini birleştirerek olağanüstü hassasiyetle üretimi yönlendirebildiği karmaşık çok koşullu iş akışları oluşturur. Çerçeve, üretilen görsellerde tutarlı uzamsal yapıları sürdürmenin temel zorluğunu çözerek profesyonel AI görsel üretim iş akışlarında devrim yaratmıştır. Karakter pozları, mimari düzenler, ürün yerleşimleri ve sahne kompozisyonları üzerinde hassas kontrol ihtiyacı olan profesyonel sanatçılar ve tasarımcılar için vazgeçilmez bir araç haline gelmiştir. ControlNet açık kaynaklıdır ve SD 1.5 ile SDXL dahil çeşitli Stable Diffusion sürümleri için önceden eğitilmiş modellerle Hugging Face üzerinde mevcuttur. ComfyUI ve Automatic1111 ile sorunsuz entegre olur. Konsept sanatçıları, karakter tasarımcıları, mimari görselleştiriciler, moda tasarımcıları ve animasyon stüdyoları üretim iş akışları için ControlNet'e güvenir. Etkisi Stable Diffusion'ın ötesine geçerek FLUX.1 ve diğer modern modellerde benzer kontrol mekanizmalarına ilham vermiştir.
Öne Çıkan Özellikler
14+ Kontrol Modu Desteği
Canny kenar, OpenPose, derinlik haritası, segmentasyon, karalama, normal harita ve daha fazlası ile görsel üretimini hassas şekilde yönlendirme imkanı sunar.
Sıfır-Konvolüsyon Mimarisi
Orijinal difüzyon modelinin ağırlıklarını koruyarak eğitilebilir bir kopya üzerinde çalışır, önceden öğrenilmiş yeteneklerin kaybolmasını önler.
Çoklu Model Uyumluluğu
SD 1.5, SDXL ve FLUX mimarileri ile uyumlu çalışır; her temel model için ayrı ControlNet ağırlıkları mevcuttur.
Çoklu ControlNet İstifleme
Birden fazla ControlNet modülünü aynı anda kullanarak poz ve derinlik gibi farklı koşulları tek bir üretim sürecinde birleştirebilirsiniz.
Hakkında
ControlNet, Stanford Üniversitesi'nden Lvmin Zhang ve Maneesh Agrawala tarafından geliştirilen ve ilk olarak Şubat 2023'te "Adding Conditional Control to Text-to-Image Diffusion Models" başlıklı makaleyle tanıtılan devrim niteliğinde bir sinir ağı mimarisidir. Model, Stable Diffusion gibi büyük önceden eğitilmiş metinden görsele difüzyon modellerine, kodlama katmanlarının eğitilebilir bir kopyasını oluşturarak koşullu kontrol ekler. Bu yenilikçi yaklaşım, kullanıcıların Canny kenarları, insan pozu iskeletleri (OpenPose ile), derinlik haritaları (MiDaS ile), segmentasyon haritaları, karalama çizimleri ve normal haritalar dahil çeşitli mekansal koşullandırma girdileri kullanarak görsel üretimini yönlendirmesine olanak tanır. ControlNet'in ortaya çıkışı, yapay zeka destekli görsel üretimde kontrol edilebilirlik paradigmasını kökten değiştirmiş ve rastgele üretimden hassas yönlendirmeli üretime geçişi mümkün kılmıştır.
Çekirdek mimari, bağlı bir kopyayı eğitirken orijinal model ağırlıklarını kilitleyerek çalışır ve önceden eğitilmiş yeteneklerin korunmasını sağlarken yeni koşullu kontrol öğrenilir. Bu sıfır-konvolüsyon (zero-convolution) tekniği, ControlNet'in felaket unutması (catastrophic forgetting) olmadan nispeten küçük veri setlerinde eğitilebileceği anlamına gelir. Kontrol modeli başına yaklaşık 1,4 milyar parametre ile SD 1.5 kodlayıcısını yansıtan ControlNet, dikkat çekici yapısal sadakat elde eder. Eğitim sürecinde sıfır konvolüsyon katmanları başlangıçta sıfır çıktı üretir, bu da eğitimin başında ana modelin davranışının korunmasını ve kademeli olarak kontrol sinyallerinin öğrenilmesini sağlar. Bu zarif tasarım, modelin kararlı ve öngörülebilir bir şekilde eğitilmesinin temelini oluşturur.
ControlNet, 14'ten fazla farklı kontrol türünü destekleyerek benzersiz bir esneklik sunar. Canny kenar algılama ile nesne sınırlarını koruyabilir, OpenPose ile insan vücut pozlarını yeniden üretebilir, MiDaS derinlik haritaları ile üç boyutlu mekansal yapıyı aktarabilir, segmentasyon haritaları ile bölgesel içerik kontrolü sağlayabilir ve normal haritalar ile yüzey detaylarını yönetebilir. Canny koşullandırma görevlerinde 0,89 SSIM puanı elde eden model, yapısal sadakat açısından endüstri standardı haline gelmiştir. Ayrıca birden fazla ControlNet modelinin aynı anda kullanılabilmesi, örneğin derinlik ve poz kontrolünün eş zamanlı uygulanması gibi karmaşık senaryoları mümkün kılar.
Kullanım alanları açısından ControlNet, AI sanat üretiminden endüstriyel tasarıma kadar geniş bir yelpazeyi kapsar. Mimari görselleştirmede eskiz aşamasından fotorealistik render üretmeye, moda tasarımında belirli pozlardaki kıyafet görselleştirmesine, oyun geliştirmede konsept sanatı üretmeye ve film endüstrisinde storyboard'ları görselleştirmeye kadar profesyonel iş akışlarına entegre edilmiştir. İç mekan tasarımcıları derinlik haritalarıyla mekan düzenini koruyarak farklı stil alternatifleri üretebilirken, illüstratörler karalama çizimlerini detaylı görsellere dönüştürebilir.
ControlNet, AI sanat ve tasarım topluluğunda temel bir araç haline gelmiş olup ComfyUI, Automatic1111 ve Fooocus gibi popüler arayüzlere entegre edilmiştir. SD 1.5, SDXL ve FLUX mimarilerini her biri için özel ağırlık setleriyle destekler. Apache 2.0 lisansı, hem araştırma hem de ticari uygulamalar için serbestçe kullanılabilir kılar ve Hugging Face, Replicate ve fal.ai dahil platformlarda dağıtılmıştır. Topluluk tarafından üretilen özel ControlNet modelleri de sürekli genişleyen bir ekosistem oluşturmuştur.
Rakipleriyle karşılaştırıldığında ControlNet, T2I-Adapter'dan daha hassas kontrol sunarken daha fazla hesaplama kaynağı gerektirir. IP-Adapter gibi stil tabanlı adaptörlerden farklı olarak, ControlNet tamamen yapısal ve mekansal kontrol üzerine yoğunlaşır. Bu tamamlayıcı yapı, ControlNet'in diğer adaptörlerle birlikte kullanılmasını teşvik etmiş ve modern AI görsel üretim iş akışlarının vazgeçilmez bir bileşeni haline getirmiştir. Açık kaynak doğası ve güçlü topluluk desteği sayesinde ControlNet, kontrol edilebilir görsel üretim alanında en yaygın benimsenen çözüm olmaya devam etmektedir.
Kullanım Senaryoları
Poz Tabanlı Karakter Üretimi
İnsan pozu referansı ile istenilen pozda karakter görselleri oluşturma.
Mimari Görselleştirme
Kenar haritalarından mimari render ve görselleştirmeler oluşturma.
Derinlik Tabanlı Sahne Üretimi
Derinlik haritası ile 3D hissi koruyan yeni sahne ve stil üretimi.
Ürün Fotoğrafçılığı Kontrolü
Ürün görsellerinin kompozisyon ve yapısını koruyarak farklı stiller üretme.
Artılar ve Eksiler
Artılar
- Poz iskeleti, derinlik haritası, kenar tespiti ve segmentasyon maskesi gibi çeşitli kontrol yöntemleri sunar
- Büyük ön-eğitimli difüzyon modellerinin görsel kalitesini koruyarak mekansal kontrol ekler
- Küçük, görev-spesifik veri setlerinden öğrenirken genel yetenekleri kaybetmez
- Tekrarlanabilirliği ve hizalamayı artırarak sanatçılar, prodüksiyon ekipleri ve prototipleme için büyük değer sağlar
- ControlNet++ ile segmentasyon, çizgi ve derinlik kontrollerinde %7-13 iyileştirme sağlanmıştır
Eksiler
- Kötü hazırlanmış kontrol girdileri (tutarsız boyutlar, gürültülü maskeler) süreci bozabilir
- Kontrol gücü çok yüksek ayarlanırsa katı, artifakt dolu sonuçlar ortaya çıkar
- Gürültülü veya karmaşık kenarlı görüntülerde kenar tespiti zorlanabilir
- Her eklenen ControlNet için %20-50 daha uzun işlem süresi gerekir
- Birden fazla kişi veya karmaşık pozlarda zorluk yaşanabilir
Teknik Detaylar
Parametre
1.4B
Mimari
Conditional Diffusion (encoder copy)
Eğitim Verisi
Various conditioning datasets
Lisans
Apache 2.0
Özellikler
- Pose Control (OpenPose)
- Canny Edge Detection
- Depth Map Conditioning (MiDaS)
- Segmentation Map Control
- Scribble/Sketch Guidance
- Normal Map destek
- Lineart Control
- Multi-ControlNet Stacking
Benchmark Sonuçları
| Metrik | Değer | Karşılaştırma | Kaynak |
|---|---|---|---|
| Parametre Sayısı | 1.4B (SD 1.5 encoder kopyası) | T2I-Adapter: 77M | ControlNet Paper (arXiv) |
| Desteklenen Kontrol Türü | 14+ (Canny, Depth, Pose, vb.) | T2I-Adapter: 8+ | ControlNet GitHub |
| SSIM (Canny koşulu) | 0.89 | — | ControlNet Paper (arXiv) |
| Çıkarım Süresi Artışı | +%15-25 (temel modele göre) | T2I-Adapter: +%5-10 | ControlNet GitHub |
Mevcut Platformlar
Haberler ve Referanslar
Sıkça Sorulan Sorular
İlgili Modeller
InstantID
InstantID, InstantX Team tarafından geliştirilen ve yalnızca tek bir referans fotoğrafı kullanarak belirli bir kişinin çeşitli stil, poz ve bağlamlarda görsellerini üretebilen sıfır atışlı kimlik koruyucu görsel üretim çerçevesidir. Birden fazla referans görsel veya zaman alıcı ince ayar gerektiren geleneksel yüz değiştirme veya kişiselleştirme yöntemlerinden farklı olarak InstantID, bir yüz kodlayıcı, IP-Adapter ve yüz referans noktası rehberliği için ControlNet'i birleştiren yenilikçi bir mimari aracılığıyla yalnızca bir yüz fotoğrafından doğru kimlik koruması sağlar. Sistem, referans görselinden detaylı yüz kimlik özelliklerini çıkarır ve üretim sürecine enjekte ederek üretilen kişinin çeşitli çıktı senaryolarında tanınabilir yüz hatlarını, oranlarını ve karakteristiklerini korumasını sağlar. InstantID, farklı sanatsal stillerde portreler üretme, kişiyi hayal edilen sahne veya bağlamlara yerleştirme, profil resimleri ve avatarlar oluşturma ve tutarlı karakter temsilleri içeren pazarlama materyalleri üretme dahil çeşitli yaratıcı uygulamaları destekler. Model, temel olarak Stable Diffusion XL ile çalışır ve açık kaynaklıdır, yerel dağıtım için GitHub ve Hugging Face üzerinde mevcuttur. Topluluk tarafından geliştirilen düğümler aracılığıyla ComfyUI ile entegre olur ve bulut API'leri üzerinden erişilebilir. Portre fotoğrafçıları, sosyal medya içerik üreticileri, kişiselleştirilmiş kampanyalar oluşturan pazarlama ekipleri, karakter varyantları tasarlayan oyun geliştiricileri ve kimlik tabanlı yaratıcı çalışmaları keşfeden dijital sanatçılar InstantID'yi kullanır. Çerçeve, sonraki kimlik koruma modellerini etkilemiştir ve açık kaynak ekosisteminde tek görsellik kimlik transferi için en etkili çözümlerden biri olmaya devam etmektedir.
IP-Adapter
IP-Adapter, Tencent AI Lab tarafından geliştirilen ve temel modelin herhangi bir ince ayarını gerektirmeden text-to-image difüzyon modelleri için görsel rehberli üretim sağlayan bir görsel prompt adaptörüdür. Adaptör, bir CLIP görsel kodlayıcı kullanarak referans görsellerden görsel özellikler çıkarır ve bu özellikleri ayrıştırılmış bir dikkat mekanizması aracılığıyla difüzyon modelinin çapraz dikkat katmanlarına enjekte ederek çalışır. Bu, kullanıcıların metin promptlarının yanında referans görselleri görsel promptlar olarak sağlamasına olanak tanır ve metin açıklamasını takip ederken referansla stilistik öğeleri, kompozisyonel özellikleri veya görsel karakteristikleri paylaşan görseller üretmek için üretim sürecini yönlendirir. IP-Adapter, üretilen görselin referansın sanatsal stilini benimsediği stil transferi ve referanstan belirli konuların veya öğelerin çıktıda göründüğü içerik transferi dahil birden fazla çalışma modunu destekler. Adaptör hafiftir ve temel modelin çıkarım sürecine minimum hesaplama yükü ekler. Poz, stil ve içeriğin her birinin bağımsız olarak kontrol edilebildiği sofistike iş akışları sağlayarak çok modlu koşullandırma için ControlNet gibi diğer kontrol mekanizmalarıyla birleştirilebilir. IP-Adapter açık kaynaklıdır ve SD 1.5 ile SDXL dahil çeşitli Stable Diffusion sürümleri için mevcuttur. Topluluk uzantıları aracılığıyla ComfyUI ve Automatic1111 ile entegre olur. Üretilen görsellerde görsel tutarlılık sağlaması veya referans materyalden belirli estetik nitelikleri aktarması gereken dijital sanatçılar, ürün tasarımcıları, marka yöneticileri ve içerik üreticileri IP-Adapter'ın yeteneklerinden özellikle faydalanır.
IP-Adapter FaceID
IP-Adapter FaceID, Tencent AI Lab tarafından geliştirilen ve yüz kimlik bilgisini difüzyon görüntü üretim sürecine enjekte ederek belirli bir kişinin yüz özelliklerini sadakatle koruyan yeni görüntüler oluşturmayı mümkün kılan özelleştirilmiş bir adaptör modülüdür. Geleneksel yüz değiştirme yaklaşımlarından farklı olarak, IP-Adapter FaceID, InsightFace kütüphanesinden yüz tanıma özellik vektörleri çıkarır ve bunları çapraz dikkat katmanları aracılığıyla difüzyon modeline besler, böylece modelin tutarlı yüz kimliğini korurken çeşitli sahneler, stiller ve kompozisyonlar üretmesine olanak tanır. Mevcut Stable Diffusion modellerinin üzerine katmanlanan yalnızca yaklaşık 22 milyon adaptör parametresiyle FaceID, kişiye özel ince ayar veya birden fazla referans görüntü gerektirmeden dikkat çekici kimlik koruması sağlar. Tek bir net yüz fotoğrafı, kişiyi çeşitli sanatsal stillerde, farklı kıyafetlerle, çeşitli ortamlarda ve yeni pozlarda üretmek için yeterlidir. Adaptör hem SDXL hem de SD 1.5 temel modellerini destekler ve poz, derinlik ve kompozisyon üzerinde ek kontrol için diğer ControlNet adaptörleriyle birleştirilebilir. IP-Adapter FaceID Plus varyantları, geliştirilmiş benzerlik ve ayrıntı koruması için yüz gömülerinin yanına ek CLIP görüntü özellikleri ekler. Apache 2.0 lisansı altında tamamen açık kaynaklı olan model, ComfyUI iş akışlarına ve Diffusers kütüphanesine yaygın olarak entegre edilmiştir. Yaygın uygulamalar arasında kişiselleştirilmiş avatar oluşturma, çeşitli sanatsal stillerde özel portre üretimi, hikaye anlatımında karakter tutarlılığı ve kişiselleştirilmiş pazarlama içeriği yer alır.
FLUX Redux
FLUX Redux, Black Forest Labs tarafından geliştirilen FLUX model ailesinin özel görsel varyasyon modeli olup referans görüntülerin temel stilini, renk paletini ve kompozisyon özünü korurken yaratıcı varyasyonlar üretmek için tasarlanmıştır. 12 milyar parametreli Diffusion Transformer mimarisi üzerine inşa edilen FLUX Redux, girdi olarak bir referans görüntü alır ve orijinalin görsel DNA'sını korurken içerik, kompozisyon veya perspektifte kontrollü varyasyonlar sunan yeni görüntüler üretir. Model, sanatsal teknik, renk uyumu, aydınlatma atmosferi ve doku nitelikleri dahil üst düzey stilistik özellikleri yakalar, ardından bunları kaynak materyalle estetik olarak tutarlı hissettiren taze kompozisyonlar üretmek için uygular. FLUX Redux, varyasyonun yönünü belirlemek için metin promptlarıyla birleştirilebilir ve kullanıcıların 'aynı stil ama dağ manzarası ile' veya 'benzer renk paleti ile kentsel sahne' gibi belirli değişiklikler talep etmesine olanak tanır. Bu özellik, pazarlama ekiplerinin birleşik bir estetiği paylaşan birden fazla görsele ihtiyaç duyduğu marka tutarlılığı iş akışları için özellikle güçlü kılar. Model ayrıca referansın güçlü bir stilistik önsel olarak hizmet ettiği ve metin promptlarının yeni içeriği tanımladığı görüntüden görüntüye iş akışlarını destekler. Tescilli bir model olan FLUX Redux, Black Forest Labs'ın API'si ve Replicate, fal.ai dahil iş ortağı platformları üzerinden kullanım tabanlı fiyatlandırmayla erişilebilir. Temel uygulamalar arasında sosyal medya kampanyaları için tutarlı görsel içerik serileri üretme, reklamcılıkta A/B testi için stil tutarlı varyasyonlar oluşturma ve sanatçıların her seferinde sıfırdan başlamadan görsel yön üzerinde yineleme yapması yer alır.