CodeFormer
CodeFormer, Nanyang Teknoloji Üniversitesi ve Tencent ARC iş birliğiyle geliştirilen, NeurIPS 2022 konferansında sunulan son teknoloji kör yüz restorasyon modelidir. Model, ciddi biçimde bozulmuş yüz görsellerini yüksek sadakatle restore etmek için ayrık codebook arama mekanizmasına sahip benzersiz bir Transformer tabanlı mimari kullanır. En ayırt edici özelliği, 0.0 ile 1.0 arasında değişen ayarlanabilir w parametresiyle kullanıcılara kimlik koruma ile restorasyon kalitesi arasında hassas ve esnek kontrol imkanı sunmasıdır. Mimari olarak üç temel bileşenden oluşur: yüksek kaliteli yüz veri setlerinden ayrık görsel kodlar öğrenen VQGAN encoder-decoder, bu öğrenilmiş temsilleri kalıcı olarak depolayan ayrık codebook ve restorasyon sırasında optimal kod kombinasyonlarını tahmin eden güçlü Transformer modülü. Bu yaklaşım, modelin ciddi bozulmalarda bile inandırıcı ve gerçekçi yüz detayları üretmesini sağlar çünkü bilgiyi bozuk girdiden değil önceden öğrenilmiş yüksek kaliteli ön bilgilerden alır. CelebA-HQ ve WIDER-Face veri setlerinde yapılan kapsamlı benchmark testlerinde CodeFormer, FID, NIQE ve kimlik benzerliği metriklerinde önceki yöntemlere kıyasla tutarlı biçimde üstün sonuçlar elde etmiştir. Pratik kullanım alanları arasında eski aile fotoğraflarının restorasyonu, yapay zeka ile üretilmiş görsellerdeki yüz kalitesinin iyileştirilmesi, düşük çözünürlüklü video karelerinden yüz detayı çıkarma ve profesyonel fotoğraf rötuşlama yer alır. Açık kaynaklı olan model, ComfyUI, AUTOMATIC1111 WebUI ve Fooocus gibi popüler araçlarla entegre çalışır ve Replicate API ile Hugging Face Spaces üzerinden bulut tabanlı erişim sunar.
Öne Çıkan Özellikler
Kontrol Edilebilir Sadakat-Kalite Dengesi
Sadakat agirligi parametresi ile orijinal kimligi koruma ve gorsel kaliteyi maksimize etme arasindaki dengeyi kullanicinin ihtiyacina gore ayarlama imkani
Ayrik Kod Kitabi Yaklasimi
Yuksek kaliteli yuz goruntulrinden ogrenilmis ayrik kod kitabi ile gercekci yuz detaylari uretebilen yenilikci restorasyon yontemi
Ciddi Bozulma Yonetimi
Diger yontemlerin basarisiz oldugu ciddi sekilde bozulmus yuzlerde bile yuksek kaliteli restorasyon yapabilen saglam performans
Genis Ekosistem Entegrasyonu
Real-ESRGAN boru hatti ve diger populer goruntu isleme araclarina entegre edilmis, yaygin kullanilan yuz restorasyon cozumu
Hakkında
CodeFormer, Nanyang Teknoloji Üniversitesi ve Microsoft Research Asia tarafından geliştirilen, 2022 yılında NeurIPS konferansında sunulan son teknoloji bir kör yüz restorasyon modelidir. Model, ayrık kod arama mekanizmasıyla çalışan Transformer tabanlı bir mimari kullanarak bozulmuş yüz görsellerini yüksek sadakat ve kaliteyle restore eder. CodeFormer'ın en ayırt edici özelliği, kullanıcıya sadakat (fidelity) ile kalite arasında hassas kontrol imkanı sunan ayarlanabilir bir parametreye sahip olmasıdır; bu özellik onu profesyonel ve araştırma odaklı iş akışlarında son derece değerli kılmaktadır.
Mimari açıdan CodeFormer, üç temel bileşenden oluşan özgün ve yenilikçi bir yapıya sahiptir: bir VQGAN encoder-decoder, ayrık bir codebook ve bir Transformer modülü. İlk aşamada VQGAN encoder, yüksek kaliteli yüz görsellerinden oluşan büyük bir veri setinden öğrenilen ayrık görsel kodları bir codebook'ta depolar. Restorasyon sırasında bozuk giriş görseli encoder'dan geçirilir, ardından Transformer modülü en uygun kod kombinasyonunu tahmin ederek codebook'tan doğru yüz detaylarını çeker. Bu yaklaşım, modelin şiddetli bozulmalarda bile makul ve tutarlı yüz detayları üretmesini sağlar çünkü bilgiyi doğrudan bozuk görüntüden değil, önceden öğrenilmiş yüksek kaliteli codebook'tan alır.
CodeFormer, kontrol edilebilir özellik dönüşümü modülü sayesinde w parametresi (0.0 ile 1.0 arasında) üzerinden sadakat-kalite dengesini ayarlamaya olanak tanır. Düşük w değerleri daha yüksek kalite ve zengin detay üretirken kimlik sadakatini biraz azaltabilir; yüksek w değerleri ise orijinal yüze daha sadık kalırken daha muhafazakar bir restorasyon uygular. Bu benzersiz esneklik, farklı kullanım senaryolarına tek bir modelle yanıt vermeyi mümkün kılar. Benchmark testlerinde CodeFormer, CelebA-HQ ve WIDER-Face veri setlerinde FID, NIQE ve kimlik benzerliği metriklerinde üstün sonuçlar elde etmiş ve bu alandaki önceki yöntemleri tutarlı biçimde geride bırakmıştır.
Kullanım alanları arasında eski ve yıpranmış aile fotoğraflarının restorasyonu, AI görsel üretim çıktılarında yüz kalitesinin iyileştirilmesi, düşük çözünürlüklü video karelerinden yüz detaylarının çıkarılması ve profesyonel fotoğraf rötuşlama iş akışları yer alır. Özellikle ciddi bozulma içeren görsellerde GFPGAN'a kıyasla daha güvenilir ve tutarlı sonuçlar üretmesi nedeniyle zorlu restorasyon görevlerinde tercih edilmektedir. Video restorasyonunda kare kare uygulanarak eski filmlerdeki ve arşiv görüntülerindeki yüz kalitesini artırmak için de yaygın biçimde kullanılır. Dijital arşivleme projelerinde tarihi fotoğraf koleksiyonlarının toplu restorasyonu için de etkili biçimde kullanılmaktadır.
CodeFormer, açık kaynaklı olarak GitHub'da yayınlanmıştır ve araştırma ile kişisel kullanım için ücretsizdir. Model, ComfyUI, Automatic1111 WebUI ve Fooocus gibi popüler AI sanat araçlarına sorunsuz biçimde entegre edilmiştir. Hugging Face üzerinde etkileşimli demo sayfası mevcuttur ve Replicate API üzerinden bulut tabanlı erişim de mümkündür. Python tabanlı kurulumu, pip ile bağımlılık yönetimi ve detaylı dokümantasyonu sayesinde farklı seviyelerdeki geliştiriciler için erişilebilir bir yapıya sahiptir.
Yüz restorasyon alanında CodeFormer, kontrol edilebilirlik ve kalite arasındaki dengeyi en iyi kuran model olarak öne çıkar. GFPGAN'ın ham işleme hızına tam olarak ulaşamasa da, özellikle zorlu bozulma senaryolarında ve profesyonel düzeyde ince ayar kontrolü gerektiren iş akışlarında belirgin biçimde üstün performans gösterir. Transformer tabanlı codebook yaklaşımı, yüz restorasyon teknolojisinde yeni bir paradigma oluşturmuş ve sonraki akademik araştırmalara önemli bir ilham kaynağı olmuştur.
Kullanım Senaryoları
Eski Fotograf Yuz Restorasyonu
Eski aile fotograflarindaki bozulmus yuzleri dogal ve gercekci sekilde restore etme
Video Yuz Iyilestirme
Dusuk kaliteli video karelerindeki yuzleri tek tek restore ederek video kalitesini artirma
Goruntu Buyutme Destegi
Real-ESRGAN ile birlikte buyutme islemlerinde yuz bolgelerin kalitesini artiran tamamlayici bilesen olarak kullanma
Kimlik Dogrulama On Isleme
Dusuk kaliteli guvenlik kamerasi goruntulrindeki yuzleri restore ederek kimlik dogrulama sistemlerinin dogrulugunu artirma
Artılar ve Eksiler
Artılar
- Düşük kaliteli girdileri etkili şekilde işler; düşük çözünürlük, gürültü, sıkıştırma artifaktları ve bulanıklığı aynı anda ele alır
- Ayarlanabilir sadakat ağırlık parametresi ile kalite ve kimlik koruma arasında denge kurulabilir
- Sentetik ve gerçek dünya veri setlerinde son teknoloji yöntemlerden üstün performans ve sağlamlık gösterir
- Codebook Lookup Transformer mimarisi ile zengin detay ve yüz ifadesi rekonstrüksiyonu
Eksiler
- Yüzleri yaratıcı biçimde yeniden yapılandırır; daha fazla detay üretirken bazen kimlik sadakati düşebilir
- Yüz restorasyonunda uzmanlaşmıştır ancak tüm görüntü iyileştirme yönlerini kapsamaz
- GFPGAN'ın ortalama 6 saniyesine kıyasla yaklaşık 10 saniye ile daha yavaş işleme süresi
- Küçük sadakat ağırlığı yüksek kalite verirken kimlik korumasını zayıflatabilir; dengeleme kullanıcı bilgisi gerektirir
Teknik Detaylar
Parametre
N/A
Mimari
Transformer with learned discrete codebook (VQGAN-based)
Eğitim Verisi
FFHQ dataset (70K high-quality face images)
Lisans
Apache 2.0
Özellikler
- Discrete Codebook Face Restoration
- Adjustable Fidelity Weight Parameter
- Transformer-Based Global Composition
- Multi-Degradation Type destek
- Real-ESRGAN Pipeline entegrasyon
- NeurIPS 2022 Published Research
Benchmark Sonuçları
| Metrik | Değer | Karşılaştırma | Kaynak |
|---|---|---|---|
| FID Score (CelebA-HQ) | 52.42 | GFPGAN: 56.82, VQFR: 55.13 | CodeFormer Paper (NeurIPS 2022) |
| PSNR (CelebA-Test) | 24.89 dB | GFPGAN: 23.84 dB | CodeFormer Paper (NeurIPS 2022) |
| SSIM (CelebA-Test) | 0.68 | GFPGAN: 0.65 | CodeFormer Paper (NeurIPS 2022) |
| Fidelity-Quality Denge (w parametresi) | 0.0 - 1.0 ayarlanabilir | — | GitHub sczhou/CodeFormer |
Mevcut Platformlar
Sıkça Sorulan Sorular
İlgili Modeller
Real-ESRGAN
Real-ESRGAN, Tencent ARC Lab'da Xintao Wang ve işbirlikçileri tarafından geliştirilen, düşük çözünürlüklü, bozulmuş veya sıkıştırılmış görselleri dikkat çekici detay kurtarmayla yüksek çözünürlüklü çıktılara dönüştüren açık kaynak görsel büyütme ve restorasyon modelidir. 2021'de BSD lisansı altında yayınlanan Real-ESRGAN, sıkıştırma yapıları, gürültü, bulanıklık ve alt örnekleme dahil gerçek dünya görsellerinde bulunan karmaşık ve öngörülemeyen kalite kaybını simüle eden yüksek dereceli bozulma modelleme yaklaşımını tanıtarak orijinal ESRGAN mimarisi üzerine inşa edilmiştir. Model üretici ağı olarak Residual-in-Residual Dense Block'lu U-Net mimarisi kullanır ve keskin, doğal görünümlü büyütülmüş sonuçlar üretmek için algısal kayıp, GAN kaybı ve piksel kaybı kombinasyonuyla eğitilmiştir. Real-ESRGAN 2x, 4x ve daha yüksek büyütme faktörlerini destekler ve genel amaçlı fotoğraf modelinin yanı sıra anime ve illüstrasyon içeriği için özelleştirilmiş model varyantları içerir. Model yalnızca sentetik bozulma desenleri üzerinde eğitilen öncülü ESRGAN'a kıyasla gerçek dünya bozulmalarını çok daha iyi işler. Real-ESRGAN masaüstü araçlar, web servisleri, mobil uygulamalar ve profesyonel görsel düzenleme iş akışları dahil sayısız uygulamaya entegre edilerek en yaygın dağıtılan AI büyütme çözümlerinden biri haline gelmiştir. Model hem CPU hem de GPU'da verimli çalışır ve daha hafif RealESRGAN-x4plus-anime varyantı tüketici donanımı için optimize edilmiştir. Önceden eğitilmiş ağırlıklarla GitHub üzerinde mevcut tamamen açık kaynak bir proje olarak Upscayl ve çeşitli ComfyUI düğümleri gibi popüler araçların omurgası olarak hizmet eder. Real-ESRGAN doğal görünümü korurken ve gerçekçi detay eklerken görsel çözünürlüğünü artırması gereken fotoğrafçılar, içerik üreticileri ve oyun geliştiricileri için vazgeçilmezdir.
Topaz Gigapixel AI
Topaz Gigapixel AI, Topaz Labs tarafından geliştirilen, profesyonel fotoğrafçılar, grafik tasarımcılar ve görüntü işleme uzmanları için endüstri standardı bir araç olarak konumlanan AI destekli görsel büyütme ve iyileştirme için ticari bir masaüstü uygulamasıdır. Windows ve macOS'ta kullanılabilen yazılım, ince detayları, dokuları ve keskinliği koruyarak ve hatta geliştirerek görselleri yüzde 600'e kadar büyütmek için birden fazla AI modelini birleştiren tescilli bir hibrit sinir ağı mimarisi kullanır. Topaz Gigapixel AI yüzler, standart fotoğrafçılık, bilgisayar grafikleri ve düşük çözünürlüklü kaynaklar dahil farklı içerik türleri için özelleştirilmiş işleme modları içerir ve her mod hedef içeriği için mümkün olan en iyi sonuçları üretmek üzere optimize edilmiştir. Yazılım büyütme sırasında yüz detaylarını iyileştiren akıllı yüz algılama ve geliştirme özelliğine sahiptir ve çok düşük çözünürlüklü kaynak görsellerden bile doğal görünümlü sonuçlar üretir. Topaz Gigapixel AI büyük görsel hacimlerini işlemek için toplu işleme desteği sunar ve Adobe Lightroom ile Photoshop'a eklenti olarak entegre olarak profesyonel fotoğrafçılık iş akışlarına sorunsuz uyum sağlar. Uygulama görselleri GPU hızlandırması kullanarak kullanıcının makinesinde yerel olarak işler ve internet bağlantısı gerektirmeden gizlilik ve hızlı işleme sağlar. Çıktı kalitesi ticari büyütme yazılımları arasında en iyilerden biri olarak kabul edilir ve özellikle doğal dokuları korumada ve birçok AI büyütücüde yaygın olan yapay yumuşatmadan kaçınmada güçlüdür. Tek seferlik satın alma veya abonelik modeliyle tescilli bir ürün olarak Topaz Gigapixel AI özellikle baskıları büyüten profesyonel fotoğrafçılar, mülk görsellerini iyileştiren emlak fotoğrafçıları, kanıt görsellerini geliştiren adli analistler ve tarihi fotoğrafları modern çözünürlük standartlarına restore eden arşivciler tarafından değerlidir.
Upscayl
Upscayl, Real-ESRGAN ve diğer süper çözünürlük modelleri üzerine inşa edilmiş, AI destekli görsel büyütme için ücretsiz ve açık kaynak bir masaüstü uygulamasıdır. Nayam Amarshe ve TGS963 tarafından geliştirilen Upscayl, gelişmiş AI görsel büyütmeyi Windows, macOS ve Linux platformlarında teknik olmayan kullanıcılar için erişilebilir kılan kullanıcı dostu bir grafik arayüz sağlar. Uygulama birden fazla AI büyütme modelini Electron tabanlı bir masaüstü uygulamasında sarmalayarak kullanıcıların herhangi bir komut satırı bilgisi veya Python ortamı kurulumu olmadan yalnızca birkaç tıklamayla görsel çözünürlüğünü artırmasına olanak tanır. Upscayl genel fotoğrafçılık, dijital sanat, anime ve keskinleştirme dahil farklı içerik türleri için optimize edilmiş önceden yüklenmiş birkaç büyütme modeli içerir ve her model hedef içeriğine uygun farklı estetik özellikler üretir. Kullanıcılar 2x, 3x veya 4x büyütme faktörlerini seçebilir ve toplu işleme yoluyla tek tek görselleri veya tüm klasörleri işleyebilir. Uygulama PNG, JPG ve WebP dahil yaygın görsel formatlarını destekler ve çıktı formatı ile kalite ayarları için seçenekler sunar. Upscayl ayrıca özel model yüklemeyi destekleyerek kullanıcıların topluluktan ek NCNN uyumlu büyütme modelleri içe aktarmasına olanak tanır. AGPL-3.0 lisansı altında yayınlanan Upscayl kodu GitHub üzerinde mevcut olan tamamen açık kaynaklıdır ve geniş bir kullanıcı ve katkıda bulunan topluluğu edinmiştir. Uygulama tamamen yerel olarak çalışır ve hassas görseller için gizlilik sağlayarak internet bağlantısı gerektirmez. Upscayl özellikle abonelik veya bulut işleme bağımlılığı olmadan görsel kalitesini artırmak için basit ve ücretsiz bir çözüme ihtiyaç duyan fotoğrafçılar, grafik tasarımcılar ve içerik üreticileri arasında popülerdir.
SUPIR
SUPIR, Tencent ARC araştırmacıları tarafından 2024'te geliştirilen, foto-gerçekçi görsel iyileştirme için büyük ölçekli bir Stable Diffusion modeli olan SDXL'in üretken gücünden yararlanan gelişmiş bir AI görsel restorasyon ve büyütme modelidir. SUPIR Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration in the Wild ifadesinin kısaltmasıdır. Model giriş görselinde bulunan belirli kalite kaybı türlerini analiz eden ve restorasyon sürecini yönlendirmek için akıllı metin komutları üreten bozulma farkındalıklı bir kodlayıcı tanıtır ve bu sayede difüzyon modeline ne tür içeriğin nasıl restore edilmesi gerektiğini etkili bir şekilde bildirir. Bu akıllı yönlendirme yaklaşımı SUPIR'in basit piksel enterpolasyonunun ötesine geçerek anlamsal olarak anlamlı detay üreten dikkat çekici derecede detaylı ve doğal görünümlü büyütülmüş sonuçlar üretmesini sağlar. Model büyütme sırasında gerçekçi dokular, yüz hatları, metin ve ince desenleri sentezlemek için SDXL'in önceden eğitilmiş ağırlıklarına gömülü geniş görsel bilgiden yararlanır. SUPIR özellikle eski fotoğraflar, ağır sıkıştırılmış web görselleri ve düşük çözünürlüklü çekimler dahil geleneksel büyütme yöntemlerinin başarısız olduğu ciddi şekilde bozulmuş görselleri restore etmede üstün performans gösterir. Model tutarlı içerik ve doğal görünümü koruyarak yüksek büyütme faktörlerini destekler. Salt araştırma lisansı altında yayınlanan SUPIR kod ve ağırlıkları GitHub üzerinde mevcut olan açık kaynaklıdır. SDXL omurgası nedeniyle hesaplama açısından yoğun olsa da model AI destekli görsel restorasyon kalitesinin mevcut sınırlarını temsil eden sonuçlar üretir. SUPIR özellikle arşiv görsellerini restore eden profesyonel fotoğrafçılar, güvenlik görüntülerini iyileştiren adli analistler ve sınırlı kaynak materyalden maksimum kaliteye ihtiyaç duyan dijital sanatçılar için değerlidir.