AI Modelleri
Yaratıcı projeleriniz için en iyi AI modellerini keşfet, karşılaştır ve bul
PixArt-Sigma
PixArt-Sigma, PixArt araştırma ekibi tarafından geliştirilen ve ayrı ölçeklendirme adımları gerektirmeden doğrudan 4K çözünürlüğe kadar görsel üretebilen son derece verimli bir transformer tabanlı text-to-image modelidir. Diffusion Transformer mimarisi üzerine inşa edilen model, çok daha az hesaplama kaynağı ve eğitim maliyeti kullanarak çok daha büyük modellerle karşılaştırılabilir kalite elde eder. PixArt-Sigma, PixArt serisinin evrimini temsil eder ve doğal yüksek çözünürlüklü üretimi mümkün kılan token sıkıştırma ve dikkat mekanizmalarındaki iyileştirmeleri içerir. Model esnek en-boy oranlarını destekler ve 512x512'den 4096x4096 piksele kadar görseller üretebilir, bu da onu baskı tasarımı ve büyük formatlı dijital görüntüleme uygulamaları için özellikle değerli kılar. Eğitim verimliliği öne çıkan bir özelliğidir; DALL-E 2 veya Imagen gibi karşılaştırılabilir modellerin gerektirdiği hesaplama bütçesinin çok küçük bir kısmıyla geliştirilmiştir. PixArt-Sigma, prompt anlama için T5 metin kodlayıcısı kullanarak çeşitli metin girdilerinde güçlü anlamsal kavrama sağlar. Açık kaynak olarak yayınlanan model, Hugging Face üzerinde mevcuttur ve mevcut iş akışlarına kolay entegrasyon için Diffusers kütüphanesiyle uyumludur. Makul VRAM gereksinimleriyle tüketici GPU'larında çalışır ve bireysel içerik üreticileri ile küçük stüdyolar için erişilebilir kılar. AI araştırmacıları, dijital sanatçılar ve verimli yüksek çözünürlüklü görsel üretimle ilgilenen geliştiriciler, akademik araştırmadan ticari içerik üretimine kadar projeler için PixArt-Sigma'yı kullanır. Verimlilik odaklı tasarım felsefesi, sürdürülebilir AI gelişimine önemli bir katkı sağlar.
Shap-E
Shap-E, OpenAI tarafından geliştirilen, metin açıklamalarından veya giriş görsellerinden doğrudan örtük sinirsel temsillerin parametrelerini üreterek 3D nesneler oluşturan bir 3D üretim modelidir. Nokta bulutları üreten öncülü Point-E'nin aksine, Shap-E doğrudan render edilebilen ve 3D uygulamalarda kullanılabilen Neural Radiance Fields (NeRF) ve dokulu mesh'ler üretir. Model, önce bir kodlayıcının 3D varlıkları örtük fonksiyon parametrelerine eşlemeyi öğrendiği, ardından koşullu bir difüzyon modelinin bu parametreleri metin veya görsel girdilerden üretmeyi öğrendiği iki aşamalı bir eğitim yaklaşımı kullanır. Bu mimari modern bir GPU'da yalnızca birkaç saniyede hızlı üretim süreleri sağlar. Shap-E hem metinden 3D'ye hem de görselden 3D'ye iş akışlarını destekleyerek farklı yaratıcı süreçler için çok yönlülük sunar. Üretilen 3D nesneler renk ve doku bilgisi içerir, yalnızca geometri üreten yaklaşımlara kıyasla daha eksiksiz sonuçlar verir. Mayıs 2023'te MIT lisansı altında yayınlanan model, GitHub üzerinde önceden eğitilmiş ağırlıklarla tamamen açık kaynaklıdır. Çıktı kalitesi nesne başına dakikalar süren DreamFusion gibi ağır optimizasyon yöntemleriyle eşleşmese de Shap-E hızlı prototipleme ve konsept keşfi için hız ve kalite arasında pratik bir denge sunar. Model özellikle metin komutlarından hızlı 3D görselleştirmelere ihtiyaç duyan oyun geliştiricileri, 3D sanatçılar ve araştırmacılar için kullanışlıdır. OpenAI'ın açık kaynak 3D AI araştırmasına katkılarından biri olarak Shap-E, hızlı ileri beslemeli 3D üretim yaklaşımlarındaki sonraki çalışmaları etkilemiştir.
Instant Style
Instant Style, InstantX Team tarafından geliştirilen ve orijinal içerik yapısını ve anlamını sadakatle korurken bir referans görselin sanatsal stilini üretilen içeriğe uygulayan stil transferi modelidir. Nisan 2024'te yayınlanan model, IP-Adapter üzerine inşa edilmiş Ayrıştırılmış Stil Adaptörü mimarisi sunarak stil bilgisini içerik bilgisinden ayırır ve üretilen görselin konu bütünlüğünü bozmadan temiz stil enjeksiyonu sağlar. Bu ayrıştırma, stil özelliklerini içerik özelliklerinden bağımsız olarak işleyen özelleştirilmiş dikkat mekanizmaları aracılığıyla gerçekleştirilir. Model, metin isteminde belirtilen kompozisyon bütünlüğünü korurken referanstan renk paletlerini, fırça tekniklerini, doku özelliklerini ve genel estetik nitelikleri yakalar. Instant Style, Stable Diffusion ekosistemi içinde çalışarak mevcut SDXL kontrol noktaları, LoRA modelleri ve ControlNet koşullarıyla uyumlu olup maksimum yaratıcı esneklik sağlar. Model, stil bilgisini çıkarmak için yalnızca tek bir referans görsel gerektirir; ince ayar veya ek eğitim gerekmez ve gerçek zamanlı iş akışlarında anlık stil uygulaması yapılabilir. Temel uygulama alanları arasında sanatsal içerik oluşturma, marka tutarlı görsel varlık üretimi, birleşik estetik stillerle oyun sanatı üretimi, görsel tutarlılığı koruyan illüstrasyon serileri ve farklı sanatsal işlemlerle görsel konseptlerin hızlı prototiplenmesi yer alır. Hugging Face üzerinde Apache 2.0 lisansı altında açık kaynak proje olarak erişilebilen Instant Style, Replicate ve fal.ai bulut platformları üzerinden de kullanılabilir. Model, güçlü stilistik dönüşümler uygulanırken konu bütünlüğünü sıklıkla bozan önceki yaklaşımlara kıyasla üstün içerik koruması sunarak kontrol edilebilir stil transferinde önemli bir ilerlemeyi temsil eder.
Stable Audio 2.0
Stable Audio 2.0, Stability AI'ın Nisan 2024'te yayınlanan en yeni müzik ve ses üretim modelidir. Metin komutlarından 44,1kHz'de 3 dakikaya kadar yüksek kaliteli stereo ses üretebilir. Model, giriş, verse, nakarat ve çıkış dahil tutarlı şarkı yapılarıyla tam müzikal parçalar, ses efektleri ve ambient ses manzaraları üretir. Temel yenilik olan sesten sese üretim, kullanıcıların yüklenen ses örneklerini orijinalin yapısal öğelerini koruyarak yeni kompozisyonlara dönüştürmesini sağlar. Model, ticari güvenlik için AudioSparx'tan lisanslı bir veri seti üzerinde eğitilmiştir. Stable Audio web platformu ve API üzerinden erişilebilir. Açık kaynak varyantı araştırma kullanımı için Stability AI Topluluk Lisansı altında mevcuttur.
MusicLM
MusicLM, Google Research tarafından geliştirilen, metin açıklamalarından 24 kHz'de yüksek sadakatli müzik üreten text-to-music üretim modelidir. Ocak 2023'te bir araştırma makalesiyle birlikte yayınlanan MusicLM, AI'ın yalnızca doğal dil açıklamalarından birden fazla dakikayı kapsayan tutarlı ve yüksek kaliteli müzik üretebileceğini gösteren ilk modellerden biri olmuştur. Model ses tokenizasyonu için SoundStream ve ses temsil öğrenimi için w2v-BERT'i birleştiren hiyerarşik bir diziden diziye mimari kullanır ve birden fazla zamansal çözünürlükte müzik tokenleri üretir ardından bunlar dalga biçimlerine dönüştürülür. MusicLM enstrümanları, tempoyu, ruh halini ve müzikal özellikleri tanımlayan metin komutlarına dayalı olarak çeşitli türlerde ve tarzlarda müzik üretebilir ve uzun süreler boyunca müzikal tutarlılığı ve yapısal bütünlüğü korur. Model ayrıca kullanıcıların üretilen çıktıyı yönlendiren bir melodi mırıldanabildiği veya ıslık çalabildiği melodi koşullandırmayı destekleyerek daha sezgisel müzik oluşturma iş akışlarına olanak tanır. MusicLM zengin tınısal kalite ve doğal ses dinamikleriyle önceki metinden müziğe yaklaşımlara göre önemli bir iyileşmeyi temsil eden ses üretir. Tescilli bir Google modeli olarak MusicLM açık kaynak değildir ve başlangıçta yalnızca AI Test Kitchen deneysel platformu üzerinden erişilebilirken daha sonra daha geniş Google hizmetlerine entegre edilmiştir. MusicGen ve Suno gibi daha yeni modeller daha geniş benimseme sağlamış olsa da MusicLM yüksek kaliteli metinden müzik üretiminin öncü bir gösterimi olarak tarihsel önemini korumaktadır. Model AI müzik üretim alanındaki sonraki araştırmaları ve ticari gelişmeleri etkilemiş ve metinden müziğe üretimi uygulanabilir ve hızla ilerleyen bir AI araştırma alanı olarak kurulmasına yardımcı olmuştur.
AudioLDM 2
AudioLDM 2, Çin Hong Kong Üniversitesi ve Surrey Üniversitesi araştırmacıları tarafından geliştirilen, tek bir model içinde metin açıklamalarından müzik, ses efektleri ve konuşma üretebilen birleşik bir ses üretim çerçevesidir. Orijinal AudioLDM üzerine inşa edilen versiyon 2, farklı ses türlerini paylaşılan bir semantik uzaya kodlayarak aralarındaki boşluğu kapatan Language of Audio adlı evrensel bir ses temsili tanıtır. Model metin girdilerini anlamak için GPT-2 dil modelini ve ses koşullandırma için AudioMAE kodlayıcısını birleştirerek dalga biçimlerine dönüştürülen ses spektrogramları üreten bir gizli difüzyon modeline besler. Bu mimari AudioLDM 2'nin her ses türü için ayrı özel modeller gerektirmeden çeşitli ses üretim görevlerini yönetmesini sağlar. Model metinden müziğe, metinden ses efektlerine ve metinden konuşmaya değerlendirmeleri dahil birden fazla kıyaslamada rekabetçi performans gösterir. AudioLDM 2 hem müzikal hem de müzikal olmayan içerik için iyi algısal kaliteyle 48 kHz'e kadar ses üretir. Ağustos 2023'te araştırma lisansı altında yayınlanan model kod ve önceden eğitilmiş ağırlıkları GitHub ve Hugging Face üzerinde mevcut olan açık kaynaklıdır. AudioLDM 2 metin koşullu üretimin yanı sıra ses doldurma, stil transferi ve süper çözünürlük desteği de sunar. Model özellikle birleşik ses üretimini araştıran akademisyenler, tek bir araçtan çeşitli ses türlerine ihtiyaç duyan içerik üreticileri ve kapsamlı ses üretim sistemleri kuran geliştiriciler için ilgilidir. Konuşma, müzik ve çevresel sesleri yönetmedeki birleşik yaklaşımı onu çok amaçlı ses uygulamaları için çok yönlü bir temel haline getirir.
Stable Cascade
Stable Cascade, Stability AI tarafından geliştirilen, dramatik şekilde geliştirilmiş eğitim ve çıkarım verimliliği için yüksek oranda sıkıştırılmış latent uzayda çalışan Wuerstchen mimarisi üzerine inşa edilmiş verimli bir üç aşamalı görsel üretim modelidir. Model, üç aşamadan oluşan kademeli bir pipeline kullanır: Aşama C kompakt bir 24x24 latent temsil üretir, Aşama B bunu 256x256 latent görsele çözer ve Aşama A nihai yüksek çözünürlüklü çıktıyı oluşturur. İlk aşamadaki bu aşırı sıkıştırma, Stable Cascade'in karşılaştırılabilir kalitedeki modellerden önemli ölçüde daha az hesaplama kaynağıyla eğitilmesini ve çalıştırılmasını sağlarken etkileyici görsel kalitesini korur. Mimari, standart latent difüzyon modellerine kıyasla yaklaşık 16 kat sıkıştırma oranı elde ederek mevcut en kaynak verimli yüksek kaliteli görsel üreticilerden biri olur. Stable Cascade, text-to-image üretimi, görselden görsele dönüşüm, inpainting ve ControlNet tarzı koşullandırmayı destekler. Modüler üç aşamalı tasarımı, araştırmacıların bireysel aşamalarla bağımsız olarak deney yapmasına ve geliştirmesine olanak tanır. Açık kaynak lisansı altında yayınlanan model, Hugging Face üzerinde mevcuttur ve Diffusers kütüphanesiyle uyumludur. Mütevazı VRAM gereksinimleriyle, tipik olarak 8GB ve üzeri, tüketici GPU'larında etkili şekilde çalışır. Verimli üretken mimarileri inceleyen AI araştırmacıları ve kaynak kısıtlı uygulamalar geliştiren yazılımcılar, Stable Cascade'in hesaplama birimi başına kaliteyi maksimize etme yaklaşımını özellikle değerli bulur. FLUX.1'in yayınlanmasıyla gölgede kalmış olsa da latent uzay sıkıştırmasındaki mimari yenilikleri verimli görsel üretim alanına önemli araştırma katkıları temsil eder.
PowerPaint
PowerPaint, Tsinghua Üniversitesi ve HKUST araştırmacıları tarafından Tencent ARC bünyesinde geliştirilen, tek bir birleşik model içinde birden fazla inpainting işlevini mümkün kılan öğrenilebilir görev promptları kavramını tanıtan çok yönlü açık kaynaklı bir inpainting modelidir. Her düzenleme görevi için ayrı özelleşmiş modeller gerektirmek yerine, PowerPaint paylaşılan model ağırlıkları içinde farklı davranışları etkinleştiren öğrenilebilir görev vektörleri kullanarak dört farklı modu destekler: metin rehberli nesne ekleme, nesne kaldırma, şekil rehberli inpainting ve görüntü genişletme (outpainting). Stable Diffusion omurgası üzerine ControlNet benzeri kontrol mekanizmasıyla zenginleştirilmiş model, kullanıcıların metin promptlarıyla bağlamsal içerik üretmesine, çevre dokuları koruyarak nesneleri temizce kaldırmasına, belirli maske şekilleri içinde içerik oluşturmasına veya görselleri orijinal sınırlarının ötesine genişletmesine olanak tanır. Bu çok görevli esneklik, düzenleme iş akışlarında farklı araçlar arasında geçiş yapma ihtiyacını ortadan kaldırır. Benchmark testlerinde PowerPaint, ayrı optimize edilmiş göreve özel modellerle rekabetçi sonuçlar elde eder; nesne kaldırma kalitesi LaMa ve MAT gibi uzman modellerle yarışır düzeydedir. Fotoğraf düzenleme, grafik tasarım mockup'ları, e-ticaret ürün görseli hazırlama, dijital sanat tuval genişletme ve sosyal medya içerik adaptasyonu başlıca kullanım alanlarıdır. PyTorch tabanlı model Hugging Face üzerinden Gradio demo arayüzü ve Diffusers entegrasyonuyla sunulur. 8GB ve üzeri VRAM önerilir. PowerPaint, çok görevli inpainting alanında yeni bir paradigma oluşturmuş ve birleşik görsel düzenleme araştırmalarına ilham vermeye devam etmektedir.
T2I-Adapter
T2I-Adapter, Tencent ARC Lab tarafından geliştirilen, eskiz, derinlik, segmentasyon, renk ve stil girdileri dahil çeşitli rehberlik sinyalleri aracılığıyla üretilen görseller üzerinde yapısal kontrol sağlayan text-to-image difüzyon modelleri için hafif bir koşullandırma çerçevesidir. Kodlayıcının tam kopyalarını oluşturarak önemli hesaplama yükü ekleyen ControlNet'ten farklı olarak T2I-Adapter, önemli ölçüde daha az bellek kullanımı ve daha hızlı çıkarım süreleriyle benzer koşullandırma yetenekleri elde eden kompakt bir adaptör mimarisi kullanır. Adaptör, koşullandırma görsellerinden çok ölçekli özellikler çıkarır ve bunları difüzyon modelinin ara özellik haritalarına enjekte ederek üretim sürecini belirtilmeyen alanlarda modelin yaratıcı özgürlüğünü korurken istenen uzamsal yapıyı takip etmeye yönlendirir. T2I-Adapter, kullanıcıların hem yapısal düzeni hem stilistik yönü eş zamanlı belirlemesine olanak tanıyan karmaşık çok koşullu üretim için birleştirilebilen birden fazla koşullandırma türünü destekler. Her adaptör türü bağımsız olarak eğitilir ve çıkarım zamanında karıştırılıp eşleştirilebilir, esnek kompozisyonel kontrol sağlar. Çerçeve özellikle mimari görselleştirme, ürün tasarımı iterasyonu ve karakter sayfası üretimi gibi birden fazla varyasyon genelinde tutarlı uzamsal düzenler gerektiren profesyonel iş akışları için etkilidir. T2I-Adapter açık kaynaklıdır ve Stable Diffusion 1.5 ile SDXL için Hugging Face üzerinde mevcuttur, Diffusers kütüphanesi ve ComfyUI ile uyumludur. Hafif yapısı onu özellikle kaynak kısıtlı donanımda dağıtım ve gerçek zamanlı koşullandırma gerektiren uygulamalar için değerli kılar. Tasarımcılar, mimarlar, ürün geliştiriciler ve animasyon stüdyoları, daha ağır kontrol çözümlerinin hesaplama maliyeti olmadan hassas yapısal rehberliğin gerektiği üretim iş akışları için T2I-Adapter kullanır.
Hunyuan-DiT
Hunyuan-DiT, Tencent tarafından geliştirilen, doğal Çince ve İngilizce dil anlama kapasitesiyle yüksek kaliteli görsel üretim için tasarlanmış Diffusion Transformer mimarisine sahip çift dilli bir text-to-image difüzyon transformer modelidir. Model, önceki difüzyon modellerinde kullanılan geleneksel U-Net omurgasını daha ölçeklenebilir ve verimli bir transformer mimarisiyle değiştiren transformer tabanlı bir difüzyon yaklaşımı kullanır. Hunyuan-DiT, hem Çince hem İngilizce promptları derin anlamsal anlayışla işlemek için çift dilli CLIP metin kodlayıcısını çok dilli T5 kodlayıcısıyla birleştirir. Model, fotorealizm, geleneksel Çin resmi, modern illüstrasyon ve dijital sanat dahil çeşitli sanatsal stillerde güçlü kompozisyonel doğruluk, detaylı dokular ve sadık prompt uyumuyla yüksek çözünürlüklü görseller üretir. Eğitim veri seti kapsamlı Çin kültürel içeriği içerir ve çoğu Batı merkezli eğitilmiş modelin düzgün işleyemediği Çince karakterleri, geleneksel sanatsal motifleri, mimari öğeleri ve kültürel sahneleri doğru şekilde render etmesini sağlar. Hunyuan-DiT çeşitli koşullandırma mekanizmaları aracılığıyla kontrol edilebilir üretimi destekler ve birden fazla çözünürlük ve en-boy oranında görsel üretebilir. Esnek bir lisans altında açık kaynak olarak yayınlanan model, tam eğitim ve çıkarım koduyla Hugging Face ve GitHub üzerinde mevcuttur. Verimli çalışma için 11GB ve üzeri VRAM'e sahip GPU gerektirir. Çinli teknoloji şirketleri, Çince konuşan pazarlardaki dijital içerik üreticileri, çok dilli AI araştırmacıları ve kültürler arası görsel yaratımı keşfeden sanatçılar birincil kullanıcı kitlesini oluşturur. Hunyuan-DiT, Tencent'in açık kaynak görsel üretim ekosistemine önemli katkısını temsil eder.
Unique3D
Unique3D, Tencent tarafından geliştirilen, çoklu görünüm üretimi, geometri rekonstrüksiyonu ve doku iyileştirmesini birleştiren çok aşamalı bir hat aracılığıyla tek giriş görsellerinden detaylı, iyi dokulu 3D mesh'ler üreten yüksek kaliteli tek görselden 3D rekonstrüksiyon modelidir. Model profesyonel 3D uygulamalarda doğrudan kullanılabilecek keskin dokular ve temiz geometriye sahip üretim kalitesinde 3D varlıklar üretmek için tasarlanmıştır. Unique3D ilk 3D rekonstrüksiyonun birden fazla çözünürlük seviyesinde aşamalı olarak geliştirildiği çok seviyeli yükseltme iyileştirme stratejisi kullanır ve tek geçişli yöntemlere kıyasla önemli ölçüde daha ince yüzey detayları ve doku kalitesi elde eder. Hat önce bir difüzyon modeli kullanarak tutarlı çoklu görünüm görselleri üretir, ardından ilk 3D mesh'i yeniden yapılandırır ve son olarak hem geometri hem de dokuya yinelemeli yükseltme ve iyileştirme uygular. Bu yaklaşım karmaşık desenlere veya ince yapılara sahip nesneler için bile keskin doku detayları ve iyi tanımlanmış geometrik özelliklerle mesh'ler üretir. Mayıs 2024'te Apache 2.0 lisansı altında yayınlanan Unique3D kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır. Model karakterler, hayvanlar, üretilmiş ürünler ve sanatsal nesneler dahil çeşitli nesne türlerini işler. Çıktı mesh'leri standart 3D yazılımlarla uyumlu yüksek çözünürlüklü doku haritaları ve düzgün UV koordinatları içerir. Unique3D özellikle 3D varlıkların kalitesinin nihai çıktıyı doğrudan etkilediği oyun geliştirme, animasyon, ürün görselleştirme ve dijital içerik üretimi alanlarındaki profesyonel iş akışları için uygundur. Çok seviyeli iyileştirme yaklaşımı AI üretimli 3D içerikte üretim kalitesine ulaşmada önemli bir katkıyı temsil eder.
LGM
LGM (Large Gaussian Model), Pekin Üniversitesi araştırmacıları tarafından geliştirilen, tek görsellerden veya metin komutlarından yaklaşık beş saniyede 3D Gaussian Splatting temsili kullanarak yüksek kaliteli 3D nesneler üreten bir 3D üretim modelidir. 2024'te MIT lisansı altında yayınlanan LGM, çoklu görünüm görsel üretimini Gaussian tabanlı 3D rekonstrüksiyonla uçtan uca bir çerçevede birleştirir. Model önce çoklu görünüm difüzyon omurgası kullanarak hedef nesnenin birden fazla tutarlı görünümünü üretir, ardından U-Net tabanlı bir Gaussian kod çözücü bu görünümlerden tam 3D temsili oluşturmak için 3D Gaussian parametrelerini tahmin eder. Mesh tabanlı yaklaşımların aksine Gaussian Splatting çıktısı doğru aydınlatma, şeffaflık ve yansıtıcı yüzey efektleri dahil yüksek görsel kaliteyle gerçek zamanlı render imkanı sağlar. LGM üretilen görünümler için 512 piksele kadar çözünürlük destekler ve temiz geometri ile canlı dokularla detaylı 3D içerik üretir. Model hem fotoğraflardan görselden 3D'ye dönüşüm hem de ön uç olarak metinden görsele modeliyle eşleştirildiğinde metinden 3D'ye üretim için kullanılabilir. Kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan açık kaynak bir proje olarak LGM hem akademik çalışma hem de pratik uygulamalar için araştırmacılara ve geliştiricilere açıktır. Model özellikle etkileşimli 3D görselleştirme, sanal gerçeklik içeriği, oyun varlığı prototipleme ve üretilen 3D içeriğin gerçek zamanlı render edilmesinin gerektiği senaryolar için uygundur. LGM Gaussian Splatting'in AI üretimli 3D içerik için geleneksel mesh temsillerine cazip bir alternatif sunduğunu göstermektedir.
Pix2Pix
Pix2Pix, UC Berkeley'de geliştirilen ve eşleştirilmiş görüntü çeviri görevleri için koşullu üretici çekişmeli ağların kullanılması kavramını tanıtan öncü bir görüntüden görüntüye çeviri çerçevesidir. Kasım 2017'de "Image-to-Image Translation with Conditional Adversarial Networks" başlıklı çığır açıcı makale kapsamında yayınlanan Pix2Pix, eşleştirilmiş eğitim örnekleri sağlandığında tek bir genel amaçlı mimarinin farklı görsel alanlar arasındaki eşlemeleri öğrenebileceğini göstermiştir. Mimari, atlama bağlantıları aracılığıyla uzamsal bilgiyi koruyan U-Net tabanlı bir üretici ve görüntü kalitesini global düzeyde değil yama düzeyinde değerlendiren bir PatchGAN ayırt edici içerir. Bu yapı modelin yapısal tutarlılığı korurken ince taneli doku detaylarını yakalamasını sağlar. Yaklaşık 54 milyon parametreyle Pix2Pix, modern difüzyon modellerine kıyasla nispeten hafiftir ve hızlı çıkarım ile verimli eğitim sunar. Model; semantik etiket haritalarını fotorealistik sahnelere dönüştürme, mimari cepheleri eskizlerden dönüştürme, siyah beyaz fotoğrafları renklendirme, kenar haritalarını gerçekçi görsellere çevirme ve uydu görüntülerini sokak haritalarına çevirme gibi çeşitli çeviri görevlerinde üstün performans gösterir. BSD lisanslı açık kaynak uygulaması, CycleGAN, SPADE ve modern difüzyon tabanlı görsel düzenleme yaklaşımları gibi sonraki modelleri etkileyen temel ilkeleri belirleyerek üretici yapay zeka alanındaki en etkili çalışmalardan biri haline gelmiştir. Ham çıktı kalitesi açısından daha yeni teknikler tarafından geçilmiş olsa da Pix2Pix, eğitim bağlamlarında, hızlı prototiplemede ve eşleştirilmiş eğitim verisinin mevcut olduğu uygulamalarda yaygın şekilde kullanılmaya devam etmektedir. Hugging Face ve Replicate üzerinde erişilebilen model, koşullu görsel üretim ve çekişmeli eğitim dinamiklerini anlamak için temel bir referans olmaya devam eder.
Kandinsky 3.0
Kandinsky 3, Sber AI ve AI Forever araştırma ekibi tarafından geliştirilen, ünlü soyut ressam Wassily Kandinsky'nin adını taşıyan açık kaynaklı bir text-to-image üretim modelidir. Model, güçlü çok dilli prompt anlama kapasitesiyle öne çıkar ve özellikle Rusça ve İngilizce dil girdilerinde mükemmel performans gösterirken diğer dilleri de destekler. Yaklaşık 3 milyar parametreyle latent difüzyon mimarisi üzerine inşa edilen Kandinsky 3, geleneksel CLIP tabanlı yaklaşımlardan daha nüanslı anlamsal anlayış sağlayan büyük bir dil modeli omurgasını metin kodlama için kullanır. Model, fotorealizm, dijital sanat, anime ve geleneksel resim estetiği dahil çeşitli stillerde 1024x1024 çözünürlükte yüksek kaliteli görseller üretir. Eğitim verisi kültürel temsil açısından dikkat çekici ölçüde çeşitlidir ve ağırlıklı olarak Batı merkezli eğitilmiş modellere kıyasla daha geniş bir küresel perspektifi yansıtan görseller üretir. Kandinsky 3, img2img üretimi, inpainting ve kontrollü çıktı için çeşitli koşullandırma yöntemlerini destekler. Açık kaynak lisansı altında yayınlanan model, Hugging Face üzerinde ücretsiz olarak mevcuttur ve 8GB üzeri VRAM'e sahip GPU'larda yerel olarak dağıtılabilir. Python tabanlı iş akışlarında kolay uygulama için Diffusers kütüphanesiyle entegre olur. AI araştırmacıları, dijital sanatçılar ve Rusça konuşan topluluklardaki geliştiriciler Kandinsky 3'ü özellikle değerli bulur, ancak çok dilli yetenekleri onu dünya genelinde kullanışlı kılar. Model ayrıca multimodal AI ve çapraz dil görsel üretiminde akademik araştırma için temel oluşturarak açık kaynak görsel üretim ekosistemine değerli çeşitlilik katar.
StyleDrop
StyleDrop, Google Research tarafından geliştirilen, metin-görsel üretim modellerinin yalnızca bir veya iki referans görselden belirli bir görsel stili sadakatle yakalayıp yeniden üretmesi için ince ayar yapma yöntemidir. Genel metin-görsel modellerin çeşitli veya jenerik stillerde görsel üretmesinin aksine, StyleDrop büyük veri setleri yerine yalnızca birkaç stil örneği gerektiren adaptör ayarlaması yoluyla model parametrelerini verimli şekilde uyarlayarak hassas stil kontrolü sağlar. Yöntem öncelikle Google'ın maskeli üretken transformer mimarisi olan Muse modeli üzerinde gösterilmiş olup düz illüstrasyonlar, yağlı boya, suluboya, 3D render, piksel sanatı ve soyut kompozisyonlar dahil çeşitli sanatsal stillerde dikkat çekici stil sadakati elde eder. StyleDrop, referans görsellerden renk paletleri, fırça darbeleri, doku özellikleri ve kompozisyon eğilimleri gibi stile özgü özellikleri yakalayan hafif adaptör parametreleri eğiterek çalışır. Çıkarım sırasında bu adaptörler, öğrenilmiş stilistik nitelikleri tutarlı biçimde koruyarak rastgele içerikli yeni görseller üretilmesini yönlendirir. İnsan veya CLIP tabanlı geri bildirimle isteğe bağlı iteratif eğitim prosedürü stil doğruluğunu daha da iyileştirir. Bu yaklaşım, birden fazla üretilen varlık genelinde görsel tutarlılığın zorunlu olduğu marka kimliği uygulamaları ve AI üretimi eserlerinde imza stil korunması isteyen sanatçılar için özellikle değerlidir. StyleDrop, DreamBooth ve textual inversion yöntemlerini stile özel üretim benchmark'larında daha az eğitim görseli ve hesaplama ile geride bırakır. Kendisi açık kaynak olmasa da kavramları, Stable Diffusion ekosisteminde LoRA ve IP-Adapter gibi açık kaynak stil uyarlama tekniklerini etkilemiştir.
I2VGen-XL
I2VGen-XL, Alibaba DAMO Academy tarafından geliştirilen ve tek giriş görsellerinden güçlü anlamsal ve zamansal tutarlılıkla video içeriği üreten yüksek kaliteli bir görselden videoya üretim modelidir. Kasım 2023'te yayınlanan I2VGen-XL, video üretim sürecini iki aşamaya ayrıştıran kademeli bir mimari kullanır: doğru anlamsal içerik ve hareket kalıplarıyla düşük çözünürlüklü video üreten bir temel aşama ve ardından nihai yüksek çözünürlüklü çıktıyı üretmek için görsel kaliteyi büyüten ve geliştiren bir iyileştirme aşaması. Bu iki aşamalı yaklaşım, modelin detaylı görsel iyileştirme uygulamadan önce giriş görselinin içeriğini ve hareket dinamiklerini anlamaya odaklanmasına olanak tanıyarak hem anlamsal doğruluğu hem de görsel kaliteyi koruyan videolar ortaya çıkarır. Model, giriş görselinin kimliğini ve görsel özelliklerini korurken makul zamansal evrim üretmede güçlü yetenekler sergiler ve bu özellik onu kaynak materyalle görsel tutarlılığın kritik olduğu uygulamalar için etkili kılar. I2VGen-XL; insanların, hayvanların, manzaraların, nesnelerin ve sanatsal kompozisyonların fotoğrafları dahil çeşitli giriş türlerini yönetir ve orijinal görselde mevcut olan fiziksel özellikleri ve uzamsal ilişkileri saygılayan bağlamsal olarak uygun hareket kalıpları uygular. Model, akıcı kareler arası geçişler, tutarlı aydınlatma koşulları ve önceki görselden videoya yaklaşımlarda yaygın olan rahatsız edici artefaktlardan kaçınan doğal hareket dinamikleri içeren videolar üretir. Temel kullanım alanları arasında animasyonlu ürün vitrinleri oluşturma, stok fotoğraflardan dinamik içerik üretme, konsept sanatı ve tasarım maketlerini canlandırma ve çekici görsel hareket içeren sosyal medya içeriği üretme yer alır. Apache 2.0 lisansı altında sunulan I2VGen-XL, Hugging Face ve Replicate üzerinde erişilebilir olup araştırmacılara ve geliştiricilere kaliteyi hesaplama verimliliğiyle dengeleyen yetenekli bir açık kaynak görselden videoya üretim çözümü sunar.
Wonder3D
Wonder3D, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen, yüksek kaliteli 3D mesh rekonstrüksiyonu için tek giriş görselinden hem çoklu görünüm renkli görseller hem de karşılık gelen normal haritaları üreten tek görselden 3D rekonstrüksiyon modelidir. CVPR 2024'te kabul edilen Wonder3D, RGB renk görünümleri ve geometrik normal haritaları aynı anda üreten çapraz alan difüzyon yaklaşımını tanıtır ve üretilen görünümlerin hem görsel olarak tutarlı hem de geometrik olarak doğru olmasını sağlar. Bu çift çıktılı strateji yalnızca renkli görseller üreten yöntemlere kıyasla aşağı akış 3D rekonstrüksiyonu için önemli ölçüde daha zengin bilgi sağlar. Model difüzyon süreci boyunca renk ve normal harita alanları arasında tutarlılığı zorlayan çoklu görünüm çapraz alan dikkat mekanizması kullanır ve giriş nesnesinin 3D yapısını sadakatle temsil eden tutarlı çoklu görünüm çıktıları üretir. Wonder3D tek bir fotoğraftan yaklaşık iki ila üç dakikada tam dokulu bir 3D mesh yeniden yapılandırabilir. Çıktı mesh'leri iyi tanımlanmış yüzey detaylarıyla temiz geometri sunar ve profesyonel 3D iş akışlarında kullanıma uygundur. Apache 2.0 lisansı altında yayınlanan model kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır. Wonder3D karakterler, hayvanlar, mobilyalar ve üretilmiş nesneler dahil çeşitli nesne kategorilerini tutarlı kaliteyle işler. Model özellikle sınırlı referans görsellerinden yüksek kaliteli 3D varlıklar oluşturulması gereken oyun geliştirme, animasyon, ürün görselleştirme ve sanal gerçeklik uygulamaları için değerlidir. Çapraz alan yaklaşımı 3D rekonstrüksiyon için çoklu görünüm üretimi alanındaki sonraki araştırmaları etkilemiştir.
One-2-3-45
One-2-3-45, UC San Diego araştırmacıları tarafından geliştirilen, çoklu görünüm üretimini seyrek görünüm 3D rekonstrüksiyonuyla birleştiren iki aşamalı bir hat aracılığıyla tek giriş görselinden dokulu 3D mesh'ler üreten tek görselden 3D rekonstrüksiyon sistemidir. Adı temel süreci yansıtır: bir görselden iki, üç, dört, beş görünüm üret ve ardından tam bir 3D nesne yeniden yapılandır. İlk aşamada ince ayarlı bir Zero123 modeli tek giriş fotoğrafına dayalı olarak nesnenin farklı açılardan birden fazla yeni görünümünü üretir. İkinci aşamada bu üretilen çoklu görünüm görselleri tutarlı geometriye sahip dokulu bir 3D mesh üreten maliyet hacmi tabanlı seyrek görünüm rekonstrüksiyon ağına beslenir. Haziran 2023'te MIT lisansı altında yayınlanan One-2-3-45, 2D difüzyon modellerini 3D rekonstrüksiyonla birleştirmenin bir dakikanın altında makul 3D varlıklar üretebileceğini gösteren ilk sistemlerden biri olmuştur. Model günlük eşyalar, hayvanlar, araçlar ve sanatsal nesneler dahil çeşitli nesne türlerini işler. Nesne başına onlarca dakika süren optimizasyon gerektiren DreamFusion gibi optimizasyon tabanlı yaklaşımların aksine One-2-3-45 ileri beslemeli bir şekilde çalışır ve bu da onu önemli ölçüde daha hızlı kılar. Çıktı mesh'leri renk ve doku bilgisi içerir ve standart 3D uygulamalarda kullanılmak üzere dışa aktarılabilir. Kodu GitHub üzerinde mevcut olan tamamen açık kaynak bir proje olarak tek görselden 3D üretim alanındaki sonraki araştırmalar için etkili bir referans olmuştur. Sistem özellikle sınırlı giriş verisinden hızlı 3D içerik üretimini keşfeden araştırmacılar ve geliştiriciler için kullanışlıdır.
Rodin Gen-1
Rodin Gen-1, Microsoft Research tarafından geliştirilen, metin açıklamalarından ve görsellerden detaylı, yüksek kaliteli 3D modeller ve dijital avatarlar oluşturan bir 3D üretim modelidir. Model, Microsoft'un bilgisayar görüşü ve üretken AI'daki kapsamlı araştırmalarından yararlanarak AI destekli 3D içerik üretimi alanına önemli bir girişi temsil eder. Rodin Gen-1, öğrenilmiş bir gizli uzayda çalışan gürültü giderme işlemi aracılığıyla 3D temsiller üreten difüzyon tabanlı bir mimari kullanır ve ince geometrik detaylar ile gerçekçi yüzey dokuları içeren sonuçlar üretir. Model özellikle metin açıklamalarından doğru yüz hatları, saç, giysi ve aksesuarlarla 3D dijital avatarlar üretmede uzmanlaşmıştır ve bu da onu oyun, sanal gerçeklik ve metaverse uygulamaları için son derece ilgili kılar. Avatarların ötesinde Rodin Gen-1 farklı kategorilerde tutarlı kaliteyle genel 3D nesneler ve sahneler de üretebilir. Üretim süreci animasyon ve rigging iş akışlarına uygun düzgün topolojiye sahip dokulu mesh'ler üretir. Microsoft Rodin Gen-1'i bir araştırma katkısı olarak konumlandırmış ve akademik kullanıma izin veren ancak ticari dağıtımı kısıtlayan salt araştırma lisansı altında yayınlamıştır. Model Microsoft'un daha geniş 3D AI araştırma portföyü üzerine inşa edilmiştir ve büyük ölçekli üretken modellerin 3D içerik üretimine nasıl etkili bir şekilde uygulanabileceğini göstermektedir. Rodin Gen-1 özellikle avatar üretim kalitesiyle dikkat çeker ve giriş olarak yalnızca bir metin komutu gerektirirken manuel olarak oluşturulmuş 3D karakterlerin sadakatine yaklaşan sonuçlar elde ederek profesyonel 3D karakter oluşturma için geleneksel olarak gereken süreyi ve uzmanlığı önemli ölçüde azaltır.
OpenLRM
OpenLRM, Zexiang Xu ve işbirlikçileri tarafından geliştirilen, tek görselden 3D rekonstrüksiyon için Büyük Rekonstrüksiyon Modeli mimarisinin açık kaynak bir uygulamasıdır. Proje, tek giriş görsellerinden ileri beslemeli bir şekilde 3D temsiller tahmin etmek için transformer tabanlı mimari kullanan LRM yaklaşımının tamamen açık ve tekrarlanabilir bir uygulamasını sunar. OpenLRM bir giriş görselini DINOv2 gibi önceden eğitilmiş bir vizyon kodlayıcı aracılığıyla işler, ardından elde edilen özellikleri üç düzlem tabanlı sinirsel ışıma alanı temsili üreten bir transformer kod çözücüye besler ve bu temsil yeni bakış açılarından render edilebilir veya dokulu bir 3D mesh'e dönüştürülebilir. Tüm rekonstrüksiyon modern bir GPU'da yalnızca birkaç saniye sürer ve bu da onu etkileşimli uygulamalar ve toplu işleme iş akışları için pratik kılar. Aralık 2023'te Apache 2.0 lisansı altında yayınlanan OpenLRM, araştırmacıların inceleyebileceği, değiştirebileceği ve üzerine inşa edebileceği erişilebilir bir referans uygulama sağlayarak 3D AI araştırma topluluğundaki kritik bir boşluğu doldurur. Model çeşitli çıktı formatlarını destekler ve oyun geliştirmeden e-ticaret ürün görselleştirmesine kadar uzanan uygulamalar için mevcut 3D süreçlere entegre edilebilir. OpenLRM mobilya, araçlar, karakterler ve günlük eşyalar dahil çeşitli nesne kategorilerini makul geometrik sadakatle işler. Önceden eğitilmiş model ağırlıkları anında kullanım için Hugging Face üzerinde mevcuttur. İleri beslemeli 3D rekonstrüksiyondaki temel açık kaynak projelerden biri olarak OpenLRM, hızla gelişen tek görselden 3D üretim alanındaki birçok alt projeyi ve araştırma çalışmasını doğrudan etkilemiş ve mümkün kılmıştır.
ModelScope T2V
ModelScope T2V, Alibaba DAMO Academy tarafından geliştirilen ve işlevsel bir metinden videoya üretim hattını araştırma topluluğuna serbestçe sunarak erişilebilir video üretim araştırmasına öncülük eden erken dönem açık kaynaklı bir text-to-video üretim modelidir. Mart 2023'te yayınlanan ModelScope T2V, pratik metinden videoya üretim yeteneklerini sergileyen ilk açık kaynak modellerden biri olarak alandaki sonraki gelişmeler için önemli bir temel çizgi oluşturmuştur. 1,7 milyar parametreli bir difüzyon mimarisi üzerine inşa edilen model, görsel üretimde kanıtlanmış gizli difüzyon yaklaşımını zamansal alana genişleterek metin açıklamalarından kısa video klipler üretilmesini sağlayan zamansal konvolüsyon ve dikkat katmanları içerir. Mimari, metin istemlerini bir CLIP metin kodlayıcısı aracılığıyla işler ve eklenmiş zamansal boyutlara sahip değiştirilmiş bir U-Net aracılığıyla temel hareket tutarlılığı ve prompt uyumu içeren klipler üretir. Çıktı kalitesi Sora veya Runway Gen-3 Alpha gibi daha yeni modellerle karşılaştırıldığında mütevazı olsa da ModelScope T2V, araştırmacıların ve geliştiricilerin deneyebileceği, değiştirebileceği ve üzerine inşa edebileceği ilk gerçek anlamda erişilebilir açık kaynak uygulamayı sağlayarak video üretim teknolojisinin demokratikleştirilmesinde önemli bir tarihsel rol oynamıştır. Model, tanınabilir özneler ve temel hareket kalıplarıyla basit sahne açıklamalarını yöneterek orta çözünürlüklerde kısa video klipler üretimini destekler. Yaygın kullanım alanları arasında araştırma deneyleri, video üretim kavramlarının eğitim amaçlı gösterimi, video fikirlerinin hızlı prototiplenmesi ve daha gelişmiş modellerin eğitimi ile ince ayarı için temel çizgi olarak hizmet etme yer alır. Hugging Face ve Replicate üzerinde Apache 2.0 lisansı altında erişilebilen ModelScope T2V, son teknoloji kalitenin gerekli olmadığı ancak minimum hesaplama yüküyle işlevsel video üretim yeteneğinin gerektiği senaryolarda hafif ve kaynak verimli bir seçenek olarak geçerliliğini korumaktadır.
Era3D
Era3D, Alibaba tarafından geliştirilen, 3D rekonstrüksiyon için tek giriş görsellerinden yüksek çözünürlüklü, kamera farkındalıklı çoklu görünüm görselleri ve normal haritaları üreten çoklu görünüm üretim modelidir. Model çoklu görünüm üretimindeki yaygın sınırlamaları ele alan iki temel yenilik sunar: giriş görselinin kamera perspektifine uyum sağlayan odak uzaklığı tahmin modülü ve rakip yöntemlerden daha yüksek çözünürlüklerde üretimi daha az GPU belleğiyle mümkün kılan verimli satır bazlı dikkat mekanizması. Era3D aşağı akış 3D mesh rekonstrüksiyonu için zengin geometrik bilgi sağlayarak 512x512 çözünürlükte karşılık gelen normal haritalarıyla birlikte altı tutarlı görünüm üretir. Kamera farkındalıklı tasarım modelin farklı perspektiflerden ve odak uzaklıklarından çekilen giriş görsellerini çıktı kalitesinde bozulma olmadan işleyebilmesi anlamına gelir ve bu sabit kamera modeli varsayan yöntemlere göre önemli bir iyileştirmedir. Satır bazlı dikkat mekanizması hesaplama açısından pahalı olan tam çapraz görünüm dikkatini yatay satırlar boyunca dikkati işleyen daha verimli bir alternatifle değiştirerek görünüm tutarlılığını korurken bellek gereksinimlerini azaltır. Mayıs 2024'te Apache 2.0 lisansı altında yayınlanan Era3D kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır. Model çeşitli nesne kategorilerinde güçlü performans gösterir ve yüksek kaliteli 3D rekonstrüksiyona uygun temiz çoklu görünüm çıktıları üretir. Era3D özellikle giriş görsellerinin farklı kamera özelliklerine sahip çeşitli kaynaklardan geldiği ve nihai 3D modellerdeki ince detayları yakalamak için yüksek çözünürlüklü çoklu görünüm üretiminin gerekli olduğu profesyonel 3D içerik üretim iş akışları için değerlidir.
SyncDreamer
SyncDreamer, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen, tek giriş görsellerinden nesnelerin senkronize ve 3D tutarlı görünümlerini üreten çoklu görünüm üretim ve 3D rekonstrüksiyon modelidir. 2023'te Apache 2.0 lisansı altında yayınlanan SyncDreamer, yeni bir dikkat mekanizması aracılığıyla 3D tutarlılığı sağlarken birden fazla görünümü eş zamanlı üreten senkronize çoklu görünüm difüzyon yaklaşımını tanıtır. Görünümler arasında sıklıkla tutarsız sonuçlar üreten ardışık görünüm üretim yöntemlerinin aksine SyncDreamer'ın senkronize üretim süreci tüm çıktı görünümlerinin tutarlı geometri, aydınlatma ve görünüm paylaşmasını sağlar. Model gürültü giderme sürecinde farklı bakış açısı tahminleri arasında bilgi akışına izin veren 3D farkındalıklı özellik dikkat modülüne sahip değiştirilmiş bir difüzyon mimarisi kullanır. Bu çapraz görünüm iletişimi modelin tüm üretilen görünümler arasında uzamsal tutarlılığı korumasını sağlar. Çıktı çoklu görünüm görselleri yüksek kaliteli dokulu 3D mesh'ler üretmek için NeuS veya NeRF gibi standart çoklu görünüm rekonstrüksiyon yöntemleriyle kullanılabilir. SyncDreamer nesnenin etrafında eşit aralıklı 16 görünüm üreterek doğru 3D rekonstrüksiyon için kapsamlı kapsam sağlar. Model hayvanlar, araçlar, mobilyalar ve sanatsal nesneler dahil çeşitli nesne kategorilerini iyi tutarlılıkla işler. Kod ve ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynak bir proje olarak SyncDreamer çoklu görünüm üretimi literatüründe önemli bir referans haline gelmiştir. Model özellikle 3D üretim hatları üzerinde çalışan araştırmacılar ve tek görsellerin 3D varlıklara dönüştürülmesinin yaygın bir gereksinim olduğu oyun geliştirme, ürün görselleştirme ve sanal gerçeklik içerik üretimi uygulamaları için ilgilidir.
ProGAN
ProGAN (Aşamalı Büyüyen GAN'lar), NVIDIA araştırmacıları Tero Karras, Timo Aila, Samuli Laine ve Jaakko Lehtinen tarafından geliştirilen, yüksek çözünürlüklü yüz görselleri üretmek için eğitim sırasında hem üretici hem ayrıştırıcı ağların aşamalı olarak büyütülmesine öncülük eden 2017 tarihli GAN mimarisidir. Hedef çözünürlükte doğrudan eğitim yerine ProGAN, 4x4 pikselden başlayarak kademeli olarak daha yüksek çözünürlükleri işleyen yeni katmanlar ekler ve her detay seviyesini yumuşak geçişlerle entegre eder. Bu aşamalı strateji, ince detaylar eklenmeden önce büyük ölçekli yapıyı öğrenerek eğitimi stabilize eder, tam çözünürlükte sıfırdan eğitime kıyasla süreyi azaltır ve GAN'larla daha önce mümkün olandan çok daha yüksek çözünürlüklü görseller üretilmesini sağlar. ProGAN, 1024x1024 piksel fotorealistik yüz görselleri inandırıcı biçimde üreten ilk GAN mimarisi olmuş ve geniş çapta ilgi çekmiştir. Model, bu araştırma için hazırlanmış yüksek kaliteli CelebA-HQ veri seti üzerinde eğitilmiştir. Yüzlerin ötesinde yatak odaları, arabalar ve diğer kategorilerin yüksek çözünürlüklü görsellerini başarıyla üreterek çok yönlülüğünü kanıtlamıştır. Mimari, çıktı çeşitliliği için mini-grup standart sapma tekniğini ve eğitim stabilitesi için eşitlenmiş öğrenme hızını tanıtmıştır. ProGAN, TensorFlow'da resmi implementasyonları ve PyTorch'ta topluluk portlarıyla tamamen açık kaynaklıdır. StyleGAN gibi sonraki mimariler ProGAN'ın aşamalı eğitim temeli üzerine inşa edilerek daha yüksek kalite elde etmiş olsa da ProGAN, yüksek çözünürlüklü GAN eğitimini temelden değiştiren ve gelişmiş üretken modellerin bir neslini ilhamlandıran tarihi bir katkıdır.
172 model bulundu · Sayfa 7 / 8