AI Modelleri
Yaratıcı projeleriniz için en iyi AI modellerini keşfet, karşılaştır ve bul
DALL-E 2
DALL-E 2, OpenAI'ın 2022'de piyasaya sürüldüğünde erişilebilir AI görsel oluşturmaya öncülük eden ve milyonlarca kullanıcıyı text-to-image üretiminin olanaklarıyla tanıştıran ikinci nesil görsel üretim modelidir. CLIP tabanlı metin anlama ile difüzyon modeli mimarisi üzerine inşa edilen DALL-E 2, doğal dil açıklamalarından 1024x1024 çözünürlükte görseller üretir. Model, yayınlandığında çığır açan birçok yenilikçi yetenek tanıtmıştır: bir görselin belirli bölgelerini düzenlemek için inpainting, görselleri orijinal sınırlarının ötesine genişletmek için outpainting ve mevcut görsellerin alternatif versiyonlarını oluşturmak için varyasyonlar. DALL-E 2, AI'ın basit metin açıklamalarından yaratıcı, tutarlı ve görsel olarak çekici görseller üretebileceğini göstererek tüketici AI görsel üretim devrimini başlattı. Halefi DALL-E 3 ve Midjourney v6 ile FLUX.1 gibi rakipler tarafından kalite açısından geçilmiş olsa da DALL-E 2, önemli ölçüde düşürülmüş fiyatlandırmayla OpenAI API üzerinden hâlâ kullanılabilir durumdadır ve maksimum görsel kalitenin birincil endişe olmadığı uygulamalar için uygun maliyetli bir seçenek sunar. Model, temel görsel üretim, basit düzenleme görevleri ve prototip oluşturma için güvenilir performans sunar. Yüksek hacimli görsel üretim ihtiyacı olan uygulama geliştiricileri, görsel materyal oluşturan eğitimciler ve bütçeyle AI sanatını keşfeden hobi sahipleri DALL-E 2'yi kullanmaya devam etmektedir. Text-to-image teknolojisini ana akım farkındalığa taşıyan ilk yaygın erişilebilir AI görsel üreticilerinden biri olarak tarihsel önemi büyüktür.
Meshy v4
Meshy v4, Meshy AI'ın metin açıklamalarından ve görsellerden dakikalar içinde detaylı, dokulu 3D modeller oluşturabilen 3D model üretim platformunun dördüncü neslidir. 2024'ün sonlarında yayınlanan Meshy v4, önceki sürümlere göre mesh kalitesi, doku sadakati ve topoloji optimizasyonunda büyük bir yükseltmeyi temsil eder. Model, oyun motorları, animasyon boru hatları ve 3D baskı için uygun temiz topolojiye sahip üretime hazır 3D varlıklar üretir. Hem metinden 3D'ye hem de görselden 3D'ye üretim iş akışlarını destekler. Platform, difüz, normal, pürüzlülük ve metalik haritalar dahil PBR malzemelerle dokulu mesh'ler üreterek çıktıları Unity, Unreal Engine ve Blender ile hemen uyumlu hale getirir. GLB, OBJ, FBX ve STL dahil birden fazla formatta dışa aktarım destekler. Meshy v4, geliştirilmiş detay koruma, ince yapılar ve karmaşık geometrilerin daha iyi işlenmesi ve daha doğru renk ve doku eşleme özelliklerine sahiptir. Platform oyun geliştiricileri, 3D sanatçılar, mimarlar ve ürün tasarımcılarına hizmet eder. Freemium model sınırlı ücretsiz üretim sunar.
VALL-E
VALL-E, Microsoft Research tarafından geliştirilen ve Ocak 2023'te tanıtılan, text-to-speech sentezi için sinirsel codec dil modelidir. Mel spektrogramlar ve vokoder kullanan geleneksel TTS sistemlerinin aksine VALL-E metinden konuşmaya dönüşümü koşullu bir dil modelleme görevi olarak ele alır ve kısa bir ses örneğine koşullu olarak metin girdisinden ayrık ses codec kodları üretir. Model konuşmacının ses özelliklerini, duygusal tonunu ve akustik ortamını yalnızca 3 saniyelik bir referans ses örneğinden koruyan konuşma sentezlemek için EnCodec ses tokenleri üzerinde çalışan otoregresif ve otoregresif olmayan transformer kod çözücülerin kombinasyonunu kullanır. Bu yaklaşım modelin konuşmacıya özel ince ayar gerektirmeden yalnızca kısa bir örnek dinledikten sonra herhangi bir seste konuşma üretebilmesini sağlayan dikkat çekici sıfır atışlı ses klonlama yetenekleri sunar. VALL-E LibriLight veri kümesinden 60.000 saatlik İngilizce konuşma verisi üzerinde eğitilmiştir ve bu da modele geniş bir konuşmacı, aksan ve konuşma stili çeşitliliğine maruz kalma imkanı vermiştir. Üretilen konuşma doğal prozodi, uygun duraklamalar ve referans konuşmacının özelliklerine yakından uyan duygusal ifade korur. VALL-E dil modelleme yaklaşımlarının sinirsel ses codec'leriyle eşleştirildiğinde konuşma sentezini etkili bir şekilde çözebildiğini göstererek TTS teknolojisinde bir paradigma değişimini temsil eder. Potansiyel kötüye kullanım endişeleri nedeniyle salt araştırma lisansı altında yayınlanan model ticari kullanıma açık değildir. VALL-E sıfır atışlı TTS alanındaki sonraki araştırmaları önemli ölçüde etkilemiş ve mimarisi çok sayıda takip modeline ilham vermiştir. Model özellikle konuşma sentezi, ses dönüşümü ve dil modelleme tekniklerinin ses üretim görevlerine uygulanmasını araştıranlar için ilgilidir.
InstructPix2Pix
InstructPix2Pix, UC Berkeley araştırmacıları tarafından geliştirilen ve kullanıcıların manuel maske, eskiz veya referans görsel gerektirmeden doğal dil talimatlarıyla görselleri düzenlemesini sağlayan yenilikçi bir görsel düzenleme modelidir. Model, GPT-3'ün dil yetenekleriyle Stable Diffusion'ın görsel üretimini birleştirerek oluşturulan eşleştirilmiş görsel düzenlemeleri veri setinde eğitilmiş ve metin tabanlı düzenleme talimatlarını hassas görsel değişikliklere çevirmeyi öğrenmiştir. Kullanıcılar bir giriş görseli ile birlikte 'karlı yap,' 'kediyi köpeğe çevir' veya 'dramatik gün batımı aydınlatması ekle' gibi metin talimatı sağlayabilir ve InstructPix2Pix, orijinal görselin genel yapısını ve etkilenmeyen öğelerini korurken istenen değişiklikleri uygular. Model tek bir ileri geçişte çalışarak yinelemeli optimizasyon olmadan hızlı düzenlemeler yapar. Stil transferi, nesne değiştirme, aydınlatma değişiklikleri, mevsim ve hava durumu değişiklikleri, malzeme değişiklikleri ve sanatsal dönüşümler dahil geniş bir düzenleme işlemi yelpazesini yönetir. InstructPix2Pix, Stable Diffusion mimarisi üzerine inşa edilmiştir ve açık kaynaklıdır, Diffusers kütüphanesiyle entegrasyon ile Hugging Face üzerinde mevcuttur. 6GB ve üzeri VRAM ile tüketici GPU'larında çalışır. Fotoğrafçılar, dijital sanatçılar, içerik üreticileri ve görsel düzenleme uygulamaları geliştiren yazılımcılar hızlı yaratıcı düzenleme iş akışları için InstructPix2Pix kullanır. Karmaşık senaryolarda manuel düzenlemenin hassasiyetiyle eşleşmese de doğal dil arayüzü, sofistike görsel düzenlemeleri herhangi bir görsel düzenleme uzmanlığı olmadan kullanıcılar için erişilebilir kılar.
Zero123++
Zero123++, Stability AI tarafından geliştirilen, tek giriş görselinden bir nesnenin altı tutarlı kanonik görünümünü üreten çoklu görünüm görsel üretim modelidir. 2023'te Apache 2.0 lisansı altında yayınlanan model, orijinal Zero123 yaklaşımını önemli ölçüde iyileştirilmiş görünüm tutarlılığıyla genişletir ve modern 3D rekonstrüksiyon hatlarında kritik bir bileşen olarak hizmet eder. Zero123++ bir nesnenin tek bir fotoğrafını veya render edilmiş görselini alır ve nesnenin etrafında tam 360 derecelik aralığı kapsayan altı eşit aralıklı görünüm üretir ve bunların tümü tutarlı geometri, aydınlatma ve görünüm korur. Model çoklu görünüm tutarlılığını sağlayan özel koşullandırma mekanizmalarıyla ince ayarlı bir Stable Diffusion omurgası üzerine inşa edilmiştir. Görünümleri bağımsız üreten ve sıklıkla tutarsız sonuçlar veren orijinal Zero123'ün aksine Zero123++ tüm altı görünümü tek bir difüzyon sürecinde eş zamanlı üretir ve 3D tutarlılığı dramatik şekilde iyileştirir. Üretilen çoklu görünüm görselleri NeRF, Gaussian Splatting veya doğrudan mesh rekonstrüksiyonu gibi aşağı akış 3D rekonstrüksiyon yöntemleri için girdi görevi görerek tek bir fotoğraftan yüksek kaliteli 3D model oluşturmayı mümkün kılar. Zero123++ önceden eğitilmiş ağırlıkları Hugging Face üzerinde mevcut olan tamamen açık kaynak bir modeldir ve 3D üretim sistemleri kuran araştırmacılar ile geliştiricilere açıktır. Model birçok son teknoloji 3D üretim hattında temel bir bileşen haline gelmiş ve akademik araştırmalarda yaygın olarak kullanılmaktadır. Özellikle 2D görsellerin 3D varlıklara dönüştürülmesinin sık bir iş akışı gereksinimi olduğu oyun geliştirme, ürün görselleştirme ve sanal gerçeklik uygulamaları için değerlidir.
SwinIR
SwinIR, ETH Zurich'te Jingyun Liang ve araştırma ekibi tarafından geliştirilen, süper çözünürlük, görsel gürültü giderme ve JPEG sıkıştırma yapıları kaldırma dahil birden fazla restorasyon görevinde son teknoloji performans elde eden Transformer tabanlı görsel restorasyon modelidir. Ağustos 2021'de Apache 2.0 lisansı altında yayınlanan SwinIR, görsellerde hem yerel detayı hem de küresel bağlamı verimli şekilde yakalayan kaydırılmış pencere dikkat mekanizmalarından yararlanarak Swin Transformer mimarisini görsel işleme için uyarlar. Model üç ana modülden oluşur: sığ özellik çıkarma katmanı, artık bağlantılarla Swin Transformer bloklarından oluşan derin özellik çıkarma modülü ve restore edilmiş yüksek kaliteli çıktıyı üreten rekonstrüksiyon modülü. Yalnızca 12 milyon parametreyle SwinIR birçok rakip modele kıyasla dikkat çekici ölçüde hafiftir ve üstün veya karşılaştırılabilir sonuçlar sunar. Model 2x, 3x ve 4x büyütme dahil birden fazla süper çözünürlük ölçeğini, farklı kalite-hız dengelemeleri için klasik ve hafif varyantları ve çeşitli gürültü seviyelerinde gürültü giderme ile farklı kalite faktörlerinde JPEG yapı kaldırma için optimize edilmiş ayrı yapılandırmaları destekler. SwinIR Transformer mimarilerinin düşük seviyeli görsel işleme görevlerinde CNN tabanlı yaklaşımları geçebileceğini göstererek alanda önemli bir dönüm noktası oluşturmuştur. Model önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır ve standart derin öğrenme çerçeveleriyle iyi entegre olur. SwinIR akademik araştırmalarda görsel restorasyon kıyaslamaları için temel çizgi olarak ve yüksek kaliteli görsel iyileştirmeye ihtiyaç duyan fotoğrafçılar, grafik tasarımcılar ve içerik üreticileri tarafından pratik uygulamalarda yaygın olarak kullanılır. Verimli mimarisi onu özel GPU gereksinimleri olmadan tüketici donanımında dağıtıma uygun kılar.
ArtBreeder
ArtBreeder, Joel Simon tarafından oluşturulan, üretken çekişmeli ağ (GAN) teknolojisiyle desteklenen sezgisel bir web tabanlı arayüz aracılığıyla kullanıcıların görselleri harmanlama, evrimleştirme ve oluşturmasına olanak tanıyan iş birlikçi bir AI sanat platformudur. Platform, kullanıcıların birden fazla görseli karıştırma oranlarını ayarlayarak birleştirmesini sağlar; biyolojik ıslaha benzer bir süreçle üst görsellerden özellikler miras alan özgün görsel çıktılar oluşturur. Kaydırıcı kontrolleriyle yaş, ifade, etnisite, saç rengi ve sanatsal stil gibi çeşitli görsel nitelikler gerçek zamanlı olarak ayarlanarak geniş bir görsel olasılık uzayı keşfedilebilir. ArtBreeder; portreler, manzaralar, albüm kapakları, anime karakterler ve genel görseller dahil birçok özelleşmiş model üzerinde çalışır ve her biri kendi kategorisinde yüksek kaliteli sonuçlar üretir. Platformun iş birlikçi doğası, oluşturulan tüm görsellerin varsayılan olarak herkese açık paylaşılması anlamına gelir ve diğer kullanıcıların remix yapıp geliştirebileceği devasa bir topluluk kütüphanesi oluşturur. Bu sosyal boyut, fikirlerin organik olarak birbirleri üzerine inşa edildiği benzersiz bir yaratıcı ekosistem yaratır. Başlıca kullanım alanları oyun ve hikaye için karakter tasarımı, film ve roman için konsept sanat keşfi, benzersiz profil resimleri ve avatarlar oluşturma, illüstrasyon projeleri için referans görseli üretme ve görsel stillerle sanatsal deneyler yapmadır. Platform ücretsiz temel erişim ile premium katmanlarda daha yüksek çözünürlük ve ek özellikler sunar. Açık kaynak olmasa da ArtBreeder, GAN tabanlı görsel manipülasyonu teknik uzmanlık veya yerel donanım gerektirmeden herkes için erişilebilir kılarak AI sanat üretimini demokratikleştirmiştir.
LTX Video
LTX Video, Lightricks tarafından geliştirilen ve görsel kaliteden ödün vermeden üretim hızı ve verimliliği vurgulayarak 24 kare/saniye hızında 768x512 çözünürlükte videolar üreten gerçek zamanlı bir video üretim modelidir. Kasım 2024'te yayınlanan LTX Video, hızlı çıkarım için optimize edilmiş transformer tabanlı bir mimari üzerine inşa edilmiş olup birçok rakip modelden daha hızlı video içeriği üretebilir. Bu özellik, onu etkileşimli uygulamalar ve hızlı iterasyon gerektiren iş akışları için özellikle uygun kılar. Model, doğal dil açıklamalarını yorumlayarak tutarlı hareket, tutarlı sahne dinamikleri ve görsel olarak çekici çıktı kalitesine sahip kısa video klipler üreten metinden videoya üretimi destekler. LTX Video'nun mimarisi, profesyonel yaratıcı uygulamalar için gereken kaliteyi korurken hesaplama gereksinimlerini azaltan verimli dikkat mekanizmaları ve optimize edilmiş gizli uzay işlemleri içerir. Model, doğal hareketli insan özneleri, dinamik öğeler içeren çevresel sahneler, soyut görsel içerik ve stilize sanatsal yorumlar dahil çeşitli içerik türleri üretmede yetkinlik sergiler. LTX Video, API erişilebilirliği ve popüler geliştirme çerçeveleriyle uyumluluğu aracılığıyla mevcut yaratıcı iş akışlarına entegrasyonu destekler. Gerçek zamanlı performans vurgusu, onu etkileşimli içerik oluşturma araçları, canlı önizleme sistemleri ve uzun üretim sürelerinin yaratıcı akışı bozacağı prototip üretimi gibi uygulamalar için özellikle değerli kılar. Apache 2.0 lisansı altında sunulan LTX Video, Hugging Face üzerinde ve fal.ai ile Replicate dahil bulut platformları aracılığıyla erişilebilir olup hem yerel dağıtım hem de bulut tabanlı entegrasyon sağlar. Lightricks'in yaratıcı araçlar şirketi olarak geçmişi, modelin pratik kullanılabilirliğe odaklanmasına yansımış olup optimizasyonlar günlük yaratıcı süreçlerinde çıktı kalitesinin yanı sıra iş akışı verimliliğine öncelik veren içerik üreticileri ve tasarımcıların ihtiyaçlarına yöneliktir.
Kandinsky 3.1
Kandinsky 3.1, Rusya'nın en büyük teknoloji şirketi Sber AI tarafından geliştirilen ve öncü soyut sanatçı Wassily Kandinsky'nin adını taşıyan gelişmiş bir metin-görsel AI modelidir. Difüzyon mimarisi üzerine inşa edilmiş 12 milyar parametresiyle model, geliştirilmiş görüntü kalitesi, daha hızlı üretim hızları ve daha iyi prompt uyumu ile Kandinsky 3.0'a göre önemli bir ilerlemeyi temsil eder. Kandinsky 3.1, özellikle görseller içinde Kiril metni oluşturma ve Rusça dil promptlarını ana dil akıcılığıyla anlama konusunda üstün performans sergilerken İngilizce ve diğer dilleri de etkili şekilde destekler. Model, önce düşük çözünürlükte görüntüler üreten ardından ayrı bir süper çözünürlük modülüyle büyüten kademeli üretim boru hattı kullanarak son derece detaylı çıktılar elde eder. Kandinsky 3.1, standart görüntü üretim kıyaslamalarında rekabetçi sonuçlar elde ederek çeşitli stillerde fotorealistik görüntüler, dijital sanat ve illüstrasyonlar üretir. Mimari, promptlarda tanımlanan semantik nüansları ve uzamsal ilişkileri daha iyi yakalayan geliştirilmiş metin kodlaması içerir. Apache 2.0 lisansı altında tamamen açık kaynaklı olan model, Hugging Face üzerinden indirme ve yerel dağıtım için mevcuttur. Diffusers kütüphanesiyle entegre olur ve alana özgü uygulamalar için ince ayar yoluyla özelleştirilebilir. Yaygın kullanım alanları arasında Rusça konuşulan pazarlar için pazarlama içeriği oluşturma, editoryal illüstrasyon, konsept sanat, ürün görselleştirme ve eğitim materyali üretimi yer alır. Model ayrıca yönetilen altyapı tercih eden geliştiriciler için Sber'in bulut API'si aracılığıyla da erişilebilir durumdadır.
InstantMesh
InstantMesh, Tencent tarafından geliştirilen, tek giriş görsellerinden çoklu görünüm üretimi ve seyrek görünüm rekonstrüksiyonu hattı aracılığıyla yüksek kaliteli dokulu 3D mesh'ler oluşturan ileri beslemeli bir 3D mesh üretim modelidir. Nisan 2024'te Apache 2.0 lisansı altında yayınlanan InstantMesh, tek görselden 3D rekonstrüksiyonda hem hız hem de kalite elde etmek için çoklu görünüm difüzyon modelini büyük bir rekonstrüksiyon modeliyle birleştirir. Hat önce ince ayarlı çoklu görünüm difüzyon modeli kullanarak giriş nesnesinin birden fazla tutarlı görünümünü üretir, ardından bu görünümleri üç düzlem sinirsel temsili tahmin eden transformer tabanlı bir rekonstrüksiyon ağına besler ve son olarak bu temsil dokulu bir mesh'e dönüştürülür. Bu iki aşamalı yaklaşım tek aşamalı yöntemlerden önemli ölçüde daha yüksek kaliteli sonuçlar üretirken üretim sürelerini yalnızca birkaç saniyede tutar. InstantMesh bir görsel üretim modeliyle birleştirildiğinde metinden 3D'ye iş akışlarını ve fotoğraflardan veya sanat eserlerinden doğrudan görselden 3D'ye dönüşümü destekler. Çıktı mesh'leri standart 3D yazılımlar ve oyun motorlarıyla uyumlu detaylı geometri ve doku haritaları içerir. Model karakterler, araçlar, mobilyalar ve organik şekiller dahil çok çeşitli nesne türlerini iyi geometrik sadakatle işler. Kod ve ağırlıkları GitHub ve Hugging Face üzerinde mevcut olan açık kaynak bir proje olarak InstantMesh, 3D varlık üretim hatları kuran geliştiriciler arasında popüler bir seçim haline gelmiştir. Özellikle hızlı geri dönüş ve makul kalitenin birlikte önemli olduğu oyun geliştirme, e-ticaret ürün görselleştirme ve hızlı prototipleme senaryoları için kullanışlıdır.
Kolors
Kolors, Kuaishou Technology tarafından geliştirilen ve prompt tabanlı görsel oluşturma için hem Çince hem İngilizce dillerinde doğal anlama kapasitesiyle tasarlanmış çift dilli bir text-to-image üretim modelidir. Model, Batı merkezli eğitilmiş modellerin sıklıkla kaçırdığı Çin kültürel içeriği, görsel estetik ve dilsel nüanslara özel vurguyla milyarlarca görsel-metin çiftiyle eğitilmiş büyük ölçekli bir difüzyon mimarisi üzerine inşa edilmiştir. Kolors, standart Batı görsel kavramlarının yanı sıra Çin sanat geleneklerini, kültürel sembolleri, kaligrafiyi ve modern Çin tasarım estetiğini doğru şekilde yansıtan görseller üretmede güçlü yetenekler sergiler. Model, iyi prompt uyumu, doğru renk üretimi ve fotorealistik, illüstratif ve sanatsal stillerde detaylı renderla rekabetçi görsel kalite elde eder. Çift dilli mimarisi, Çince ve İngilizce promptları eşit yetkinlikle işleyerek özellikle Çince konuşan kitleler veya kültürler arası projeler için içerik üreten yaratıcılar için değerli kılar. Kolors çeşitli çözünürlük ve en-boy oranlarında text-to-image üretimini destekler. Kuaishou tarafından açık kaynak olarak yayınlanan model, Hugging Face üzerinde mevcuttur ve Python tabanlı iş akışlarına entegrasyon için Diffusers kütüphanesiyle uyumludur. 8GB ve üzeri VRAM'e sahip GPU'larda çalışır ve yerel olarak dağıtılabilir veya çeşitli bulut platformları üzerinden erişilebilir. Çinli içerik üreticileri, Çin pazarlarını hedefleyen uluslararası pazarlama ekipleri, Çin estetiğiyle ilgilenen dijital sanatçılar ve çok dilli görsel üretimi inceleyen AI araştırmacıları birincil kullanıcı kitlesini oluşturur. Kolors, kültürel farkındalığa sahip yüksek kaliteli çift dilli yetenekler sunarak görsel üretim alanında önemli bir boşluğu doldurur.
AnimateDiff Img2Vid
AnimateDiff Img2Vid, AnimateDiff çerçevesinin görselden videoya boru hattı uzantısıdır ve AnimateDiff'i benzersiz şekilde çok yönlü kılan tak-çıkar hareket modülü yaklaşımını kullanarak statik görselleri canlandırır. Eylül 2023'te yayınlanan bu boru hattı, referans görseli girdi olarak alır ve görselin görsel özelliklerini, stilini ve kompozisyon öğelerini koruyan animasyonlu diziler üretir. Mimari, giriş görselini Stable Diffusion modelinin gizli uzayına kodlar ve ardından tutarlı bir animasyonlu dizi oluşturan kare kare hareket üretmek için AnimateDiff hareket modülünün zamansal dikkat katmanlarını uygular. Bu yaklaşım AnimateDiff ekosisteminin tüm esneklik avantajlarını miras alır; kullanıcılar img2vid boru hattını stile özgü animasyon için uyumlu Stable Diffusion kontrol noktalarıyla, özelleştirme için LoRA modelleriyle ve yapısal rehberlik için ControlNet modülleriyle birleştirebilir. Model, üretilen animasyonun hızı ve dinamizmi üzerinde yaratıcı kontrol sağlayan özelleştirilebilir kare sayıları, kare hızları ve hareket yoğunlukları ile animasyonlu döngüler ve kısa video dizileri üretir. AnimateDiff Img2Vid; fotoğraflar, dijital illüstrasyonlar, anime sanatı, konsept tasarımlar ve stilize sanat eserleri dahil çeşitli giriş türlerini yöneterek her girdinin içeriğine ve görsel stiline uygun hareket kalıpları üretir. Yaygın uygulamalar arasında animasyonlu sosyal medya içeriği, statik illüstrasyonlardan hareketli sanat eserleri, animasyonlu ürün vitrinleri ve konsept sanatını canlandırma yer alır. Apache 2.0 lisansı altında Hugging Face, Replicate ve fal.ai üzerinde erişilebilir olup maksimum yaratıcı kontrol için çeşitli ControlNet ve LoRA yapılandırmalarını birleştiren gelişmiş çok adımlı animasyon hatlarını mümkün kılan ComfyUI iş akışları aracılığıyla kapsamlı topluluk desteğine sahiptir.
MODNet
MODNet (Matting Objective Decomposition Network), ZHKKKe tarafından geliştirilen, önceden tanımlanmış trimap veya ek kullanıcı girdisi gerektirmeden gerçek zamanlı insan portresi arka plan kaldırma için tasarlanmış açık kaynaklı bir portre matlama modelidir. Manuel trimap gerektiren geleneksel matlama yaklaşımlarının aksine MODNet, karmaşık matlama hedefini üç alt göreve ayrıştırarak tam otomatik portre matlaması gerçekleştirir: kişi bölgesini tanımlayan anlamsal tahmin, saç ve giysi sınırlarındaki kenar kalitesini iyileştiren detay tahmini ve her iki sinyali yüksek kaliteli alfa matına birleştiren anlamsal-detay füzyonu. Bu ayrıştırma, gerçek zamanlı hızlarda verimli tek geçişli çıkarım sağlayarak gecikmenin kritik olduğu video konferans, canlı yayın ve mobil fotoğrafçılık uygulamaları için pratik kılar. Model, segmentasyon tabanlı yaklaşımlar için zorlayıcı olan saç telleri, kumaş kenarları ve ince sınır detaylarını ele almada güçlü, pürüzsüz ve doğru alfa matlar üretir. Hem görsel hem video girişini destekleyen MODNet, titreşim olmadan kararlı video matlama için zamansal tutarlılık optimizasyonları sunar. Mobil cihazlarda ve kenar donanımda çalışacak kadar hafiftir; ONNX dışa aktarma desteğiyle iOS, Android ve WebAssembly aracılığıyla web tarayıcılarında dağıtım mümkündür. Yaygın uygulamalar video görüşme arka plan değiştirme, portre modu fotoğrafçılık, sosyal medya içerik oluşturma, sanal deneme sistemleri ve film post-prodüksiyonunda yeşil ekran alternatifleridir. Apache 2.0 lisansıyla yayınlanan MODNet, hem araştırma hem üretim portre matlama uygulamalarında yaygın biçimde benimsenmiş ücretsiz ve verimli bir çözüm sunar.
Tripo AI v2
Tripo AI v2, Stability AI ile birlikte TripoSR'yi geliştiren Tripo AI'ın ikinci nesil 3D model üretim platformudur. 2024'te yayınlanan Tripo v2, TripoSR'nin hız ve erişilebilirlik temellerini alarak önemli kalite iyileştirmeleri, animasyon yetenekleri ve üretime yönelik özellikler ekler. Model, geliştirilmiş geometrik doğruluk, daha iyi doku kalitesi ve rigged ve animasyonlu çıktı desteğiyle metin açıklamalarından ve tek görsellerden detaylı 3D mesh'ler üretir. Tripo v2'nin öne çıkan özelliği, otomatik iskelet bağlama ile rigged 3D karakterler üreterek animasyon ve oyun geliştirme boru hatlarında anında kullanımı mümkün kılmasıdır. PBR hazır dokulu mesh'ler GLB, FBX, OBJ ve USDZ formatlarında dışa aktarılabilir. Temel modeller için 10 saniyenin altında, animasyon rigging ile daha yüksek kaliteli çıktılar için 1-2 dakikada üretim hızı sunar. Platform, oyun geliştiricileri, 3D sanatçılar, AR/VR içerik üreticileri ve ürün tasarımcılarına hizmet eder.
FidelityFx Super Resolution
FidelityFX Super Resolution (FSR), AMD tarafından geliştirilen, özellikle video oyunları olmak üzere gerçek zamanlı render uygulamalarında performansı artırmak için tasarlanmış açık kaynaklı mekansal büyütme teknolojisidir. NVIDIA'nın özel Tensor Core gerektiren DLSS'inin aksine, FSR donanımdan bağımsız çalışır ve AMD, NVIDIA, Intel GPU'larında hatta entegre grafiklerde bile sorunsuz kullanılabilir. Teknoloji birden fazla nesil boyunca evrilmiştir: FSR 1.0 tek kare üzerinde Lanczos tabanlı mekansal büyütme kullanırken, FSR 2.0 hareket vektörleri ve önceki kare verilerinden yararlanan zamansal büyütme ile neredeyse yerel çözünürlük kalitesi sunmuş, FSR 3.0 ise optik akış tabanlı kare üretimi ekleyerek algılanan kare hızını dramatik biçimde artırmıştır. Ultra Quality'den Ultra Performance'a uzanan beş farklı kalite modu, kullanıcılara görsel sadakat ile 2x ve üzeri performans kazanımı arasında denge kurma imkanı tanır. FSR; DirectX 11, DirectX 12 ve Vulkan API'lerini destekler ve PC platformlarının yanı sıra Xbox, PlayStation ve Steam Deck gibi taşınabilir cihazlarda da yaygın biçimde kullanılır. Cyberpunk 2077, Starfield ve Hogwarts Legacy dahil yüzlerce büyük yapım FSR entegrasyonu sunar; Unreal Engine ve Unity oyun motorları düzeyinde doğrudan destek sağlayarak geliştirici benimsemesini kolaylaştırır. MIT lisansı ile AMD'nin GPUOpen platformunda yayınlanan FSR, geliştiricilere ve araştırmacılara şeffaf işbirliği ve modifikasyon imkanı sunar. Platform bağımsızlığı ve açık kaynak yapısı, onu oyun endüstrisinde en yaygın kullanılan görsel büyütme çözümlerinden biri haline getirmiştir.
MotionDiffuse
MotionDiffuse, Mingyuan Zhang ve ekibi tarafından geliştirilen ve doğal dil metin açıklamalarından gerçekçi 3D insan hareket dizileri üreten öncü bir difüzyon modelidir. Model, 'bir kişi ileri yürüyor ve el sallıyor' veya 'birisi arka takla atıyor' gibi metin promptları alarak doğal vücut dinamikleri ve fiziksel tutarlılıkla karşılık gelen 3D iskelet tabanlı animasyon verisi üretir. Yaklaşık 200 milyon parametreli difüzyon mimarisi üzerine inşa edilen MotionDiffuse, insan hareketinin doğal çeşitliliğini yakalayan olasılıksal hareket üretimi sunarak aynı metin girdisi için birden fazla makul hareket varyasyonu oluşturur. Model, hem tek eylem hem de ardışık çoklu eylem üretimini destekleyerek farklı aktiviteler arasında akıcı geçişler yapan karmaşık hareket dizilerinin oluşturulmasını sağlar. MotionDiffuse, HumanML3D ve KIT-ML dahil büyük ölçekli hareket yakalama veri setleri üzerinde eğitilmiştir ve semantik açıklamaları tüm vücut iskeleti boyunca fiziksel olarak gerçekçi eklem rotasyonlarına ve ötelemelerine eşlemeyi öğrenmiştir. Üretilen hareket verileri, Blender, Maya ve Unity dahil 3D animasyon yazılımlarıyla uyumlu standart formatlarda dışa aktarılabilir. MIT lisansı altında yayınlanan model, hem araştırma hem de ticari uygulamalar için tamamen açık kaynaklıdır. Temel kullanım alanları arasında oyunlar ve filmler için karakter animasyonları üretme, poz tahmin modelleri için eğitim verisi oluşturma, koreografi prototipleme, VR ve AR avatar hareketleri üretme ve geleneksel olarak yetenekli hareket yakalama sanatçıları gerektiren tekrarlayan animasyon görevlerini otomatikleştirme yer alır.
Open-Sora
Open-Sora, HPC-AI Tech tarafından yüksek kaliteli video üretim araştırma ve yeteneklerine erişimi demokratikleştirmek amacıyla geliştirilen, OpenAI'nın Sora video üretim modelinin açık kaynak reprodüksiyonudur. Mart 2024'te yayınlanan Open-Sora, Sora'nın çığır açıcı video üretim yaklaşımının arkasındaki temel ilkeleri kopyalamayı hedeflerken tüm eğitim hattını, model mimarisini ve ağırlıkları araştırma topluluğuna serbestçe sunar. 1,1 milyar parametreli bir transformer mimarisi üzerine inşa edilen Open-Sora, metin açıklamalarını bir dil modeli kodlayıcısı aracılığıyla işler ve sıkıştırılmış bir gizli uzayda difüzyon tabanlı gürültü giderme süreciyle video içeriği üretir. Proje, hem kare içi görsel ilişkileri hem de kareler arası zamansal dinamikleri yakalayan uzamsal-zamansal bir dikkat mekanizması uygulayarak tutarlı hareket ve sahne evrimi içeren videoların üretilmesini sağlar. Open-Sora, çoklu çözünürlük çıktılarını ve değişken uzunlukta video üretimini destekler ve model farklı platformlara uygun çeşitli en boy oranlarında klipler üretebilir. Proje, üretim kalitesini, hareket tutarlılığını ve prompt uyumunu aşamalı olarak iyileştiren düzenli sürüm güncellemeleriyle iteratif bir geliştirme yaklaşımı izler. Mevcut model, Sora veya Runway Gen-3 gibi ticari alternatiflerin kalitesiyle eşleşmese de tescilli kısıtlamalar olmadan video üretim teknolojisini anlama ve ilerletme için paha biçilmez bir araştırma platformu sağlar. Apache 2.0 lisansı altında sunulan Open-Sora, Hugging Face ve Replicate üzerinde erişilebilir olup tam eğitim kodu ve veri hattı belgeleri reprodüksiyon ve genişletme için kamuya açıktır. Proje, büyük ölçekli çok modlu modeller için video üretimi, zamansal modelleme ve verimli eğitim stratejileri üzerine akademik çalışmalara temel teşkil ederek yapay zeka araştırma topluluğundan önemli ilgi çekmiştir.
PuLID
PuLID, ByteDance tarafından geliştirilen ve kişiselleştirilmiş portreler oluşturmak için Saf ve Yıldırım Hızında Kimlik (Pure and Lightning ID) özelleştirme yaklaşımı sunan kimlik korumalı görsel üretim modelidir. Nisan 2024'te yayınlanan PuLID, uzun ince ayar süreçleri gerektirmeden farklı üretilen görsellerde kişinin kimlik özelliklerini koruma temel sorununu ele alır. Model, önceden eğitilmiş difüzyon modelleriyle doğrudan çalışan yeni bir karşıtsal hizalama kaybı ve doğru kimlik kaybı mekanizması aracılığıyla bunu başarır ve özellikle SDXL ve FLUX mimarileriyle entegre olur. PuLID'ın temel yeniliği, kimlik özelliklerini poz, ifade ve arka plan gibi diğer görsel niteliklerden ayırabilme yeteneğinde yatmaktadır. Bu sayede öznenin kimliği tutarlı kalırken diğer tüm yönler serbestçe değiştirilebilen yüksek düzeyde kontrol edilebilir üretim sağlar. Model, referans görselleri InsightFace tabanlı bir kimlik kodlayıcısı aracılığıyla işleyerek güçlü yüz özellik temsilleri çıkarır ve bunları özelleştirilmiş adaptör katmanları üzerinden üretim hattına enjekte eder. Bu yaklaşım, kişi başına herhangi bir eğitim gerektirmeden gerçek zamanlı kişiselleştirme sağlayarak DreamBooth veya metin inversiyonu gibi alternatiflere göre önemli ölçüde hızlı çalışır. PuLID; kişiselleştirilmiş avatar oluşturma, sosyal medya içerik üretimi, sanal deneme senaryoları ve kimlik tutarlı çoklu sahne illüstrasyonu gibi uygulamalarda öne çıkar. Apache 2.0 lisansı altında açık kaynak olarak yayınlanan PuLID, Hugging Face üzerinde erişilebilir ve fal.ai gibi platformlar aracılığıyla desteklenerek araştırmacılara ve içerik üreticilerine minimum hesaplama yüküyle güçlü bir kimlik korumalı görsel üretim aracı sunar.
OpenJourney
Openjourney, PromptHero tarafından oluşturulan ve özellikle Midjourney çıktılarının ayırt edici sanatsal stilini kopyalamak için eğitilmiş açık kaynaklı bir Stable Diffusion ince ayar modelidir. Model, Midjourney'i ünlü yapan karakteristik canlı renkler, dramatik aydınlatma, sinematik kompozisyonlar ve resimsel estetiği öğrenerek küratörlü bir Midjourney tarafından üretilmiş görsel veri setinde ince ayarlanmıştır. Promptlarda tetikleyici anahtar kelime kullanarak kullanıcılar, Midjourney aboneliği gerektirmeden Midjourney benzeri kalitede görseller üretebilir. Openjourney, Stable Diffusion 1.5 üzerine inşa edilmiştir ve bu sayede hafif yapıda olup 4GB kadar düşük VRAM ile tüketici GPU'larında erişilebilir şekilde çalıştırılabilir. Model, açık kaynak AI sanat hareketinin ilk günlerinde, abonelik hizmetini karşılayamayan veya erişemeyen kullanıcılar için Midjourney esinli bir estetiğe erişimi demokratikleştirerek büyük popülerlik kazanmıştır. img2img, inpainting ve ControlNet koşullandırma dahil tüm standart Stable Diffusion özelliklerini destekler. Hugging Face ve CivitAI üzerinde mevcut olan Openjourney, ComfyUI, Automatic1111 ve diğer popüler Stable Diffusion arayüzleriyle entegre olur. Dijital sanatçılar, hobi sahipleri, içerik üreticileri ve yaratıcı uygulamalar geliştiren yazılımcılar birincil kullanıcı kitlesini oluşturur. SDXL ve FLUX.1 gibi daha yeni modeller çıktı kalitesini aşmış ve Midjourney stili Openjourney'in yakaladığının ötesinde önemli ölçüde evrimleşmiş olsa da model, sanatsal görsel üretim için hafif bir seçenek olarak ve açık kaynak AI topluluğunda ince ayar yoluyla stil transferinin tarihsel açıdan önemli bir örneği olarak geçerliliğini korumaktadır.
Riffusion
Riffusion, Stable Diffusion v1.5'in ince ayarlı bir versiyonunu kullanarak spektrogramları görsel olarak üreten yenilikçi bir AI müzik üretim modelidir. 2022 sonlarında Seth Forsyth ve Hayk Martiros tarafından yan proje olarak oluşturulan Riffusion, görsel difüzyon modellerinin müziğin spektrogram temsilleri üzerinde eğitilerek ses üretimi için yeniden kullanılabileceğini göstermiştir. Model müzikal türleri, enstrümanları, ruh hallerini ve stilleri tanımlayan metin komutlarına koşullu mel spektrogramları üretir ve bunlar Griffin-Lim algoritması veya sinirsel vokoderleri kullanılarak ses dalga biçimlerine geri dönüştürülür. Müzik üretimine bu görsel tabanlı yaklaşım yayınlandığı dönemde çığır açıcıydı ve Stable Diffusion'ın güçlü üretken yeteneklerinin ses alanına aktarılabileceğini gösterdi. Riffusion rock, caz, elektronik, klasik ve ambient dahil çeşitli tarzlarda kısa müzik klipleri üretebilir ve farklı komutlar arasında gerçek zamanlı enterpolasyon sayesinde pürüzsüz müzikal geçişler sağlar. Model Stable Diffusion tabanından devralınan yaklaşık 1 milyar parametreye sahiptir. MIT lisansı altında yayınlanan Riffusion ince ayarlı model ağırlıkları, eğitim kodu ve etkileşimli web uygulamasıyla GitHub üzerinde tamamen açık kaynaklıdır. MusicGen ve Suno gibi daha yeni amaca yönelik müzik üretim modelleri çıktı kalitesi ve süre açısından Riffusion'ı geçmiş olsa da model AI müzik üretiminde yaygın ilgiyi ateşleyen kavram kanıtı olarak tarihsel önemini korumaktadır. Riffusion görsel üretim ile ses sentezi kesişimini keşfeden hobiciler ve araştırmacılar tarafından kullanılmaya devam etmekte ve yaratıcı AI müzik uygulamaları için ilham kaynağı olmaktadır.
DynamiCrafter
DynamiCrafter, Tencent tarafından geliştirilen ve doğal hareket ile zamansal tutarlılıkla dinamik içerik üretmek için video difüzyon önceliklerinden yararlanarak durağan görselleri canlandıran açık kaynaklı bir görsel animasyon modelidir. Ekim 2023'te yayınlanan DynamiCrafter, modelin ek hareket rehberliği olmadan tek bir statik görselden makul hareket kalıplarını çıkarması gereken açık alan görsel animasyonu görevini ele alır. 1,4 milyar parametreli difüzyon mimarisi üzerine inşa edilen model, hareket önceliği olarak önceden eğitilmiş video difüzyon modelini kullanarak üretimi giriş görseli üzerinde koşullandırır ve kaynağın görsel özelliklerini korurken uygun zamansal dinamikler ekleyen animasyonlar üretir. Mimari, görsel anlama ile öğrenilmiş hareket kalıplarını birleştirerek hareketli öğeler içeren manzaralar, ince ifadeli portreler, mimari sahneler ve sanatsal kompozisyonlar dahil çeşitli içerikleri canlandırır. DynamiCrafter, uzamsal yerleşimi ve derinlik ilişkilerini saygılayan fiziksel olarak makul animasyonlar üretmede güçlüdür ve çarpıtma bozulmaları ile doğal olmayan deformasyonlardan kaçınır. Çoklu çözünürlük çıktılarını ve değişen uzunluklarda animasyonlar üretmeyi destekler. Kullanım alanları arasında sosyal medya için animasyonlu fotoğraflar, sunumlar için dinamik arka planlar, sanat eserlerini canlandırma ve yaratıcı projeler için görsel efektler üretme yer alır. Apache 2.0 lisansı altında Hugging Face, Replicate ve fal.ai üzerinde erişilebilir olup popüler yaratıcı iş akışlarına entegrasyon yoluyla topluluk tarafından benimsenmiştir. Model, statik görsel varlıklara manuel animasyon becerileri olmadan hareket eklenmesi gereken içerik üreticileri için pratik bir çözüm sunarak denetimsiz görsel animasyonda önemli bir ilerlemeyi temsil eder.
IP-Adapter Style
IP-Adapter Style, Tencent'in IP-Adapter çerçevesinin difüzyon modeli görsel üretim pipeline'larında sanatsal stil transferine odaklanan uzmanlaşmış bir varyantıdır. Referans görsellerden hem içerik hem stil aktaran standart IP-Adapter'ın aksine, Style varyantı yalnızca renk paletleri, fırça darbeleri, doku özellikleri ve sanatsal atmosfer gibi stilistik nitelikleri çıkarıp uygulamak üzere tasarlanmıştır ve metin promptunun içerik kontrolünü korumasına izin verir. Model, stil referans görsellerini CLIP görsel encoder aracılığıyla kodlar ve çıkarılan stil özelliklerini Stable Diffusion modellerinin çapraz dikkat katmanlarına stil ile içerik bilgisini ayıran ayrıştırılmış dikkat mekanizmaları yoluyla enjekte eder. Bu sıfır atışlı yaklaşım hedef stil üzerinde ince ayar gerektirmez, bu sayede herhangi bir referans görselle anında kullanılabilir. Kullanıcılar bir ağırlık parametresiyle stil etkisinin gücünü ayarlayarak referans stilin çıktıyı ne kadar etkilediğini prompt uyumunu koruyarak hassas biçimde kontrol edebilir. IP-Adapter Style hem SD 1.5 hem SDXL mimarileriyle uyumludur ve ComfyUI ile Diffusers tabanlı iş akışlarına sorunsuz entegre olur. Yapısal rehberlik için ControlNet ile birleştirilebilir ve ek özelleştirme için LoRA modelleriyle birlikte çalışabilir. İllüstrasyon serileri genelinde görsel tutarlılık, belirli sanatsal estetikler uygulama, marka kimliğiyle tutarlı içerik oluşturma ve yaratıcı stil varyasyonlarını keşfetme başlıca uygulamaları arasındadır. Apache 2.0 lisansıyla açık kaynaklı olan model, hafif yapısıyla AI sanat iş akışlarında stil kontrollü görsel oluşturma için standart araç haline gelmiştir.
Neural Style Transfer
Neural Style Transfer, Leon Gatys, Alexander Ecker ve Matthias Bethge tarafından 2015'teki çığır açan makalelerinde tanıtılan, evrişimli sinir ağlarının görsellerin içerik ve stilini ayırıp yeniden birleştirebildiğini gösteren öncü algoritmadır. Algoritma iki giriş görseli alır: bir içerik görseli ve bir stil referansı. Ardından, önceden eğitilmiş VGG-19 ağından çıkarılan özellik temsillerini kullanarak birinin içerik yapısını diğerinin sanatsal stilini eş zamanlı yakalayan bir çıktıyı iteratif olarak optimize eder. Derin katmanlar nesne şekilleri ve mekansal düzenlemeler gibi üst düzey içerik bilgilerini yakalarken, sığ katmanlar dokular, renkler ve fırça darbeleri gibi stil özelliklerini kodlar. Bu özellik temsillerine dayanan ayrı içerik ve stil kayıp fonksiyonları tanımlanıp ağırlıklı kombinasyonları gradyan inişi ile minimize edilerek, fotoğrafların tanınabilir içeriğini koruyup tabloların veya diğer sanat eserlerinin görsel estetiğini benimseyen görseller üretilir. Bu temel çalışma, AI destekli sanatsal görsel dönüşümü alanının tamamını başlatmış ve çok sayıda gerçek zamanlı varyant, mobil uygulama ve ticari ürüne ilham kaynağı olmuştur. Orijinal optimizasyon tabanlı yaklaşım GPU'da görsel başına birkaç dakika gerektirirken, Johnson ve diğerlerinin sonraki ileri beslemeli ağ yaklaşımları gerçek zamanlı performansa ulaşmıştır. Algoritma tamamen açık kaynaklıdır ve PyTorch, TensorFlow ile diğer framework'lerde çok sayıda uygulaması mevcuttur. Neural Style Transfer, bilgisayar görüşü eğitiminde temel bir referans noktası olmaya ve modern stil transferi araştırmalarını ile üretken yapay zeka geliştirmelerini etkilemeye devam etmektedir.
StableSR
StableSR, Jianyi Wang ve işbirlikçileri tarafından geliştirilen, gerçekçi detay sentezi ile yüksek kaliteli görsel büyütme için önceden eğitilmiş bir Stable Diffusion modelinin üretken öncülünden yararlanan yenilikçi bir süper çözünürlük modelidir. 2023'te Apache 2.0 lisansı altında yayınlanan StableSR, difüzyon tabanlı üretken modellerin görsel süper çözünürlük görevine ilk başarılı uygulamalarından birini temsil eder. Model düşük çözünürlüklü giriş görselinden bilgiyi her zaman adımında Stable Diffusion gürültü giderme sürecine enjekte eden zaman farkındalıklı bir kodlayıcı ile orijinal görsele sadakat ve üretilen detayların zenginliği arasında denge kuran kontrol edilebilir özellik sarma modülü tanıtır. Bu mimari StableSR'nin geleneksel regresyon tabanlı süper çözünürlük yöntemlerinin elde edemeyeceği dikkat çekici derecede gerçekçi dokular ve ince detaylarla büyütülmüş görseller üretmesini sağlar. Kontrol edilebilir özellik sarma kullanıcıların üretken iyileştirmenin gücünü ayarlamasına olanak tanır ve girdiye yakından uyan muhafazakar restorasyondan daha fazla sentezlenmiş detay ekleyen agresif iyileştirmeye kadar bir yelpaze sunar. StableSR fotoğraflar, sanat eserleri, ekran görüntüleri ve metin içeren görseller dahil çeşitli görsel türlerini işler ve özellikle cilt, saç, kumaş ve yaprak gibi doğal dokuları restore etmede güçlüdür. Model kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır ve mevcut Stable Diffusion altyapısıyla uyumludur. StableSR düşük çözünürlüklü görselleri restore eden fotoğrafçılar, referans materyali büyüten dijital sanatçılar ve sınırlı kaynak görsellerinden yüksek çözünürlüklü çıktılara ihtiyaç duyan içerik üreticileri için değerlidir. Difüzyon tabanlı yaklaşımı üretken süper çözünürlük yöntemlerindeki sonraki araştırmaları etkilemiştir.
172 model bulundu · Sayfa 6 / 8