Ana SayfaModeller

AI Modelleri

Yaratıcı projeleriniz için en iyi AI modellerini keşfet, karşılaştır ve bul

Filtrele
172 model bulundu
Point-E icon

Point-E

OpenAI|N/A

Point-E, OpenAI tarafından geliştirilen, metin açıklamalarından iki aşamalı kademeli bir yaklaşımla renkli 3D nokta bulutları üreten bir 3D üretim sistemidir. Aralık 2022'de yayınlanan model, büyük bir AI laboratuvarından çıkan ilk halka açık text-to-3D modellerinden biri olmuştur. Sistem iki aşamada çalışır: önce metin koşullu DALL-E tabanlı bir görsel üretim modeli tanımlanan nesnenin sentetik bir görünümünü oluşturur, ardından ikinci bir difüzyon modeli bu görsele koşullu olarak 3D nokta bulutu üretir. Bu kademeli tasarım tek bir GPU'da yalnızca bir iki dakikada sonuç üretir ve saatlerce işlem gerektiren DreamFusion gibi optimizasyon tabanlı yöntemlerden çok daha hızlıdır. Üretilen nokta bulutları nesnelerin 3D şeklini ve görünümünü temsil eden binlerce renkli noktadan oluşur. Nokta bulutları üretim amaçlı 3D uygulamalar için mesh'ler kadar doğrudan kullanılabilir olmasa da Poisson yüzey rekonstrüksiyonu gibi standart algoritmalarla mesh'lere dönüştürülebilir. Point-E hayvanlar, araçlar, mobilyalar ve günlük eşyalar dahil çok çeşitli nesnelerin üretimini destekler. Model MIT lisansı altında tamamen açık kaynaklıdır ve kod ile önceden eğitilmiş ağırlıklar GitHub üzerinde mevcuttur. Hızlı metinden 3D'ye üretimde öncü bir katkı olarak Point-E, kaliteden ödün vererek dramatik hız artışı sağlamanın uygulanabilir bir yaklaşım olduğunu göstermiş ve Shap-E gibi sonraki modellerin gelişimini doğrudan etkilemiştir. Sistem 3D üretim hatlarını araştıran akademisyenler ve üretim kalitesinden ziyade hızın önemli olduğu hızlı konsept görselleştirme senaryoları için değerini korumaktadır.

Açık Kaynak
3.7
DeepFloyd IF icon

DeepFloyd IF

Stability AI|4.3B

DeepFloyd IF, Stability AI araştırma laboratuvarı olan DeepFloyd tarafından geliştirilen, donmuş T5-XXL dil modelinin metin kodlayıcısı olarak entegrasyonu aracılığıyla doğal metin anlama yeteneklerine sahip kademeli bir piksel uzayı difüzyon modelidir. Sıkıştırılmış latent uzayda çalışan Stable Diffusion gibi latent difüzyon modellerinden farklı olarak DeepFloyd IF, üç aşamalı kademeli mimari aracılığıyla doğrudan piksel uzayında çalışır. İlk aşama 64x64 temel görsel üretir, ikinci aşama 256x256'ya ölçekler ve üçüncü aşama nihai 1024x1024 çıktıyı oluşturur. Bu kademeli yaklaşım, modelin genel kompozisyon ile ince detaylar arasında olağanüstü tutarlılık korumasını sağlar. T5-XXL metin kodlayıcısı, DeepFloyd IF'e CLIP tabanlı modellerden önemli ölçüde daha güçlü prompt anlama kapasitesi verir ve özellikle görseller içinde doğru metin oluşturma, promptlarda tanımlanan uzamsal ilişkileri anlama ve karmaşık kompozisyonel talimatları takip etmede üstündür. Model, güvenilir görsel içi metin üretimi sergileyen ilk açık kaynak modellerden biri olmuştur. Araştırma lisansı altında yayınlanan DeepFloyd IF, tüm aşamalar genelinde yaklaşık 4,3 milyar parametreyle Hugging Face üzerinde mevcuttur. Tam pipeline için 16GB ve üzeri VRAM önerilir ve önemli hesaplama kaynakları gerektirir. AI araştırmacıları ve dijital sanatçılar özellikle doğru metin render veya hassas kompozisyonel kontrol gerektiren projeler için kullanır. FLUX.1 gibi daha yeni modeller genel kalitesini geçmiş olsa da DeepFloyd IF, büyük dil modeli anlayışını piksel uzayı difüzyonuyla birleştiren bir öncü olarak tarihsel önemini korumaktadır.

Açık Kaynak
4.1
Wuerstchen icon

Wuerstchen

Stability AI|1B

Wuerstchen, Stability AI araştırmacıları tarafından geliştirilen ve son derece sıkıştırılmış bir latent uzayda çalışan yeni bir üç aşamalı mimari sunarak hem eğitim hem çıkarım verimliliğinde dramatik iyileştirmeler sağlayan son derece verimli bir text-to-image üretim modelidir. Modelin temel yeniliği, Stable Diffusion gibi standart latent difüzyon modellerinin kullandığı 8 kat sıkıştırmayı çok aşan 42 kat sıkıştırma oranını latent uzayında kullanmasıdır. Bu aşırı sıkıştırma, Aşama C'nin küçük 24x24 latent temsillerle çalıştığı, Aşama B'nin bunları ara çözünürlüğe çözdüğü ve Aşama A'nın nihai çıktıyı ürettiği hiyerarşik bir yaklaşımla elde edilir. Bu agresif sıkıştırmaya rağmen Wuerstchen, çok daha hesaplama açısından pahalı modellerle rekabetçi görsel kalitesini korur. Mimari, tüketici donanımında eğitimi ve benzer çıktı kalitesindeki modellere kıyasla önemli ölçüde daha hızlı çıkarım sürelerini mümkün kılar. Wuerstchen, karşılaştırılabilir kaliteyi korurken SDXL'den önemli ölçüde daha az bellek ve hesaplama kullanarak 1024x1024 görsel üretebilir. Model, tasarım ilkelerini daha geniş dağıtım için doğrulayan Stable Cascade'in mimari temeli olarak hizmet etmiştir. Açık kaynak olarak yayınlanan Wuerstchen, Hugging Face üzerinde mevcuttur ve Diffusers kütüphanesiyle uyumludur. Verimli üretken model mimarilerini inceleyen AI araştırmacıları, kaynak kısıtlı uygulamalar geliştiren yazılımcılar ve sınırlı GPU erişimine sahip akademik kurumlar Wuerstchen'i özellikle değerli bulur. Model, aşırı latent uzay sıkıştırmasının daha az güçlü donanımda erişilebilir kılarak yüksek kaliteli görsel üretimi demokratikleştirmek için uygulanabilir bir yol olabileceğini göstermektedir.

Açık Kaynak
4.0
DCGAN Face icon

DCGAN Face

Radford et al.|N/A

DCGAN (Derin Evrişimli Üretken Çekişmeli Ağ) Face, Alec Radford, Luke Metz ve Soumith Chintala tarafından 2015'teki etkili makalelerinde tanıtılan, GAN mimarilerinde evrişimli sinir ağlarının kullanımının temel prensiplerini belirleyen öncü bir mimaridir. DCGAN, derin evrişimli ağların tutarlı görseller, özellikle insan yüzleri üretebileceğini güvenilir biçimde gösteren ilk modellerden biridir ve GAN'ları basit tam bağlı mimarilerin ötesine taşımıştır. Mimari, sonraki GAN araştırmalarında standart uygulama haline gelen tasarım ilkeleri sunar: ayrıştırıcıda havuzlama katmanlarının adımlı evrişimlerle, üreticide kesirli adımlı evrişimlerle değiştirilmesi, eğitimi stabilize etmek için toplu normalleştirme, tam bağlı gizli katmanların kaldırılması ve üreticide ReLU, ayrıştırıcıda LeakyReLU aktivasyonunun uygulanması. CelebA ünlü yüzleri veri seti üzerinde eğitilen DCGAN Face, 64x64 piksel yüz görselleri üretir; modern standartlara göre mütevazı olsa da yayın zamanında çığır açıcıydı. Model ayrıca öğrenilmiş gizli uzayda vektör işlemlerinin farklı yüzlerden özelliklerin birleştirilmesi gibi anlamsal olarak anlamlı sonuçlar ürettiğini gösteren gizli uzay aritmetiğini sergilemiştir. Bu çalışma GAN literatüründe en çok alıntı yapılan makalelerden biri haline gelmiş ve derin öğrenme eğitiminde zorunlu okuma olmaya devam etmektedir. DCGAN, PyTorch, TensorFlow ve diğer framework'lerde tamamen açık kaynaklıdır. ProGAN, StyleGAN ve difüzyon modelleri tarafından kalite açısından aşılmış olsa da evrişimli GAN'ların görsel üretim için uygulanabilir olduğunu kanıtlayan ve modern üretken modellerde hala kullanılan tasarım kalıplarını belirleyen mimari olarak tarihsel önemini korumaktadır.

Açık Kaynak
3.5

172 model bulundu · Sayfa 8 / 8