Görselden 3D Modelleri

Görselden 3D için en iyi AI modellerini keşfet

13 model bulundu
TripoSR icon

TripoSR

Stability AI & Tripo|N/A

TripoSR, Stability AI ve Tripo AI tarafından ortaklaşa geliştirilen, tek giriş görsellerinden bir saniyeden kısa sürede detaylı 3D mesh'ler üreten hızlı bir ileri beslemeli 3D rekonstrüksiyon modelidir. Nesne başına dakikalar süren optimizasyon tabanlı yöntemlerin aksine, TripoSR Büyük Rekonstrüksiyon Modeli çerçevesi üzerine inşa edilmiş transformer tabanlı mimarisi sayesinde tek bir 2D fotoğraftan 3D geometriyi doğrudan tahmin eder. Model herhangi bir standart görseli girdi olarak kabul eder ve oyun motorları, 3D modelleme yazılımları ve artırılmış gerçeklik uygulamalarında kullanıma uygun dokulu 3D mesh üretir. Günlük nesneleri, mobilyaları, araçları, karakterleri ve organik şekilleri etkileyici geometrik doğruluk ve yüzey detayıyla yeniden yapılandırmada üstün performans gösterir. Mart 2024'te MIT lisansı altında yayınlanan model tamamen açık kaynaklıdır ve özel donanım gerektirmeden tüketici sınıfı GPU'larda çalışabilir. Birden fazla görselin verimli dönüşümü için toplu işleme desteği sunar ve Blender, Unity ile Unreal Engine dahil popüler 3D iş akışlarıyla sorunsuz entegre olur. Ürün fotoğraflarından hızlı 3D varlık oluşturmaya ihtiyaç duyan oyun geliştiricileri, ürün tasarımcıları ve e-ticaret ekipleri için özellikle değerlidir. Çıktı mesh'leri yapılandırılabilir çözünürlük ayarlarıyla OBJ ve GLB formatlarında dışa aktarılabilir. DINOv2 vizyon kodlayıcısı giriş görselinden zengin semantik ve yapısal özellikler çıkararak rekonstrüksiyon kalitesini artırır. TripoSR pahalı tarama ekipmanı veya manuel modelleme uzmanlığı gerektirmeden yüksek kaliteli rekonstrüksiyonu erişilebilir kılarak 3D içerik üretiminin demokratikleşmesinde önemli bir adımı temsil eder.

Açık Kaynak
4.5
TRELLIS icon

TRELLIS

Microsoft Research|Unknown

TRELLIS, Microsoft Research tarafından geliştirilen ve yeni bir Structured Latent Diffusion mimarisi kullanarak metin açıklamalarından veya tek 2D görüntülerden yüksek kaliteli 3D varlıklar üreten devrim niteliğinde bir AI modelidir. Aralık 2024'te yayınlanan TRELLIS, geometri, doku ve malzeme özelliklerini ayrı aşamalar olarak ele almak yerine eşzamanlı olarak kodlayan yapılandırılmış bir gizli uzayda çalışarak 3D içerik üretiminde temel bir ilerlemeyi temsil eder. Model, detaylı PBR (Fiziksel Tabanlı Render) dokularıyla eksiksiz 3D mesh'ler üretir ve kapsamlı manuel son işleme olmadan oyun motorları, 3D render boru hatları ve AR/VR uygulamalarında doğrudan kullanımı mümkün kılar. TRELLIS, kullanıcıların istenen nesneleri doğal dilde tanımladığı metinden 3D üretimini ve tek bir fotoğrafın kapalı bakış açılarından çıkarılan geometriyle tam 3D modele dönüştürüldüğü görüntüden 3D rekonstrüksiyonu destekler. Yapılandırılmış gizli temsil, geometrik tutarlılığı sağlar ve havada kalan geometri, doku dikişleri ve gerçekçi olmayan oranlar gibi diğer 3D üretim yaklaşımlarında görülen yaygın artefaktları önler. TRELLIS, UV haritalı dokularla GLB ve OBJ dahil standart 3D formatlarında çıktı üretir ve Blender, Unity, Unreal Engine gibi profesyonel araçlarla entegrasyonu kolaylaştırır. MIT lisansı altında tamamen açık kaynaklıdır. Temel uygulamalar arasında oyun geliştirme için hızlı 3D varlık prototipleme, mimari görselleştirme, ürün tasarım modelleri ve metaverse varlık üretimi yer alır.

Açık Kaynak
4.5
Stable Point Aware 3D (SPA3D) icon

Stable Point Aware 3D (SPA3D)

Stability AI|Unknown

Stable Point Aware 3D (SPA3D), Stability AI tarafından geliştirilen ve tek bir girdi görüntüsünden saniyeler içinde yüksek kaliteli dokulu 3D mesh'ler üreten gelişmiş bir ileri beslemeli 3D rekonstrüksiyon modelidir. Dakikalar süren işlem gerektiren yinelemeli optimizasyon tabanlı yaklaşımlardan farklı olarak SPA3D, tek bir geçişte 3D geometri ve doku tahmin eden doğrudan ileri beslemeli mimari kullanarak etkileşimli iş akışları ve üretim boru hatları için pratik hale gelir. Model, diğer tek görünüm rekonstrüksiyon yöntemlerine kıyasla geometrik tutarlılığı önemli ölçüde iyileştiren nokta bulutu hizalama teknikleri kullanır ve üretilen 3D modellerin birden fazla bakış açısından doğru oranları ve yapısal bütünlüğü korumasını sağlar. SPA3D, temiz topoloji ve UV haritalı dokularla endüstri standardı mesh çıktıları üreterek Blender, Unity, Unreal Engine ve profesyonel CAD araçlarına doğrudan içe aktarmayı mümkün kılar. Model, karakterler ve hayvanlar gibi organik şekillerden mobilya ve araçlar gibi sert yüzeyli nesnelere kadar çeşitli nesne kategorilerini işleyerek rekonstrüksiyon yaklaşımını her girdinin yapısal özelliklerine uyarlar. Stability AI Community License altında yayınlanan model, gelir tabanlı kısıtlamalarla kişisel ve ticari kullanıma açıktır. Temel uygulamalar arasında oyun geliştirme için hızlı 3D varlık oluşturma, artırılmış gerçeklik içerik üretimi, 3D baskı hazırlığı, sanal ürün fotoğrafçılığı ve e-ticaret 3D ürün gösterimleri yer alır. SPA3D özellikle konsept çizimlerinden veya fotoğraflardan hızlı 3D modeller gerektiren yaratıcı profesyoneller için değerlidir.

Açık Kaynak
4.3
Zero123++ icon

Zero123++

Stability AI|N/A

Zero123++, Stability AI tarafından geliştirilen, tek giriş görselinden bir nesnenin altı tutarlı kanonik görünümünü üreten çoklu görünüm görsel üretim modelidir. 2023'te Apache 2.0 lisansı altında yayınlanan model, orijinal Zero123 yaklaşımını önemli ölçüde iyileştirilmiş görünüm tutarlılığıyla genişletir ve modern 3D rekonstrüksiyon hatlarında kritik bir bileşen olarak hizmet eder. Zero123++ bir nesnenin tek bir fotoğrafını veya render edilmiş görselini alır ve nesnenin etrafında tam 360 derecelik aralığı kapsayan altı eşit aralıklı görünüm üretir ve bunların tümü tutarlı geometri, aydınlatma ve görünüm korur. Model çoklu görünüm tutarlılığını sağlayan özel koşullandırma mekanizmalarıyla ince ayarlı bir Stable Diffusion omurgası üzerine inşa edilmiştir. Görünümleri bağımsız üreten ve sıklıkla tutarsız sonuçlar veren orijinal Zero123'ün aksine Zero123++ tüm altı görünümü tek bir difüzyon sürecinde eş zamanlı üretir ve 3D tutarlılığı dramatik şekilde iyileştirir. Üretilen çoklu görünüm görselleri NeRF, Gaussian Splatting veya doğrudan mesh rekonstrüksiyonu gibi aşağı akış 3D rekonstrüksiyon yöntemleri için girdi görevi görerek tek bir fotoğraftan yüksek kaliteli 3D model oluşturmayı mümkün kılar. Zero123++ önceden eğitilmiş ağırlıkları Hugging Face üzerinde mevcut olan tamamen açık kaynak bir modeldir ve 3D üretim sistemleri kuran araştırmacılar ile geliştiricilere açıktır. Model birçok son teknoloji 3D üretim hattında temel bir bileşen haline gelmiş ve akademik araştırmalarda yaygın olarak kullanılmaktadır. Özellikle 2D görsellerin 3D varlıklara dönüştürülmesinin sık bir iş akışı gereksinimi olduğu oyun geliştirme, ürün görselleştirme ve sanal gerçeklik uygulamaları için değerlidir.

Açık Kaynak
4.3
Meshy v4 icon

Meshy v4

Meshy AI|undisclosed

Meshy v4, Meshy AI'ın metin açıklamalarından ve görsellerden dakikalar içinde detaylı, dokulu 3D modeller oluşturabilen 3D model üretim platformunun dördüncü neslidir. 2024'ün sonlarında yayınlanan Meshy v4, önceki sürümlere göre mesh kalitesi, doku sadakati ve topoloji optimizasyonunda büyük bir yükseltmeyi temsil eder. Model, oyun motorları, animasyon boru hatları ve 3D baskı için uygun temiz topolojiye sahip üretime hazır 3D varlıklar üretir. Hem metinden 3D'ye hem de görselden 3D'ye üretim iş akışlarını destekler. Platform, difüz, normal, pürüzlülük ve metalik haritalar dahil PBR malzemelerle dokulu mesh'ler üreterek çıktıları Unity, Unreal Engine ve Blender ile hemen uyumlu hale getirir. GLB, OBJ, FBX ve STL dahil birden fazla formatta dışa aktarım destekler. Meshy v4, geliştirilmiş detay koruma, ince yapılar ve karmaşık geometrilerin daha iyi işlenmesi ve daha doğru renk ve doku eşleme özelliklerine sahiptir. Platform oyun geliştiricileri, 3D sanatçılar, mimarlar ve ürün tasarımcılarına hizmet eder. Freemium model sınırlı ücretsiz üretim sunar.

Tescilli
4.5
InstantMesh icon

InstantMesh

Tencent|N/A

InstantMesh, Tencent tarafından geliştirilen, tek giriş görsellerinden çoklu görünüm üretimi ve seyrek görünüm rekonstrüksiyonu hattı aracılığıyla yüksek kaliteli dokulu 3D mesh'ler oluşturan ileri beslemeli bir 3D mesh üretim modelidir. Nisan 2024'te Apache 2.0 lisansı altında yayınlanan InstantMesh, tek görselden 3D rekonstrüksiyonda hem hız hem de kalite elde etmek için çoklu görünüm difüzyon modelini büyük bir rekonstrüksiyon modeliyle birleştirir. Hat önce ince ayarlı çoklu görünüm difüzyon modeli kullanarak giriş nesnesinin birden fazla tutarlı görünümünü üretir, ardından bu görünümleri üç düzlem sinirsel temsili tahmin eden transformer tabanlı bir rekonstrüksiyon ağına besler ve son olarak bu temsil dokulu bir mesh'e dönüştürülür. Bu iki aşamalı yaklaşım tek aşamalı yöntemlerden önemli ölçüde daha yüksek kaliteli sonuçlar üretirken üretim sürelerini yalnızca birkaç saniyede tutar. InstantMesh bir görsel üretim modeliyle birleştirildiğinde metinden 3D'ye iş akışlarını ve fotoğraflardan veya sanat eserlerinden doğrudan görselden 3D'ye dönüşümü destekler. Çıktı mesh'leri standart 3D yazılımlar ve oyun motorlarıyla uyumlu detaylı geometri ve doku haritaları içerir. Model karakterler, araçlar, mobilyalar ve organik şekiller dahil çok çeşitli nesne türlerini iyi geometrik sadakatle işler. Kod ve ağırlıkları GitHub ve Hugging Face üzerinde mevcut olan açık kaynak bir proje olarak InstantMesh, 3D varlık üretim hatları kuran geliştiriciler arasında popüler bir seçim haline gelmiştir. Özellikle hızlı geri dönüş ve makul kalitenin birlikte önemli olduğu oyun geliştirme, e-ticaret ürün görselleştirme ve hızlı prototipleme senaryoları için kullanışlıdır.

Açık Kaynak
4.3
Tripo AI v2 icon

Tripo AI v2

Tripo AI|undisclosed

Tripo AI v2, Stability AI ile birlikte TripoSR'yi geliştiren Tripo AI'ın ikinci nesil 3D model üretim platformudur. 2024'te yayınlanan Tripo v2, TripoSR'nin hız ve erişilebilirlik temellerini alarak önemli kalite iyileştirmeleri, animasyon yetenekleri ve üretime yönelik özellikler ekler. Model, geliştirilmiş geometrik doğruluk, daha iyi doku kalitesi ve rigged ve animasyonlu çıktı desteğiyle metin açıklamalarından ve tek görsellerden detaylı 3D mesh'ler üretir. Tripo v2'nin öne çıkan özelliği, otomatik iskelet bağlama ile rigged 3D karakterler üreterek animasyon ve oyun geliştirme boru hatlarında anında kullanımı mümkün kılmasıdır. PBR hazır dokulu mesh'ler GLB, FBX, OBJ ve USDZ formatlarında dışa aktarılabilir. Temel modeller için 10 saniyenin altında, animasyon rigging ile daha yüksek kaliteli çıktılar için 1-2 dakikada üretim hızı sunar. Platform, oyun geliştiricileri, 3D sanatçılar, AR/VR içerik üreticileri ve ürün tasarımcılarına hizmet eder.

Tescilli
4.5
Unique3D icon

Unique3D

Tencent|N/A

Unique3D, Tencent tarafından geliştirilen, çoklu görünüm üretimi, geometri rekonstrüksiyonu ve doku iyileştirmesini birleştiren çok aşamalı bir hat aracılığıyla tek giriş görsellerinden detaylı, iyi dokulu 3D mesh'ler üreten yüksek kaliteli tek görselden 3D rekonstrüksiyon modelidir. Model profesyonel 3D uygulamalarda doğrudan kullanılabilecek keskin dokular ve temiz geometriye sahip üretim kalitesinde 3D varlıklar üretmek için tasarlanmıştır. Unique3D ilk 3D rekonstrüksiyonun birden fazla çözünürlük seviyesinde aşamalı olarak geliştirildiği çok seviyeli yükseltme iyileştirme stratejisi kullanır ve tek geçişli yöntemlere kıyasla önemli ölçüde daha ince yüzey detayları ve doku kalitesi elde eder. Hat önce bir difüzyon modeli kullanarak tutarlı çoklu görünüm görselleri üretir, ardından ilk 3D mesh'i yeniden yapılandırır ve son olarak hem geometri hem de dokuya yinelemeli yükseltme ve iyileştirme uygular. Bu yaklaşım karmaşık desenlere veya ince yapılara sahip nesneler için bile keskin doku detayları ve iyi tanımlanmış geometrik özelliklerle mesh'ler üretir. Mayıs 2024'te Apache 2.0 lisansı altında yayınlanan Unique3D kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır. Model karakterler, hayvanlar, üretilmiş ürünler ve sanatsal nesneler dahil çeşitli nesne türlerini işler. Çıktı mesh'leri standart 3D yazılımlarla uyumlu yüksek çözünürlüklü doku haritaları ve düzgün UV koordinatları içerir. Unique3D özellikle 3D varlıkların kalitesinin nihai çıktıyı doğrudan etkilediği oyun geliştirme, animasyon, ürün görselleştirme ve dijital içerik üretimi alanlarındaki profesyonel iş akışları için uygundur. Çok seviyeli iyileştirme yaklaşımı AI üretimli 3D içerikte üretim kalitesine ulaşmada önemli bir katkıyı temsil eder.

Açık Kaynak
4.3
Wonder3D icon

Wonder3D

Tsinghua University|N/A

Wonder3D, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen, yüksek kaliteli 3D mesh rekonstrüksiyonu için tek giriş görselinden hem çoklu görünüm renkli görseller hem de karşılık gelen normal haritaları üreten tek görselden 3D rekonstrüksiyon modelidir. CVPR 2024'te kabul edilen Wonder3D, RGB renk görünümleri ve geometrik normal haritaları aynı anda üreten çapraz alan difüzyon yaklaşımını tanıtır ve üretilen görünümlerin hem görsel olarak tutarlı hem de geometrik olarak doğru olmasını sağlar. Bu çift çıktılı strateji yalnızca renkli görseller üreten yöntemlere kıyasla aşağı akış 3D rekonstrüksiyonu için önemli ölçüde daha zengin bilgi sağlar. Model difüzyon süreci boyunca renk ve normal harita alanları arasında tutarlılığı zorlayan çoklu görünüm çapraz alan dikkat mekanizması kullanır ve giriş nesnesinin 3D yapısını sadakatle temsil eden tutarlı çoklu görünüm çıktıları üretir. Wonder3D tek bir fotoğraftan yaklaşık iki ila üç dakikada tam dokulu bir 3D mesh yeniden yapılandırabilir. Çıktı mesh'leri iyi tanımlanmış yüzey detaylarıyla temiz geometri sunar ve profesyonel 3D iş akışlarında kullanıma uygundur. Apache 2.0 lisansı altında yayınlanan model kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır. Wonder3D karakterler, hayvanlar, mobilyalar ve üretilmiş nesneler dahil çeşitli nesne kategorilerini tutarlı kaliteyle işler. Model özellikle sınırlı referans görsellerinden yüksek kaliteli 3D varlıklar oluşturulması gereken oyun geliştirme, animasyon, ürün görselleştirme ve sanal gerçeklik uygulamaları için değerlidir. Çapraz alan yaklaşımı 3D rekonstrüksiyon için çoklu görünüm üretimi alanındaki sonraki araştırmaları etkilemiştir.

Açık Kaynak
4.1
One-2-3-45 icon

One-2-3-45

UC San Diego|N/A

One-2-3-45, UC San Diego araştırmacıları tarafından geliştirilen, çoklu görünüm üretimini seyrek görünüm 3D rekonstrüksiyonuyla birleştiren iki aşamalı bir hat aracılığıyla tek giriş görselinden dokulu 3D mesh'ler üreten tek görselden 3D rekonstrüksiyon sistemidir. Adı temel süreci yansıtır: bir görselden iki, üç, dört, beş görünüm üret ve ardından tam bir 3D nesne yeniden yapılandır. İlk aşamada ince ayarlı bir Zero123 modeli tek giriş fotoğrafına dayalı olarak nesnenin farklı açılardan birden fazla yeni görünümünü üretir. İkinci aşamada bu üretilen çoklu görünüm görselleri tutarlı geometriye sahip dokulu bir 3D mesh üreten maliyet hacmi tabanlı seyrek görünüm rekonstrüksiyon ağına beslenir. Haziran 2023'te MIT lisansı altında yayınlanan One-2-3-45, 2D difüzyon modellerini 3D rekonstrüksiyonla birleştirmenin bir dakikanın altında makul 3D varlıklar üretebileceğini gösteren ilk sistemlerden biri olmuştur. Model günlük eşyalar, hayvanlar, araçlar ve sanatsal nesneler dahil çeşitli nesne türlerini işler. Nesne başına onlarca dakika süren optimizasyon gerektiren DreamFusion gibi optimizasyon tabanlı yaklaşımların aksine One-2-3-45 ileri beslemeli bir şekilde çalışır ve bu da onu önemli ölçüde daha hızlı kılar. Çıktı mesh'leri renk ve doku bilgisi içerir ve standart 3D uygulamalarda kullanılmak üzere dışa aktarılabilir. Kodu GitHub üzerinde mevcut olan tamamen açık kaynak bir proje olarak tek görselden 3D üretim alanındaki sonraki araştırmalar için etkili bir referans olmuştur. Sistem özellikle sınırlı giriş verisinden hızlı 3D içerik üretimini keşfeden araştırmacılar ve geliştiriciler için kullanışlıdır.

Açık Kaynak
4.0
OpenLRM icon

OpenLRM

Zexiang Xu|N/A

OpenLRM, Zexiang Xu ve işbirlikçileri tarafından geliştirilen, tek görselden 3D rekonstrüksiyon için Büyük Rekonstrüksiyon Modeli mimarisinin açık kaynak bir uygulamasıdır. Proje, tek giriş görsellerinden ileri beslemeli bir şekilde 3D temsiller tahmin etmek için transformer tabanlı mimari kullanan LRM yaklaşımının tamamen açık ve tekrarlanabilir bir uygulamasını sunar. OpenLRM bir giriş görselini DINOv2 gibi önceden eğitilmiş bir vizyon kodlayıcı aracılığıyla işler, ardından elde edilen özellikleri üç düzlem tabanlı sinirsel ışıma alanı temsili üreten bir transformer kod çözücüye besler ve bu temsil yeni bakış açılarından render edilebilir veya dokulu bir 3D mesh'e dönüştürülebilir. Tüm rekonstrüksiyon modern bir GPU'da yalnızca birkaç saniye sürer ve bu da onu etkileşimli uygulamalar ve toplu işleme iş akışları için pratik kılar. Aralık 2023'te Apache 2.0 lisansı altında yayınlanan OpenLRM, araştırmacıların inceleyebileceği, değiştirebileceği ve üzerine inşa edebileceği erişilebilir bir referans uygulama sağlayarak 3D AI araştırma topluluğundaki kritik bir boşluğu doldurur. Model çeşitli çıktı formatlarını destekler ve oyun geliştirmeden e-ticaret ürün görselleştirmesine kadar uzanan uygulamalar için mevcut 3D süreçlere entegre edilebilir. OpenLRM mobilya, araçlar, karakterler ve günlük eşyalar dahil çeşitli nesne kategorilerini makul geometrik sadakatle işler. Önceden eğitilmiş model ağırlıkları anında kullanım için Hugging Face üzerinde mevcuttur. İleri beslemeli 3D rekonstrüksiyondaki temel açık kaynak projelerden biri olarak OpenLRM, hızla gelişen tek görselden 3D üretim alanındaki birçok alt projeyi ve araştırma çalışmasını doğrudan etkilemiş ve mümkün kılmıştır.

Açık Kaynak
4.1
Era3D icon

Era3D

Alibaba|N/A

Era3D, Alibaba tarafından geliştirilen, 3D rekonstrüksiyon için tek giriş görsellerinden yüksek çözünürlüklü, kamera farkındalıklı çoklu görünüm görselleri ve normal haritaları üreten çoklu görünüm üretim modelidir. Model çoklu görünüm üretimindeki yaygın sınırlamaları ele alan iki temel yenilik sunar: giriş görselinin kamera perspektifine uyum sağlayan odak uzaklığı tahmin modülü ve rakip yöntemlerden daha yüksek çözünürlüklerde üretimi daha az GPU belleğiyle mümkün kılan verimli satır bazlı dikkat mekanizması. Era3D aşağı akış 3D mesh rekonstrüksiyonu için zengin geometrik bilgi sağlayarak 512x512 çözünürlükte karşılık gelen normal haritalarıyla birlikte altı tutarlı görünüm üretir. Kamera farkındalıklı tasarım modelin farklı perspektiflerden ve odak uzaklıklarından çekilen giriş görsellerini çıktı kalitesinde bozulma olmadan işleyebilmesi anlamına gelir ve bu sabit kamera modeli varsayan yöntemlere göre önemli bir iyileştirmedir. Satır bazlı dikkat mekanizması hesaplama açısından pahalı olan tam çapraz görünüm dikkatini yatay satırlar boyunca dikkati işleyen daha verimli bir alternatifle değiştirerek görünüm tutarlılığını korurken bellek gereksinimlerini azaltır. Mayıs 2024'te Apache 2.0 lisansı altında yayınlanan Era3D kod ve önceden eğitilmiş ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynaklıdır. Model çeşitli nesne kategorilerinde güçlü performans gösterir ve yüksek kaliteli 3D rekonstrüksiyona uygun temiz çoklu görünüm çıktıları üretir. Era3D özellikle giriş görsellerinin farklı kamera özelliklerine sahip çeşitli kaynaklardan geldiği ve nihai 3D modellerdeki ince detayları yakalamak için yüksek çözünürlüklü çoklu görünüm üretiminin gerekli olduğu profesyonel 3D içerik üretim iş akışları için değerlidir.

Açık Kaynak
4.2
SyncDreamer icon

SyncDreamer

Tsinghua University|N/A

SyncDreamer, Tsinghua Üniversitesi araştırmacıları tarafından geliştirilen, tek giriş görsellerinden nesnelerin senkronize ve 3D tutarlı görünümlerini üreten çoklu görünüm üretim ve 3D rekonstrüksiyon modelidir. 2023'te Apache 2.0 lisansı altında yayınlanan SyncDreamer, yeni bir dikkat mekanizması aracılığıyla 3D tutarlılığı sağlarken birden fazla görünümü eş zamanlı üreten senkronize çoklu görünüm difüzyon yaklaşımını tanıtır. Görünümler arasında sıklıkla tutarsız sonuçlar üreten ardışık görünüm üretim yöntemlerinin aksine SyncDreamer'ın senkronize üretim süreci tüm çıktı görünümlerinin tutarlı geometri, aydınlatma ve görünüm paylaşmasını sağlar. Model gürültü giderme sürecinde farklı bakış açısı tahminleri arasında bilgi akışına izin veren 3D farkındalıklı özellik dikkat modülüne sahip değiştirilmiş bir difüzyon mimarisi kullanır. Bu çapraz görünüm iletişimi modelin tüm üretilen görünümler arasında uzamsal tutarlılığı korumasını sağlar. Çıktı çoklu görünüm görselleri yüksek kaliteli dokulu 3D mesh'ler üretmek için NeuS veya NeRF gibi standart çoklu görünüm rekonstrüksiyon yöntemleriyle kullanılabilir. SyncDreamer nesnenin etrafında eşit aralıklı 16 görünüm üreterek doğru 3D rekonstrüksiyon için kapsamlı kapsam sağlar. Model hayvanlar, araçlar, mobilyalar ve sanatsal nesneler dahil çeşitli nesne kategorilerini iyi tutarlılıkla işler. Kod ve ağırlıkları GitHub üzerinde mevcut olan tamamen açık kaynak bir proje olarak SyncDreamer çoklu görünüm üretimi literatüründe önemli bir referans haline gelmiştir. Model özellikle 3D üretim hatları üzerinde çalışan araştırmacılar ve tek görsellerin 3D varlıklara dönüştürülmesinin yaygın bir gereksinim olduğu oyun geliştirme, ürün görselleştirme ve sanal gerçeklik içerik üretimi uygulamaları için ilgilidir.

Açık Kaynak
4.0