Bu sayfada
Ses klonlama, bir kişinin sesini yapay zeka ile kopyalayıp o seste yeni içerik üretme teknolojisidir. Kısa bir ses kaydından bir sesin tınısını öğrenir ve ardından o sesle konuşma üretebilir veya başka bir kaydı o sese dönüştürebilir. Bu rehberde ses klonlamanın nasıl çalıştığını, ses dönüştürmeden farkını ve açık kaynak araçlarla adım adım nasıl yapacağınızı öğreneceksiniz.
Ses Klonlama ve Ses Dönüştürme: İki Farklı Yaklaşım
Önce iki temel paradigmayı ayırt etmek gerekir. Ses dönüştürme (voice-to-voice), mevcut bir ses kaydını alır ve hedef bir sesin tınısına çevirir; orijinal perde, ritim ve duyguyu korur. RVC v2 ve So-VITS-SVC bu yaklaşımı kullanır ve AI şarkı cover'ları ile gerçek zamanlı ses değiştirme için idealdir. Ses klonlama / TTS (text-to-speech) ise metinden, kısa bir referans klibiyle klonlanan seste yeni konuşma üretir; OpenVoice, XTTS v2 ve F5-TTS bu gruptadır ve seslendirme ile asistan sesleri için uygundur. Hangi yöntemi seçeceğiniz amacınıza bağlıdır.
Adım 1: Doğru Aracı Seçin
İhtiyacınıza göre bir araç seçin. Mevcut bir vokali başka bir sese dönüştürmek (cover, gerçek zamanlı ses değiştirme) istiyorsanız RVC v2 en pratik seçimdir; gerçek zamanlı çalışır, az VRAM ister ve MIT lisanslıdır. Şarkı dönüştürmede maksimum nüans için So-VITS-SVC tercih edilebilir. Metinden, eğitim gerektirmeden çok dilli konuşma üretmek istiyorsanız OpenVoice (zero-shot, MIT) uygundur. Çok dilli TTS için XTTS v2 (17 dil) bir seçenektir ancak ağırlıkları ticari değildir.
Adım 2: Kaliteli Ses Verisi Hazırlayın
Sonuç kalitesi büyük ölçüde girdi verisine bağlıdır. RVC gibi eğitim gerektiren araçlar için temiz, gürültüsüz, tek konuşmacılı kayıtlar toplayın; genellikle ~10 dakikalık net ses iyi sonuç için yeterlidir, daha fazlası daha iyidir. Arka plan müziği ve gürültüyü ayırın (RVC, UVR5 vokal ayırma içerir), kayıtları 44.1 kHz mono'ya getirin ve sessizlikleri kırpın. OpenVoice gibi zero-shot araçlar için yalnızca kısa, temiz bir referans klibi yeterlidir; eğitim gerekmez.
Adım 3: Modeli Eğitin (Gerekiyorsa)
RVC ve So-VITS-SVC, hedef ses için bir model eğitmenizi gerektirir. RVC'de WebUI üzerinden veriyi yükler, özellik çıkarımı (HuBERT/ContentVec) ve perde çıkarımı (RMVPE) yapar, ardından eğitimi başlatırsınız; ~4 GB VRAM'li bir GPU ile bu işlem tipik olarak yarım ila bir saat sürer. So-VITS-SVC daha fazla VRAM (~10 GB) ve daha uzun süre ister. OpenVoice ve diğer zero-shot araçlarda bu adım yoktur — doğrudan çıkarıma geçersiniz.
Adım 4: Çıkarım — Sesi Üretin veya Dönüştürün
Model hazır olduğunda (veya zero-shot araçta doğrudan), çıktıyı üretirsiniz. RVC'de bir kaynak vokal yükler, index_rate gibi parametrelerle tını sızıntısını ayarlar ve dönüştürülmüş sesi alırsınız; gerçek zamanlı modda mikrofonunuzu da kullanabilirsiniz. OpenVoice'ta bir metin ve kısa referans klibi verir, klonlanan seste konuşma üretirsiniz. İlk denemede mükemmel sonuç beklemeyin; parametreleri ve veri kalitesini iyileştirerek ilerleyin.
Adım 5: Sonucu İyileştirin
Çıktıda tını sızıntısı (kaynak sesin izleri), pes/tiz tutarsızlığı veya yapay tınılar duyabilirsiniz. RVC'de index_rate ve perde ayarlarını, So-VITS-SVC'de shallow diffusion ve kodlayıcı seçimini deneyin. Eğitim verisini çeşitlendirmek ve temizlemek çoğu zaman en büyük kalite artışını sağlar. Gerçek zamanlı kullanımda gecikmeyi azaltmak için ASIO ses aygıtları ve uygun tampon boyutları kullanın.
Etik ve Yasal Kullanım
Ses klonlama güçlü olduğu kadar hassas bir teknolojidir. Yalnızca kendi sesinizi veya açık, bilgilendirilmiş izin aldığınız sesleri klonlayın. Gerçek bir kişinin sesini rızası olmadan klonlamak kişilik hakkı ihlali, şarkı cover'larında telif sorunları ve deepfake/dolandırıcılık açısından ciddi yasal riskler doğurur. ABD'de FCC AI sesli robocall'ları yasakladı, FTC kimliğe bürünmeyi düzenledi; AB AI Yasası (Madde 50) sentetik sesin makine-okunur biçimde işaretlenmesini gerektiriyor. Sentetik içeriği her zaman şeffaf biçimde belirtin.
Sıkça Sorulan Sorular
Ses klonlama ücretsiz mi? Evet — RVC v2 ve OpenVoice MIT lisanslı (ticari serbest), So-VITS-SVC AGPL-3.0, XTTS v2 ve F5-TTS'in ağırlıkları ticari olmayan lisanslıdır. Hangisi en kolay? Eğitim gerektirmeyen OpenVoice anlık (zero-shot) klonlama için en kolayıdır; cover ve gerçek zamanlı için RVC v2 dengeli bir seçimdir. Türkçe çalışır mı? RVC ve So-VITS-SVC büyük ölçüde dilden bağımsızdır; OpenVoice ve XTTS çok dillidir, Türkçe sonucu temel modelin dil desteğine bağlıdır.