RVC v2
Évaluez RVC v2 comme flux soumis aux permissions : contrôlez ressources, paire checkpoint-index, qualité d’écoute et latence complète.
Identité et accès
- Nom du modèle
- RVC v2
- Accès
- Code officiel sous MIT ; modèles, voix, enregistrements, dépendances et services exigent leurs propres vérifications.
- Type de modèle
- Conversion vocale fondée sur la recherche
- Architecture
- Conversion vocale avec checkpoint cible, index de caractéristiques optionnel et extraction de hauteur
- Public visé
- Créateurs audio techniques capables de préparer des médias autorisés, choisir l’environnement matériel et écouter les sorties.
- Entrée
- Performance source autorisée, checkpoint vocal autorisé et, avec la recherche, index correspondant.
- Sortie
- Audio converti à vérifier pour contenu, caractère vocal, hauteur, artefacts, provenance et destination.
- Coût
- Mesurer environnement, ressources, préparation, entraînement, inférence, latence complète, écoute, correction et droits.
- À éviter
- Ne pas employer pour TTS, traduction, authentification, anonymat garanti, imitation non autorisée ou direct non mesuré.
Sources et méthode
Licence et droits
- Licence
- MIT
- Type de licence
- Open source
- Périmètre de la licence
- Code officiel sous MIT ; modèles, voix, enregistrements, dépendances et services exigent leurs propres vérifications.
- Open source
- Oui
Disponibilité
- État
- Disponible
- Périmètre de l’état
- Disponible décrit seulement le dépôt examiné et ses chemins documentés ; binaires, compatibilité et services n’ont pas été testés.
Points clés
Environnement adapté au matériel
La documentation vérifiée sépare Python 3.12 x64 et les chemins CPU, CUDA 11.8 et CUDA 12.8.
Provenance checkpoint-index
Conserver la paire avec source, version, empreinte et permission.
Mesurer la latence complète
Traiter les chiffres du README comme observations matérielles et mesurer la route entière.
Cas d’usage et limites
Évaluer une conversion hors ligne autorisée
Comparer une phrase autorisée avec index_rate à 0 puis à une valeur positive notée, après vérification du chargement de l’index associé ; conserver réglages et journaux.
Entraîner avec des voix permises
Préparer une expérience v2 documentée sans transformer dix minutes en garantie.
Tester une route en direct précise
Après acceptation hors ligne, mesurer capture, tampon, conversion, routage et lecture.
Avantages
- Le projet distingue entraînement, inférence et temps réel.
- Les chemins de dépendances et de ressources sont explicites.
- L’exécution locale peut garder les médias permis sur une infrastructure contrôlée.
Limites
- Une sortie utile exige données permises, paire compatible et écoute.
- Les dix minutes et 170/90 ms ne sont pas des garanties reproduites ici.
- MIT pour le code ne règle pas les droits sur voix, médias, dépendances ou services.
Thèmes
- RVC
- conversion vocale
À propos du modèle
Sur cette page
RVC v2 est le nom utilisé par tasarim.ai pour le flux de conversion vocale v2 documenté dans le dépôt officiel Retrieval-based-Voice-Conversion-WebUI. Il transforme une performance existante à l’aide d’un checkpoint de voix cible, avec un index de recherche et une extraction de hauteur optionnels. Une évaluation locale contrôlée exige une autorisation pour chaque enregistrement et modèle. RVC n’est ni un système de synthèse à partir de texte, ni une autorisation d’imiter quelqu’un, ni une garantie de temps réel sur un matériel non testé.
Cette évaluation repose sur le commit officiel 81eed5e8f68b6bed1789f682fe78cdd324495afc. Aucun environnement n’a été installé, aucun modèle ni audio téléchargé, aucune voix entraînée ou convertie et aucune latence ou qualité d’écoute mesurée. Le protocole ci-dessous reste une proposition sans résultats.
Définir la tâche de conversion avant de choisir RVC
Partez du signal disponible et du résultat nécessaire. RVC convertit une performance enregistrée ; il ne crée pas une phrase nouvelle depuis un texte. La source fournit les mots, le rythme, le phrasé et les mouvements de hauteur. Le checkpoint et ses contrôles façonnent le timbre converti. Si le besoin part d’un script jamais enregistré, évaluez plutôt une solution de synthèse vocale.
Écrivez un usage étroit avant de rassembler les fichiers. Par exemple, convertir une courte phrase de studio autorisée vers une seconde voix autorisée pour un essai privé. Fixez ce qui doit rester compréhensible et stable, et ce qui peut changer. « Sonner exactement comme cette personne » n’est pas un critère acceptable, car il confond préférence d’écoute, identité, consentement et provenance.
Le dépôt distingue entraînement, inférence WebUI et interface de conversion en temps réel. Une conversion hors ligne satisfaisante ne prouve pas qu’une route en direct atteindra sa cible de latence ou de stabilité. Ne vous servez pas d’une sortie pour authentifier un locuteur, prouver qu’il a parlé ou garantir son anonymat. L’identifiabilité n’a pas été mesurée ici.
Séparer code, poids vocaux, index et médias
Le dépôt fournit du code et des interfaces, pas un modèle vocal autonome. La structure actuelle attend les ressources HuBERT, le fichier RMVPE, des ressources de préentraînement v1/v2, les poids .pth dans assets/weights/ et les index .index dans assets/indices/. Les poids pymss/MSST optionnels relèvent d’une chaîne distincte de séparation vocale. Configuration et arborescence officielles.
Consignez chaque artefact séparément : auteur ou distributeur autorisé, usage permis, version et empreinte. Conservez l’association checkpoint-index ; un nom de fichier proche ne prouve ni compatibilité ni provenance. Séparez aussi les enregistrements cibles, la performance source et le résultat, avec le fournisseur, les droits de traitement et de partage, et la présence éventuelle de musique protégée.
Les commandes de téléchargement du README utilisent --revision main pour un dépôt Hugging Face. Une branche mobile est un chemin d’acquisition, pas une version binaire immuable. Lors d’un vrai essai, notez la révision résolue et calculez les empreintes locales. Aucun fichier de modèle n’a été téléchargé ou inspecté pour cette évaluation.
Préparer l’environnement matériel actuel
Au commit examiné, les instructions visent Python 3.12 x64, recommandent Ubuntu 24.04 x86_64 et décrivent aussi un environnement virtuel Windows. CPU, AMD et Intel utilisent requirments_cpu_py312.txt. Les RTX série 50 suivent une installation Torch CUDA 12.8 en deux étapes puis requirments_cu128_py312.txt. Les GPU NVIDIA antérieurs utilisent la paire CUDA 11.8 et requirments_cu118_py312.txt. L’orthographe requirments est celle du dépôt. Instructions officielles.
Choisissez un seul chemin correspondant à la machine réelle. Ne mélangez pas les fichiers CPU, CUDA 11.8 et CUDA 12.8 et ne reprenez pas un ancien guide dont Python ou les ressources diffèrent. Le README actuel place HuBERT sous assets/hubert_base/. Créez un environnement isolé et notez système, architecture, Python, Torch, torchaudio, fichier de dépendances, index de paquets, GPU et pilote.
Avant l’interface, vérifiez les ressources aux chemins documentés et l’état CUDA indiqué par Torch. Le README lance python webui.py, ou python webui.py --noautoopen sur Ubuntu sans interface graphique, au port 7865 par défaut. Ces commandes n’ont pas été exécutées ici.
Traiter les conseils d’entraînement comme un point de départ
Les mainteneurs recommandent au moins dix minutes de parole peu bruitée. Ce n’est ni une durée suffisante garantie ni une promesse d’entraînement en dix minutes. Contenu, bruit, saturation, cohérence du locuteur, plage de hauteur et sources prévues modifient le résultat. Utilisez uniquement des enregistrements autorisés, gardez l’original et documentez séparation, découpe et prétraitement.
La chaîne pymss/MSST optionnelle demande ses propres poids et ajoute une transformation à contrôler. Comparez le média prétraité à la source avant d’attribuer un artefact à RVC. Pour v2, notez pretrained_v2/*, les ressources communes et les exemples de silence sous logs/mute/. Ne mélangez pas v1 et v2. Conservez configuration, journaux, checkpoint d’inférence exporté et index correspondant comme artefacts distincts.
Réservez une phrase autorisée pour l’évaluation. Un échantillon tenu à l’écart ne crée pas un benchmark scientifique, mais évite que seul un exemple d’entraînement favorable serve de preuve.
Exécuter une évaluation bornée et contrôlée
Le test proposé utilise un checkpoint à provenance enregistrée, son index associé si la recherche est activée et deux clips autorisés. Le clip A est propre et représentatif. Le clip B isole une difficulté, par exemple une variation de hauteur plus large ou un léger bruit. Aucun clip ni résultat n’existe dans ce dossier.
Produisez d’abord une conversion hors ligne. Enregistrez mode, checkpoint, index, méthode de hauteur, transposition, contrôle de recherche, chemins et toute valeur modifiée. Gardez la source et le journal complet. Créez ensuite un second candidat en changeant un seul facteur. Un premier couple utile compare recherche désactivée et activée avec l’index correspondant. Un changement d’extracteur de hauteur appartient à un autre couple.
Avant la comparaison, repérez dans la section de conversion d’un seul fichier de l’interface hors ligne le curseur dont le libellé anglais commence par « Search feature ratio ». Dans la révision examinée, il transmet index_rate au traitement. La valeur 0 désactive la recherche dans l’index. Pour le second essai, gardez le même chemin vers un index existant et associé au checkpoint, puis notez une valeur choisie supérieure à 0 et inférieure ou égale à 1. La valeur par défaut 0.75 n’est pas une recommandation de qualité. Le clip source, le checkpoint et les autres réglages restent identiques.
Une valeur non nulle déclenche seulement une tentative : l’index doit aussi être trouvé et chargé. En cas d’échec du chargement, le code affiche une trace d’erreur dans le terminal et poursuit sans index. Conservez réglages et journal, corrigez l’erreur et ne classez pas un essai incertain parmi les résultats avec recherche activée. Le nom de l’index affiché dans le résultat ne prouve pas son utilisation : ce message vérifie uniquement l’existence du fichier. Cette correspondance vient du code de la révision examinée, pas d’un test audio. Une autre révision ou l’interface temps réel demande une vérification distincte.
N’appliquez pas une normalisation après coup à un seul candidat. Une différence de volume biaise l’écoute. Écoutez sur la route de contrôle prévue, notez saturation et coupures, et conservez les rejets. Aucun réglage n’est supposé universellement meilleur.
Appliquer des contrôles d’écoute et de provenance
Cette fiche ne contient ni note ni résultat. Remplissez-la avec les audios, réglages et observations avant de déclarer la conversion utile.
| Contrôle | Question | Preuve et condition d’arrêt |
|---|---|---|
| Droits et provenance | Source, enregistrements cibles, checkpoint et index sont-ils permis ? | Conserver autorisations et origine ; arrêter si un droit ou une source reste ambigu. |
| Contenu | Mots et limites des phrases restent-ils compréhensibles ? | Comparer à niveau d’écoute égal ; refuser omission ou ajout qui change le contenu. |
| Caractère vocal | Le résultat sert-il l’objectif autorisé sans revendication d’identité ? | Décrire les traits visés et motiver acceptation ou rejet. |
| Hauteur et rythme | Les mouvements voulus et le timing restent-ils exploitables ? | Comparer le même passage et marquer le début de l’instabilité. |
| Artefacts | Bourdonnement, métal, souffle, coupures ou fuite de la source sont-ils tolérables ? | Garder les horodatages et appliquer la tolérance convenue. |
| Livraison | Le destinataire peut-il reconnaître la transformation et retrouver source et réglages ? | Garder fichiers séparés, mention de transformation et configuration exacte. |
La destination détermine l’acceptation. Une étude privée peut tolérer un défaut qui bloque une piste vocale publiée. Un résultat séduisant doit pourtant être rejeté s’il change les mots, enfreint une permission ou ne peut être retracé. Fixez aussi un budget couvrant nettoyage, séparation, environnement, entraînement, export, inférences, écoute, correction et droits.
Mesurer le temps réel sur la route audio réelle
Le README principal annonce 170 ms de bout en bout et 90 ms avec entrée et sortie ASIO, tout en précisant que ce dernier chiffre dépend fortement du pilote matériel. Ce sont des observations des mainteneurs, ni reproduites ici ni garanties pour tout système, périphérique, tampon ou modèle. Observation officielle.
Mesurez de la capture à la sortie écoutée. Notez interface, périphérique, pilote, fréquence, tampon, matériel, modèle/index et charge parallèle. Un chronomètre d’inférence exclut capture, mise en tampon, rééchantillonnage, routage et lecture. Rapportez plusieurs essais et les coupures, pas seulement le meilleur chiffre.
Validez d’abord la qualité hors ligne. Une faible latence ne sert à rien si les mots, la hauteur ou la stabilité échouent. Si un tampon réduit le délai mais crée des coupures, conservez ce compromis. Une interface temps réel ne prouve pas une intégration DAW, OBS, Discord ou streaming ; chaque route demande son propre essai.
Diagnostiquer la première étape défaillante
Cherchez le premier artefact incohérent avant d’augmenter les époques ou plusieurs paramètres. Cette table propose des hypothèses, pas des taux d’échec mesurés.
| Observation | Vérifier d’abord | Action contrôlée |
|---|---|---|
| WebUI ne démarre pas | Python, dépendances, état Torch, chemins des ressources | Corriger l’environnement avant d’écouter. |
| Voix ou index absent | assets/weights/, assets/indices/ et association enregistrée | Restaurer les fichiers prévus et confirmer leur provenance. |
| Mots ou limites changent | Clip source, prétraitement, sortie au même niveau | Tester le contrôle propre avec même modèle et une méthode de hauteur. |
| Caractère instable ou fuite | Index associé, recherche, données cibles et phrase répétée | Changer un réglage de recherche à la fois et refuser si l’objectif échoue. |
| Hauteur cassée | Même horodatage et extracteur choisi | Comparer un second extracteur sans changer le reste. |
| Coupures en direct | Périphérique, pilote, fréquence, tampon, charge et journal de route | Stabiliser sous conditions notées puis remesurer de bout en bout. |
Un son métallique n’est pas toujours un défaut de recherche et une coupure n’est pas toujours un défaut du modèle. Séparation, rééchantillonnage, saturation, mauvaise paire checkpoint-index, extraction et routage peuvent intervenir. Arrêtez si tous les candidats échouent à un critère obligatoire ou dépassent le budget. Plus d’époques ou de données restent des expériences, pas des corrections automatiques.
Résoudre séparément les droits du code, du modèle et de la voix
Le fichier LICENSE est sous MIT. Il permet largement usage, modification et distribution du logiciel à condition de conserver les mentions, sans garantie. Cela justifie la classification open source du code examiné. Licence MIT officielle.
Cette licence n’accorde aucun droit sur checkpoints tiers, enregistrements, performances, chansons, poids optionnels ou conditions d’un service. Un checkpoint public peut manquer de provenance ou de permission. Payer une interface ne transfère pas ces droits.
Pour une voix liée à une personne, documentez l’autorisation adaptée à l’entraînement, la conversion, la divulgation, le partage et l’usage commercial. Ne présentez pas la sortie comme sa vraie parole ni comme un soutien. Si l’autorisation est privée, ne publiez ni poids ni sorties. Vérifiez séparément les conditions des dépendances avant redistribution. Ce texte n’est pas une autorisation juridique.
Décider d’entraîner, de router en direct ou d’arrêter
Si la conversion hors ligne satisfait la fiche et la provenance, archivez ensemble environnement, paire checkpoint-index, contrôles, source et sortie acceptée. Décidez ensuite seulement d’un lot répétable, d’une révision d’entraînement ou d’une route en direct ; chaque extension exige ses propres preuves.
Si aucune voix cible ne doit être entraînée, une solution TTS ou zero-shot autorisée peut mieux convenir, sans qu’une alternative nommée soit validée ici. Pour une simple correction de hauteur, réduction de bruit ou séparation, choisissez le traitement plus étroit. Si le direct échoue mais l’offline convient, restez hors ligne.
Arrêtez avant de télécharger ou partager d’autres voix si les droits sont incertains. Réparez d’abord la séparation ou le rééchantillonnage si la qualité échoue à ce stade. Si la voix reste instable sur des clips représentatifs, changez de données cibles autorisées ou de méthode. Cette page ne classe pas RVC face à un concurrent.
Consultez le répertoire des modèles une fois le besoin manquant identifié. Avant un usage public ou client, revérifiez sources et dépendances, exécutez la charge autorisée exacte, documentez les mesures et obtenez les droits requis. La popularité du dépôt, un fichier de sortie ou un chiffre de latence ne suffisent pas.