RVC v2
Evalúa RVC v2 como flujo sujeto a permisos: verifica recursos, pareja checkpoint-index, calidad y latencia de extremo a extremo.
Identidad y acceso
- Nombre del modelo
- RVC v2
- Acceso
- Código oficial MIT; modelos, voces, grabaciones, dependencias y servicios requieren comprobaciones separadas.
- Tipo de modelo
- Conversión de voz basada en recuperación
- Arquitectura
- Conversión de voz con checkpoint objetivo, índices opcionales y extracción de tono
- Público objetivo
- Creadores de audio técnicos que pueden preparar material permitido, elegir el entorno y revisar audio guardado.
- Entrada
- Interpretación permitida, checkpoint objetivo autorizado y, con recuperación, su índice correspondiente.
- Salida
- Audio convertido que requiere revisar contenido, carácter, tono, artefactos, procedencia y destino.
- Coste
- Medir entorno, recursos, preparación, entrenamiento, inferencia, latencia completa, escucha, corrección y derechos.
- Cuándo evitar
- No usar para TTS, traducción, autenticación, anonimato garantizado, imitación no autorizada o directo no medido.
Fuentes y método
Licencia y derechos
- Licencia
- MIT
- Tipo de licencia
- Código abierto
- Alcance de la licencia
- Código oficial MIT; modelos, voces, grabaciones, dependencias y servicios requieren comprobaciones separadas.
- Código abierto
- Sí
Disponibilidad
- Estado
- Disponible
- Alcance del estado
- Disponible describe solo el repositorio revisado y sus rutas; no se probaron binarios, compatibilidad ni servicios.
Aspectos clave
Entorno para el hardware actual
La guía separa Python 3.12 x64 y rutas CPU, CUDA 11.8 y CUDA 12.8.
Procedencia de checkpoint e índice
Conservar la pareja con fuente, versión, checksum y permiso.
Medir la latencia de extremo a extremo
Tratar las cifras del README como observaciones y medir toda la ruta.
Casos de uso y límites
Evaluar conversión offline autorizada
Compara una frase autorizada con index_rate 0 y un valor positivo registrado; confirma la carga del índice compatible y conserva ajustes y registros.
Entrenar con grabaciones permitidas
Preparar un experimento v2 documentado sin convertir diez minutos en garantía.
Probar una ruta en directo
Tras aceptar offline, medir captura, búfer, conversión, routing y reproducción.
Ventajas
- El proyecto separa entrenamiento, inferencia y tiempo real.
- Las rutas actuales de dependencias y recursos son explícitas.
- La ejecución local puede mantener medios permitidos bajo control.
Limitaciones
- La utilidad depende de datos permitidos, pareja compatible y escucha.
- Diez minutos y 170/90 ms no son garantías reproducidas.
- MIT para el código no autoriza voces, medios, dependencias o servicios.
Temas
- RVC
- conversión de voz
Acerca del modelo
En esta página
RVC v2 es el nombre que tasarim.ai utiliza para el flujo v2 de conversión de voz documentado en el repositorio oficial Retrieval-based-Voice-Conversion-WebUI. Convierte una interpretación ya grabada con un checkpoint de voz objetivo y puede incorporar un índice de recuperación y extracción de tono. Solo es adecuado para una evaluación local controlada cuando existen permisos para todas las grabaciones y modelos. No es texto a voz, no autoriza a imitar a una persona y no garantiza tiempo real en hardware no probado.
Esta evaluación se limita al commit oficial 81eed5e8f68b6bed1789f682fe78cdd324495afc. No se instaló ningún entorno, no se descargaron modelos ni audio, no se entrenó o convirtió una voz y no se midieron latencia ni calidad. El procedimiento y las tablas siguientes son una propuesta con resultados vacíos.
Definir la tarea antes de elegir RVC
Empieza por la señal disponible y el resultado necesario. RVC transforma una interpretación existente; no genera desde texto palabras que nunca se grabaron. La fuente aporta palabras, tiempo, fraseo y movimiento tonal. El checkpoint y los controles cambian el carácter vocal. Si el trabajo parte de un guion, evalúa síntesis de voz en vez de usar conversión como sustituto.
Anota un uso concreto antes de reunir archivos. Por ejemplo, convertir una frase breve y autorizada a otra voz autorizada para una prueba privada. Decide qué debe mantenerse, como inteligibilidad, tiempo y tono deliberado, y qué puede variar. “Suena exactamente como esa persona” no es un criterio válido porque mezcla preferencia, identidad, consentimiento y procedencia.
El repositorio separa entrenamiento, inferencia WebUI e interfaz en tiempo real. Un buen resultado offline no demuestra estabilidad ni latencia en directo. Tampoco uses la conversión para autenticar a un hablante, demostrar que dijo algo o garantizar anonimato. Esta revisión no midió identificabilidad.
Separar código, pesos, índice y medios
El repositorio ofrece código e interfaces, no una voz autónoma. La estructura actual requiere recursos HuBERT, un archivo RMVPE, preentrenamiento v1/v2, pesos .pth en assets/weights/ e índices .index en assets/indices/. Los pesos opcionales pymss/MSST pertenecen a otra ruta de separación vocal. Configuración oficial.
Registra por separado creador o distribuidor autorizado, uso permitido, versión y checksum de cada artefacto. Conserva la pareja checkpoint-index; un nombre parecido no prueba compatibilidad, origen o permiso. Separa también grabaciones objetivo, interpretación fuente y audio convertido, indicando proveedor, derechos de proceso y difusión, y música u otros materiales protegidos.
El README descarga desde Hugging Face con --revision main. Una rama móvil es una ruta de adquisición, no un binario inmutable. En una prueba real registra la revisión resuelta y hashes locales. Aquí no se descargó ni inspeccionó ningún modelo.
Preparar el entorno específico del hardware
La guía revisada apunta a Python 3.12 x64, recomienda Ubuntu 24.04 x86_64 y describe un entorno virtual de Windows. CPU, AMD e Intel usan requirments_cpu_py312.txt; RTX serie 50 instala Torch CUDA 12.8 en dos pasos y después requirments_cu128_py312.txt; NVIDIA anterior usa CUDA 11.8 y requirments_cu118_py312.txt. requirments es el nombre literal. Entorno oficial.
Elige una sola ruta para la máquina real. No mezcles archivos CPU y CUDA ni copies una guía antigua con otros recursos. El README actual coloca HuBERT en assets/hubert_base/. Usa un entorno aislado y anota sistema, arquitectura, Python, Torch, torchaudio, dependencias, índices de paquetes, GPU y controlador. Cambiar un espejo por el índice oficial sin alterar versiones, sufijos CUDA y orden es una instrucción de suministro, no garantía de compatibilidad.
Antes de abrir la WebUI confirma recursos y estado CUDA. El README indica python webui.py, python webui.py --noautoopen en Ubuntu sin interfaz y el puerto 7865. No se ejecutaron estos comandos.
Tratar la guía de entrenamiento como condición inicial
Los mantenedores recomiendan al menos diez minutos de voz con poco ruido. No es un mínimo que garantice calidad ni una promesa de entrenar en diez minutos. Contenido, ruido, clipping, consistencia, rango tonal y material de origen influyen en la escucha. Usa solo grabaciones permitidas, conserva la copia intacta y documenta separación, cortes y preproceso.
La separación pymss/MSST requiere otros pesos y añade una transformación. Compara el material preprocesado con la fuente antes de atribuir un defecto a RVC. Para v2 registra pretrained_v2/*, recursos comunes y silencios de logs/mute/; no mezcles v1 y v2. Guarda configuración, logs, checkpoint exportado e índice como artefactos distintos.
Reserva una frase autorizada para evaluar. No crea un benchmark científico, pero evita que un ejemplo favorable de entrenamiento sea la única prueba.
Ejecutar una evaluación acotada
La prueba propuesta usa un checkpoint con procedencia registrada, su índice si se activa recuperación y dos clips permitidos. A debe ser limpio y representativo; B debe aislar un reto como mayor movimiento tonal o ruido leve. No existen clips ni resultados en este candidato.
Primero genera una conversión offline y registra modo, checkpoint, índice, extractor tonal, transposición, control de recuperación, rutas y toda opción modificada. Conserva fuente y log completo. Crea un segundo candidato cambiando un factor. Una comparación útil activa o desactiva recuperación con el índice correcto y mantiene todo lo demás. Un cambio de extractor debe formar otra pareja.
Antes de comparar, localiza en la sección de conversión de un solo archivo de la interfaz sin conexión el control cuyo nombre en inglés empieza por «Search feature ratio». En la revisión examinada, envía index_rate al procesamiento. El valor 0 desactiva la búsqueda en el índice. Para la segunda ejecución, mantén la misma ruta a un índice existente y compatible con el checkpoint y registra un valor elegido mayor que 0 y menor o igual que 1. El valor predeterminado 0.75 no es una recomendación de calidad. Conserva el clip original, el checkpoint y los demás ajustes.
Un valor distinto de cero solo intenta activar la búsqueda: el índice también debe encontrarse y cargarse. Si la carga falla, el código examinado muestra el error en la terminal y continúa sin el índice. Guarda los ajustes y el registro de la terminal, resuelve el fallo y no consideres una ejecución incierta como la variante con recuperación activa. El nombre del índice en el resultado no demuestra su uso, porque ese mensaje solo comprueba que el archivo existe. Esta correspondencia procede del código de la revisión fijada, no de una prueba de audio. Otra revisión o la interfaz independiente de tiempo real necesita su propia comprobación.
No normalices solo una salida. El volumen sesga la preferencia. Escucha por la ruta prevista, marca clipping o cortes y conserva los rechazos. No se presupone un ajuste universalmente superior.
Aplicar controles de escucha y procedencia
La tabla no contiene notas ni resultados. Complétala con audio, configuración y observaciones antes de llamar útil a la salida.
| Control | Pregunta | Evidencia y condición de parada |
|---|---|---|
| Derechos y procedencia | ¿Se permiten fuente, grabaciones objetivo, checkpoint e índice? | Conservar permisos y origen; parar si falta un derecho o fuente. |
| Contenido | ¿Se entienden palabras y límites de frase? | Comparar al mismo nivel y rechazar omisiones o adiciones. |
| Carácter vocal | ¿Sirve al fin autorizado sin afirmar identidad? | Escribir rasgos buscados y decisión razonada. |
| Tono y tiempo | ¿Son útiles los movimientos y el ritmo? | Comparar el mismo pasaje y señalar la inestabilidad. |
| Artefactos | ¿Son tolerables zumbido, metal, respiración alterada, cortes o fuga? | Guardar tiempos y aplicar la tolerancia acordada. |
| Entrega | ¿Puede rastrearse la transformación? | Mantener nombres separados, aviso y configuración exacta. |
El destino define la aceptación. Un estudio privado puede tolerar un defecto que bloquearía una pista publicada. Una salida atractiva falla si cambia palabras, vulnera permisos o no es trazable. Presupuesta limpieza, separación, entorno, entrenamiento, exportación, inferencia, escucha, corrección y revisión de derechos.
Medir el tiempo real en la ruta de audio efectiva
El README principal informa 170 ms de extremo a extremo y 90 ms con entrada y salida ASIO, y advierte que este último valor depende mucho del controlador. Son observaciones del proyecto, no mediciones reproducidas ni promesas. Observación oficial.
Mide desde captura hasta salida monitorizada. Anota interfaz, dispositivo, driver, frecuencia, búfer, hardware, modelo/index y carga. Un temporizador de inferencia omite captura, búfer, remuestreo, routing y reproducción. Informa varias observaciones y cortes, no solo el mejor número.
Acepta primero la calidad offline. Una latencia baja no compensa palabras confusas, tono roto o inestabilidad. Si un búfer mejora el retraso pero causa cortes, muestra el intercambio. La interfaz en tiempo real no prueba integración con DAW, OBS, Discord o streaming; cada ruta necesita una prueba propia.
Diagnosticar la primera etapa que falla
Busca el primer artefacto inconsistente antes de aumentar épocas o cambiar varios controles. Son hipótesis, no tasas medidas.
| Observación | Revisar primero | Acción controlada |
|---|---|---|
| WebUI no inicia | Python, dependencias, Torch y rutas | Corregir el entorno antes del audio. |
| Falta voz o índice | assets/weights/, assets/indices/ y pareja registrada | Restaurar archivos y confirmar origen. |
| Cambian palabras | Fuente, preproceso y salida al mismo nivel | Probar control limpio con mismo modelo y un extractor. |
| Voz inestable o fuga | Índice, recuperación, datos y frase repetida | Cambiar un control y rechazar si falla el fin. |
| Tono se rompe | Mismo instante y extractor | Probar otro extractor sin cambiar lo demás. |
| El audio en directo se corta | Dispositivo, driver, frecuencia, búfer, carga y log | Estabilizar y volver a medir extremo a extremo. |
Separación, remuestreo, clipping, pareja incompatible, extracción y routing pueden contribuir. No llames a todo sonido metálico fallo de recuperación. Para si todos los candidatos fallan un requisito o superan el presupuesto. Más épocas, datos u otro índice son experimentos, no arreglos automáticos.
Resolver por separado derechos de código, modelo y voz
La LICENSE es MIT: permite usar, modificar y distribuir el software conservando los avisos y sin garantía. Sustenta la clasificación open source del código revisado. Licencia MIT.
No concede derechos sobre checkpoints, grabaciones, interpretaciones, canciones, pesos opcionales o servicios. Un checkpoint público puede carecer de procedencia o permiso; pagar una interfaz tampoco transfiere derechos.
Para una voz personal, documenta autorización para entrenamiento, conversión, divulgación, difusión y contexto comercial. No presentes el resultado como habla real ni como aval. Si el permiso es privado, no publiques pesos ni salidas. Las dependencias conservan sus términos. Esta página no es una autorización legal.
Decidir entre entrenar, usar directo o parar
Si el audio offline satisface la ficha, archiva entorno, checkpoint/index, controles, fuente y salida. Solo entonces decide si necesitas lote, revisión de entrenamiento o ruta en directo; cada ampliación requiere evidencia propia.
Si no hace falta entrenar una voz, TTS o zero-shot autorizado puede encajar mejor, aunque aquí no se valida una alternativa concreta. Para corregir tono, ruido o separación, usa el proceso más estrecho. Si el directo falla pero el offline funciona, mantén el flujo offline.
Si los derechos no están claros, para antes de descargar o compartir más modelos. Si la calidad falla después de separar o remuestrear, corrige esa entrada antes de reentrenar. Si sigue inestable en clips representativos, cambia a datos permitidos o a otro método. No se compara RVC con un rival.
Consulta el directorio de modelos cuando identifiques la capacidad que falta. Antes de un uso público o para clientes, verifica revisiones actuales, ejecuta la carga permitida, documenta resultados y consigue permisos. Popularidad, un archivo o una cifra de latencia no completan la decisión.