RVC v2
Avalie o RVC v2 como fluxo sujeito a permissões: confirme recursos, par checkpoint-index, qualidade e latência ponta a ponta.
Identidade e acesso
- Nome do modelo
- RVC v2
- Acesso
- Código oficial MIT; modelos, vozes, gravações, dependências e serviços exigem verificações próprias.
- Tipo de modelo
- Conversão de voz baseada em recuperação
- Arquitetura
- Conversão de voz com checkpoint-alvo, índices opcionais e extração de pitch
- Público-alvo
- Criadores técnicos de áudio capazes de preparar mídia permitida, escolher o ambiente e revisar saídas salvas.
- Entrada
- Performance permitida, checkpoint de voz autorizado e, com recuperação, seu índice correspondente.
- Saída
- Áudio convertido que exige revisão de conteúdo, caráter, pitch, artefatos, procedência e destino.
- Custo
- Medir ambiente, recursos, preparo, treinamento, inferência, latência completa, escuta, correção e direitos.
- Quando evitar
- Não usar para TTS, tradução, autenticação, anonimato garantido, imitação não autorizada ou live não medido.
Fontes e método
Licença e direitos
- Licença
- MIT
- Tipo de licença
- Código aberto
- Escopo da licença
- Código oficial MIT; modelos, vozes, gravações, dependências e serviços exigem verificações próprias.
- Código aberto
- Sim
Disponibilidade
- Estado
- Disponível
- Escopo do estado
- Disponível descreve apenas o repositório revisado e suas rotas; binários, compatibilidade e serviços não foram testados.
Pontos principais
Ambiente para o hardware atual
A documentação separa Python 3.12 x64 e caminhos CPU, CUDA 11.8 e CUDA 12.8.
Procedência de checkpoint e índice
Preserve o par com fonte, versão, checksum e permissão.
Meça a latência ponta a ponta
Trate números do README como observações e meça a rota completa.
Casos de uso e limites
Avaliar conversão offline autorizada
Compare uma frase autorizada com index_rate 0 e um valor positivo registrado, confirme o carregamento do índice correspondente e preserve configurações e registros.
Treinar com gravações permitidas
Planeje experimento v2 documentado sem transformar dez minutos em garantia.
Testar uma rota ao vivo
Depois da aceitação offline, meça captura, buffer, conversão, roteamento e reprodução.
Vantagens
- O projeto separa treinamento, inferência e tempo real.
- Caminhos atuais de dependências e recursos estão explícitos.
- Execução local pode manter mídia permitida sob controle.
Limitações
- Utilidade depende de dados permitidos, par compatível e escuta.
- Dez minutos e 170/90 ms não são garantias reproduzidas.
- MIT do código não autoriza vozes, mídia, dependências ou serviços.
Temas
- RVC
- conversão de voz
Sobre o modelo
Nesta página
RVC v2 é o nome usado pela tasarim.ai para o fluxo v2 de conversão de voz documentado no repositório oficial Retrieval-based-Voice-Conversion-WebUI. Ele transforma uma performance já gravada com um checkpoint de voz-alvo e pode usar um índice de recuperação e extração de pitch. Só cabe em uma avaliação local controlada quando todas as gravações e modelos têm permissão para o uso pretendido. Não é texto para fala, autorização para imitar alguém nem garantia de tempo real em hardware não testado.
Esta avaliação se limita ao commit oficial 81eed5e8f68b6bed1789f682fe78cdd324495afc. Nenhum ambiente foi instalado, nenhum modelo ou áudio foi baixado, nenhuma voz foi treinada ou convertida e latência e qualidade não foram medidas. O procedimento e as tabelas abaixo são uma proposta sem resultados preenchidos.
Defina a tarefa antes de escolher o RVC
Comece pelo sinal disponível e pelo resultado necessário. O RVC converte uma performance existente; ele não cria a partir de texto uma fala que nunca foi gravada. A fonte fornece palavras, ritmo, fraseado e movimento de pitch. O checkpoint e os controles moldam o caráter vocal. Se o trabalho começa com um roteiro, avalie síntese de fala em vez de tratar conversão como substituta.
Registre um uso restrito antes de reunir arquivos. Um exemplo defensável é converter uma frase curta e autorizada para uma segunda voz também autorizada em um teste privado. Defina o que deve permanecer, como inteligibilidade, timing e pitch deliberado, e o que pode mudar. “Soar exatamente como a pessoa” não serve como critério, pois mistura preferência, identidade, consentimento e procedência.
O repositório separa treinamento, inferência WebUI e interface em tempo real. Um bom resultado offline não comprova estabilidade ou latência ao vivo. Também não use a saída para autenticar alguém, provar que disse algo ou prometer anonimato. A identificabilidade não foi medida.
Separe código, pesos de voz, índice e mídia
O repositório fornece código e interfaces, não uma voz completa. A estrutura atual espera recursos HuBERT, um arquivo RMVPE, pré-treinamento v1/v2, pesos .pth em assets/weights/ e índices .index em assets/indices/. Pesos opcionais pymss/MSST pertencem a outro caminho de separação vocal. Configuração oficial.
Registre separadamente criador ou distribuidor autorizado, uso permitido, versão e checksum. Preserve a dupla checkpoint-index; nomes parecidos não provam compatibilidade, origem ou permissão. Separe gravações-alvo, performance de origem e áudio convertido, anotando fornecedor, direitos de processamento e compartilhamento e eventual música protegida.
O README baixa do Hugging Face com --revision main. Um branch móvel é uma rota de aquisição, não um binário imutável. Em um teste real, grave a revisão resolvida e hashes locais. Nenhum modelo foi baixado ou inspecionado aqui.
Prepare o ambiente específico do hardware
A documentação revisada mira Python 3.12 x64, recomenda Ubuntu 24.04 x86_64 e descreve ambiente virtual do Windows. CPU, AMD e Intel usam requirments_cpu_py312.txt; RTX série 50 instala Torch CUDA 12.8 em duas etapas e depois requirments_cu128_py312.txt; NVIDIA anterior usa CUDA 11.8 e requirments_cu118_py312.txt. requirments é o nome literal. Ambiente oficial.
Escolha apenas o caminho da máquina real. Não misture arquivos de CPU e CUDA nem copie guia antigo com recursos diferentes. O README atual coloca HuBERT em assets/hubert_base/. Use ambiente isolado e registre sistema, arquitetura, Python, Torch, torchaudio, dependências, índices de pacotes, GPU e driver. Trocar um espelho pelo índice oficial mantendo versões, sufixos CUDA e ordem é orientação de fornecimento, não garantia.
Antes da WebUI, confirme recursos e status CUDA. O README indica python webui.py, python webui.py --noautoopen no Ubuntu sem interface e porta 7865. Esses comandos não foram executados.
Trate a orientação de treinamento como ponto inicial
Os mantenedores recomendam pelo menos dez minutos de fala com pouco ruído. Isso não garante qualidade nem treinamento em dez minutos. Conteúdo, ruído, clipping, consistência, faixa de pitch e fonte mudam a escuta. Use somente gravações permitidas, guarde a cópia intacta e documente separação, corte e pré-processamento.
A separação pymss/MSST exige outros pesos e adiciona transformação. Compare o material processado com a fonte antes de atribuir um defeito ao RVC. Para v2, registre pretrained_v2/*, recursos comuns e silêncios em logs/mute/; não misture v1 e v2. Guarde configuração, logs, checkpoint exportado e índice como artefatos separados.
Reserve uma frase autorizada para avaliação. Isso não cria benchmark científico, mas evita usar apenas um exemplo favorável de treinamento.
Execute uma avaliação controlada e limitada
O teste proposto usa um checkpoint com procedência, seu índice quando a recuperação está ativa e dois clipes permitidos. O clipe A deve ser limpo e representativo; o clipe B deve isolar um desafio, como uma variação maior de pitch ou ruído leve. Não há clipes nem resultados neste candidato.
Gere primeiro conversão offline e registre modo, checkpoint, índice, extrator de pitch, transposição, controle de recuperação, caminhos e toda opção alterada. Preserve fonte e log completo. Faça outro candidato mudando um fator. Um par útil compara recuperação desativada e ativada com o índice correto. Trocar extrator deve formar outro par.
Antes da comparação, localize na seção de conversão de um único arquivo da interface offline o controle cujo rótulo em inglês começa com “Search feature ratio”. Na revisão examinada, ele envia index_rate ao processamento. O valor 0 desativa a busca no índice. Para a segunda execução, mantenha o mesmo caminho para um índice existente e compatível com o checkpoint e registre um valor escolhido acima de 0 e até 1. O padrão 0.75 não é uma recomendação de qualidade. Preserve o clipe de origem, o checkpoint e as demais configurações.
Um valor diferente de zero apenas tenta usar a busca: o índice também precisa ser encontrado e carregado. Se o carregamento falhar, o código examinado mostra o erro no terminal e continua sem o índice. Guarde as configurações e o registro do terminal, resolva a falha e não classifique uma execução incerta como busca ativada. O nome do índice na mensagem de resultado não prova seu uso, pois essa mensagem verifica apenas a existência do arquivo. Essa correspondência vem do código da revisão fixada, não de um teste de áudio. Outra revisão ou a interface separada de tempo real exige nova verificação.
Não normalize apenas uma saída. Volume influencia preferência. Escute pela rota prevista, marque clipping e falhas e preserve rejeições. Nenhuma configuração é considerada universalmente superior.
Aplique controles de escuta e procedência
A tabela não contém notas nem resultados. Preencha com áudio, configuração e observações antes de chamar a saída de útil.
| Controle | Pergunta | Evidência e condição de parada |
|---|---|---|
| Direitos e procedência | Fonte, gravações, checkpoint e índice são permitidos? | Guardar permissões e origem; parar se algo estiver indefinido. |
| Conteúdo | Palavras e limites continuam compreensíveis? | Comparar no mesmo nível e rejeitar omissão ou adição. |
| Caráter vocal | Atende ao objetivo autorizado sem alegar identidade? | Descrever traços e decisão fundamentada. |
| Pitch e timing | Movimento e ritmo permanecem úteis? | Comparar o mesmo trecho e marcar instabilidade. |
| Artefatos | Zumbido, som metálico, respiração alterada, falha ou vazamento são aceitáveis? | Guardar tempos e aplicar a tolerância acordada. |
| Entrega | É possível rastrear a transformação? | Manter nomes separados, aviso e configuração exata. |
O destino define a aceitação. Um estudo privado pode tolerar defeito que impediria uma faixa publicada. Uma saída atraente falha se muda palavras, viola permissão ou não é rastreável. Orce limpeza, separação, ambiente, treinamento, exportação, inferência, escuta, correção e direitos.
Meça o tempo real na rota de áudio efetiva
O README principal relata 170 ms ponta a ponta e 90 ms com entrada e saída ASIO, advertindo que o segundo valor depende muito do driver. São observações dos mantenedores, não medidas reproduzidas nem promessas. Observação oficial.
Meça da captura à saída monitorada. Registre interface, dispositivo, driver, taxa, buffer, hardware, modelo/index e carga. Um timer de inferência exclui captura, buffer, reamostragem, roteamento e reprodução. Relate repetições e falhas, não só o melhor número.
Aceite primeiro a qualidade offline. Latência baixa não compensa palavras confusas, pitch quebrado ou instabilidade. Se um buffer melhora atraso e causa falhas, mostre a troca. A interface em tempo real não comprova integração com DAW, OBS, Discord ou streaming; cada rota exige teste.
Diagnostique a primeira etapa que falha
Localize o primeiro artefato inconsistente antes de aumentar épocas ou vários controles. São hipóteses, não taxas medidas.
| Observação | Verificar primeiro | Ação controlada |
|---|---|---|
| WebUI não inicia | Python, dependências, Torch e caminhos | Corrigir ambiente antes do áudio. |
| Voz ou índice ausente | assets/weights/, assets/indices/ e dupla registrada | Restaurar arquivos e confirmar origem. |
| Palavras mudam | Fonte, pré-processamento e saída no mesmo nível | Testar controle limpo com mesmo modelo e um extrator. |
| Voz instável ou vazamento | Índice, recuperação, dados e frase repetida | Alterar um controle e rejeitar se o objetivo falhar. |
| Pitch quebra | Mesmo instante e extrator | Comparar outro extrator sem mudar o restante. |
| Áudio ao vivo falha | Dispositivo, driver, taxa, buffer, carga e log | Estabilizar e medir ponta a ponta novamente. |
Separação, reamostragem, clipping, dupla incompatível, extração e roteamento podem contribuir. Não trate todo som metálico como falha de recuperação. Pare se todos os candidatos falharem requisito ou excederem orçamento. Mais épocas, dados ou outro índice são experimentos, não correções automáticas.
Resolva separadamente direitos de código, modelo e voz
A LICENSE é MIT: permite uso, modificação e distribuição do software com preservação dos avisos e sem garantia. Isso sustenta a classificação open source do código revisado. Licença MIT.
Ela não concede direitos sobre checkpoints, gravações, performances, músicas, pesos opcionais ou serviços. Um checkpoint público pode não ter procedência ou permissão; pagar uma interface também não transfere direitos.
Para voz de uma pessoa, registre autorização para treinamento, conversão, divulgação, compartilhamento e contexto comercial. Não apresente o resultado como fala real nem endosso. Se a permissão for privada, não publique pesos ou saídas. Dependências mantêm seus termos. Este texto não é autorização jurídica.
Decida entre treinar, usar ao vivo ou parar
Se o áudio offline cumprir a ficha, arquive ambiente, checkpoint/index, controles, fonte e saída. Só depois decida por lote, revisão de treinamento ou rota ao vivo; cada expansão precisa de evidência própria.
Se não for necessário treinar uma voz, TTS ou zero-shot autorizado pode servir melhor, sem validação de alternativa específica aqui. Para corrigir pitch, ruído ou separação, use o processo mais estreito. Se o ao vivo falhar e o offline funcionar, permaneça offline.
Se os direitos estiverem incertos, pare antes de baixar ou compartilhar mais modelos. Se a qualidade falhar após separar ou reamostrar, corrija a entrada antes de retreinar. Se continuar instável em clipes representativos, mude os dados permitidos ou o método. RVC não é ranqueado contra concorrentes.
Consulte o diretório de modelos depois de identificar a capacidade ausente. Antes de uso público ou para clientes, verifique revisões atuais, execute a carga autorizada, documente resultados e obtenha permissões. Popularidade, arquivo de saída ou número de latência não concluem a decisão.