RVC v2

RVC v2 を許可前提の手順として評価し、資産、チェックポイントとインデックス、音質、全経路遅延を自分で確認します。

モデル情報と利用方法

モデル名
RVC v2
利用方法
公式コードは MIT。モデル、音声、録音、依存資産、サービスは別の来歴と条件確認が必要。
モデルの種類
検索ベースの音声変換
アーキテクチャ
対象音声チェックポイント、任意の特徴インデックス、ピッチ抽出を使う音声変換
対象ユーザー
許可済み素材を準備し、機材別環境を選び、保存音声を確認できる技術系音声制作者。
入力
許可済みの元演技、対象音声チェックポイント、検索利用時は対応するインデックス。
出力
内容、声質、ピッチ、アーティファクト、来歴、用途を確認すべき変換音声。
費用
環境、資産、データ準備、学習、推論、全経路遅延、試聴、修正、権利確認を測定する。
避けるべき場合
TTS、翻訳、話者認証、匿名性保証、無許可の模倣、未測定のライブ制作には使わない。

情報源と評価方法

ライセンスと権利

ライセンス
MIT
ライセンスの種類
オープンソース
ライセンスの適用範囲
公式コードは MIT。モデル、音声、録音、依存資産、サービスは別の来歴と条件確認が必要。
オープンソース
はい

提供状況

状態
提供中
状態の適用範囲
利用可能とは確認済みリポジトリと取得経路のみを指し、バイナリ、互換性、サービスは未検証。

要点

機材別の現行環境

確認済み資料は Python 3.12 x64 と CPU、CUDA 11.8、CUDA 12.8 の経路を分けています。

チェックポイントとインデックスの来歴

対応する組を出所、版、ハッシュ、許可と一緒に保存します。

全経路で測る遅延

README の値は機材依存の観察として扱い、実経路を測ります。

利用例と制約

許可済みオフライン変換を評価

許可を得た同じ音声を index_rate 0 と記録した正の値で比較します。対応するインデックスの読み込みを確認し、設定とログを保存します。

許可済み録音で学習

10 分の目安を保証にせず、記録可能な v2 試験を準備します。

特定のライブ経路を試験

オフライン合格後、取得、バッファ、変換、配線、再生を測ります。

利点

  • 学習、オフライン推論、リアルタイム UI が別に記載されています。
  • 現行の機材別依存関係と資産パスが明示されています。
  • ローカル実行なら許可済み録音を管理下に置けます。

制約

  • 有用な出力には許可済みデータ、対応する組、試聴が必要です。
  • 10 分と 170/90 ms は再現済み保証ではありません。
  • コードの MIT は音声、媒体、依存資産、サービスの権利を与えません。

トピック

  • RVC
  • 音声変換

モデルについて

このページの内容

RVC v2 は、公式の Retrieval-based-Voice-Conversion-WebUI リポジトリに記載された v2 音声変換ワークフローを tasarim.ai で示す名称です。録音済みの演技を対象音声チェックポイントで変換し、必要に応じて検索インデックスとピッチ抽出を使います。すべての録音とモデルについて目的に合った許可がある場合に限り、管理されたローカル評価の候補になります。テキスト読み上げではなく、人物を模倣する許可でも、未検証の機材でリアルタイム性能を保証するものでもありません。

本評価は公式コミット 81eed5e8f68b6bed1789f682fe78cdd324495afc に限定されています。環境の構築、モデルや音声のダウンロード、学習、変換、遅延測定、試聴評価は行っていません。以下は結果欄が空の評価案です。

RVC を選ぶ前に変換タスクを定義する

手元の信号と必要な出力から始めます。RVC は既存の演技を変換し、録音されていない発話をテキストから作りません。元音声が単語、タイミング、フレージング、ピッチの動きを与え、チェックポイントと設定が声質を変えます。台本から新しい発話が必要なら、音声合成を別に評価します。

ファイルを集める前に、狭く許可された用途を書きます。例は、許可済みの短いスタジオ音声を、別の許可済み音声へ変換する非公開テストです。明瞭な単語、タイミング、意図したピッチなど、維持すべき要素を決めます。「本人とまったく同じ」は、好みと本人性、同意、来歴を混同するため合格条件にできません。

リポジトリは学習、WebUI 推論、リアルタイム変換を分けています。オフラインで成功しても、ライブ経路の遅延や安定性は証明されません。話者認証、本人が発言した証明、匿名性保証にも使えません。本評価では識別可能性を測っていません。

コード、音声重み、インデックス、媒体を分ける

公式リポジトリはコードと UI を提供しますが、単一の完成音声モデルではありません。現行構成は HuBERT、RMVPE、v1/v2 事前学習資産、assets/weights/.pthassets/indices/.index を想定します。任意の pymss/MSST 重みは別のボーカル分離経路です。公式の構成

各資産について作成者または正規配布者、許可用途、版、チェックサムを記録します。チェックポイントとインデックスの組を保持し、似たファイル名を互換性や許可の証拠にしません。対象学習音声、元演技、変換結果も分け、提供者、処理と共有の権利、保護された音楽の有無を記録します。

README の Hugging Face 取得は --revision main を使います。動くブランチは取得経路であり、固定バイナリではありません。実試験では解決済みリビジョンとローカルハッシュを保存します。本評価はモデルファイルを取得または検査していません。

現在の機材に合う環境を準備する

確認した説明は Python 3.12 x64 を対象とし、Ubuntu 24.04 x86_64 を推奨し、Windows の仮想環境も示します。CPU、AMD、Intel は requirments_cpu_py312.txt、RTX 50 系は CUDA 12.8 の Torch を二段階で入れて requirments_cu128_py312.txt、以前の NVIDIA は CUDA 11.8 と requirments_cu118_py312.txt を使います。requirments はリポジトリ上の綴りです。公式環境手順

実機に合う経路を一つ選び、CPU と各 CUDA のファイルを混ぜません。現行 README は HuBERT を assets/hubert_base/ に置きます。隔離環境を作り、OS、構成、Python、Torch、torchaudio、依存ファイル、パッケージ索引、GPU、ドライバを記録します。バージョン、CUDA 接尾辞、順序を維持した索引変更は供給経路の説明であり、互換性保証ではありません。

WebUI 前に資産と CUDA 状態を確認します。README は python webui.py、GUI なし Ubuntu では python webui.py --noautoopen、既定ポート 7865 を示します。ここでは実行していません。

学習の目安を開始条件として扱う

管理者は低ノイズ音声を少なくとも 10 分推奨します。品質の保証や 10 分で学習が終わるという意味ではありません。内容、ノイズ、クリッピング、話者の一貫性、音域、利用する元音声が結果に影響します。許可された録音だけを使い、原本を残し、分離、切り出し、前処理を記録します。

pymss/MSST 分離は別の重みと変換段階を追加します。RVC の不具合と判断する前に前処理済み音声を元と比較します。v2 では pretrained_v2/*、共有資産、logs/mute/ を記録し、v1 と混ぜません。設定、ログ、書き出した推論チェックポイント、対応インデックスを別々に保存します。

許可済みの一文を評価用に残します。科学的ベンチマークにはなりませんが、好都合な学習例だけを根拠にすることを避けられます。

範囲を限定した比較を行う

提案試験は来歴を記録したチェックポイント、検索を使う場合の対応インデックス、二つの許可済みクリップを使います。クリップ A は雑音が少なく、想定した用途を代表する録音にします。クリップ B は、広い音程の変化や軽い背景音など、一つの課題だけを含む録音にします。本候補にはクリップも結果もありません。

まずオフライン変換を作り、モード、チェックポイント、インデックス、ピッチ抽出、移調、検索設定、入出力パス、変更値を記録し、元音声と完全なログを保存します。次は一要因だけを変えます。最初の有用な比較は、他条件を固定して検索を無効化した場合と対応インデックスで有効化した場合です。抽出方式の比較は別の組にします。

比較の前に、オフラインの操作画面の単一ファイル変換欄で、英語の表示名が「Search feature ratio」で始まるスライダーを確認します。調べた版では、この値が処理側の index_rate に渡され、0 にするとインデックス検索を行いません。二回目は、同じチェックポイントに対応する既存のインデックスを指定したまま、0 より大きく 1 以下の値を選んで記録します。初期値は 0.75 ですが、音質の推奨値ではありません。元のクリップ、チェックポイント、ほかの設定は変えません。

値がゼロでないだけでは、検索が使われた証拠にはなりません。インデックスが見つかり、正常に読み込まれる必要があります。読み込みに失敗すると、確認したコードは端末にエラーの詳細を出し、インデックスなしで処理を続けます。設定と端末の記録を保存し、読み込みの問題を解決してください。動作が不明な実行結果を「検索あり」の比較対象にしてはいけません。結果欄のインデックス名も、ファイルの存在しか確認していないため、検索成功の証拠にはなりません。これは固定した版のコードから確認した対応関係で、音声試験の結果ではありません。別の版やリアルタイム用の画面では、改めて確認が必要です。

片方だけ後処理で正規化しません。音量差は好みを偏らせます。予定した監視経路で聴き、クリッピングや途切れを記録し、不採用出力も残します。普遍的な最良設定は想定しません。

試聴と来歴の確認を適用する

次表に評価値や実測結果はありません。有用と述べる前に音声、設定、観察を記入します。

確認質問証拠と停止条件
権利と来歴元演技、対象録音、チェックポイント、インデックスは許可済みか許可と出所を保存し、不明なら停止する。
内容単語と句切りが理解できるか同じ音量で比較し、意味を変える欠落や追加は不採用にする。
声質本人性を主張せず許可された目的を満たすか必要な特徴と採否理由を書く。
ピッチと時間意図した動きとタイミングが使えるか同じ箇所を比較し、不安定になる位置を記す。
アーティファクトハム、金属音、息の変化、途切れ、元声の漏れを許容できるか時刻を保存し、合意した許容幅で判断する。
納品変換済みと識別でき、元と設定まで追跡できるか別名、変換注記、正確な設定を残す。

用途により合格基準は変わります。非公開の試作で許せる欠陥も、公開ステムでは失格です。魅力的でも単語を変え、権利を破り、追跡不能なら不採用です。清掃、分離、環境、学習、出力、反復推論、試聴、編集、権利確認を修正予算に含めます。

実際の音声経路でリアルタイムを測る

ルート README はエンドツーエンド 170 ms、ASIO 入出力で 90 ms と報告し、後者が機材ドライバに強く依存すると注意します。これは管理者の観察で、ここで再現した測定や保証ではありません。公式の観察

入力取得から監視出力までを測り、UI、機器、ドライバ、サンプルレート、バッファ、機材、モデルとインデックス、同時負荷を記録します。推論時間だけでは取得、バッファ、再サンプリング、配線、再生を含みません。最良値だけでなく反復値と途切れを報告します。

まずオフライン品質を合格させます。単語が不明瞭、ピッチが崩れる、経路が不安定なら低遅延値に意味はありません。バッファで遅延と途切れが交換関係になるなら両方を示します。リアルタイム UI は DAW、OBS、Discord、配信との統合試験ではありません。

最初に失敗した段階を診断する

学習回数や複数設定を増やす前に、最初の不一致を探します。次表は仮説であり実測失敗率ではありません。

観察最初の確認制御した次の操作
WebUI が起動しないPython、依存、Torch、資産パス音声評価前に環境を直す。
声またはインデックスがないassets/weights/assets/indices/、記録した組ファイルを戻し、来歴を確認する。
単語が変わる元、前処理、同音量の出力同じモデルで清潔な対照を試す。
声質が漏れるか不安定対応インデックス、検索、対象データ、同じ句一つずつ変え、目的を満たさなければ拒否する。
ピッチが崩れる同じ時刻と抽出方式他設定を固定して別方式を比較する。
ライブ音声が途切れる機器、ドライバ、レート、バッファ、負荷、経路ログ安定化して全経路を再測定する。

分離、再サンプリング、クリッピング、不適合な組、ピッチ抽出、配線が原因になり得ます。金属音をすべて検索失敗と決めません。全候補が必須条件を外すか予算超過なら停止します。追加学習や別インデックスは実験であり自動修復ではありません。

コード、モデル、声の権利を別々に確認する

LICENSE は MIT です。著作権と許諾表示を残す条件でソフトウェアの利用、変更、配布を広く許可し、保証はしません。確認したコードをオープンソースと分類する根拠になります。公式 MIT License

第三者チェックポイント、録音、演技、楽曲、任意重み、サービス条件の権利は与えません。公開チェックポイントも来歴や許可が不足する場合があります。有料 UI も権利を移転しません。

特定人物の声では、学習、変換、表示、共有、商用文脈に合う許可を記録します。本人の実際の発話や支持として示しません。非公開許可なら重みと出力を公開しません。依存資産の条件も別に確認します。本稿は法的許可ではありません。

学習、ライブ経路、停止を選ぶ

オフライン変換が表と来歴条件を満たしたら、環境、チェックポイントとインデックス、設定、元、採用出力を一緒に保存します。その後にバッチ、再学習、ライブ経路を判断し、拡張ごとに証拠を作ります。

対象音声の学習が不要なら、許可された TTS や zero-shot が適する可能性がありますが、特定製品は検証していません。ピッチ補正、ノイズ修復、分離だけなら狭い処理を選びます。ライブが失敗してオフラインが使えるならオフラインを維持します。

権利が不明なら追加モデルの取得や共有前に停止します。分離や再サンプリング後だけ悪化するなら、再学習前に入力を直します。代表クリップで不安定なら別の許可データか方法が必要です。競合との順位付けはしません。

不足機能を特定した後、モデルディレクトリを参照してください。公開または顧客利用前に現在のリビジョンを確認し、許可された実作業を実行し、測定結果と必要な権利を記録します。人気、出力ファイル、低遅延の数字だけでは判断できません。