DWPose

DWPoseをポーズ前処理として評価します。人物検出、キーポイントの対応付け、描画したマップ、後段の画像生成を分けてから、キャラクター参照の工程を判断します。

モデル情報と利用方法

モデル名
DWPose
利用方法
公式ONNXブランチには別々のコード経路とモデルファイルが記されています。ミラーの内容やライセンスが同じと考えず、確認した公式素材を使用します。
モデルの種類
CNN + Transformer
アーキテクチャ
RTMPoseを基にした全身ポーズ推定
対象ユーザー
画像生成の前に、問題の原因を調べられるポーズ前処理が必要なテクニカルアーティストや開発者。
入力
人物検出と全身ポーズ推定に使う参照画像、および選んだ経路で使う検出・ポーズの正確なチェックポイントの組。
出力
生のポーズ座標。確認した統合では、後段へ渡す身体、手、顔を描画したマップも得られます。
費用
人物検出、ポーズ推定、描画を、後段の画像生成や手修正とは別に測定します。本稿では全体のフレームレートや最低ハードウェアを検証していません。
避けるべき場合
計測に基づく3Dの動きや完成した生成画像が必要なら別の工程を選びます。DWPoseの推定画像座標とポーズガイドは、そのどちらも確立しません。

情報源と評価方法

ライセンスと権利

ライセンス
Apache 2.0:公式DWPoseコードとONNXチェックポイント
ライセンスの種類
オープンソース
ライセンスの適用範囲
確認した公式DWPoseコードと、公式モデルリポジトリの固定リビジョンにあるyolox_l.onnx / dw-ll_ucoco_384.onnxはApache 2.0を示します。必要な告知を残し、派生版、後段モデル、サービス、入力、出力は別途確認します。
オープンソース
はい

提供状況

状態
提供中
状態の適用範囲
公式プロジェクトではコードと記載のONNXの組が公開されています。利用可能はその素材を指し、ホストサービス、機器互換性、動画追跡、生成品質を保証しません。

要点

人物検出とポーズ推定は別の段階

調べたONNX経路は、ポーズ推定の前に人物を検出します。キーポイントの品質を原因とする前に、選ばれた人物と囲まれた範囲を調べます。

生のキーポイントと描画したマップは異なる

確認したラッパーは、身体、手、顔の描画前に点を除外・並べ替えます。別途計算した足の点は描画しないため、全身推定でもガイド画像に全点が出るわけではありません。

確認した前処理パッケージはApache 2.0

公式コードと、確認した公式モデルリポジトリ内の正確なONNX検出・ポーズファイルはApache 2.0を示します。後段の生成器、ラッパー、入力、出力は別途確認が必要です。

利用例と制約

条件を管理した画像処理用のポーズマップ準備

参照画像を一つ使い、対象人物と見える関節の関係を指定します。検出、生の点、描画マップ、後段の画像を四つの別の段階として確認します。

手修正の前に問題の発生箇所を特定

テクニカルアーティストは最初に崩れた表現を参照と比較し、検出、対応付け、描画ガイド、後段の生成器のどこを調整するか判断できます。

利点

  • 調べた実装では、検出器とポーズ推定器の段階を別々に識別できます。
  • ポーズ推定器は、描画ラッパーがガイド画像を作る前に座標と信頼度を返します。
  • 確認した公式コードと正確なONNXチェックポイントのリポジトリはApache 2.0を示します。

制約

  • ポーズマップが正しくても、後段の画像生成器が従うとは限りません。
  • 低信頼度の点の除外、対応付けの変更、描画方法によって、見えるマップと生の全身出力は異なる場合があります。
  • 調べたラッパーにはCUDA固有の挙動があり、すべての統合の互換性や速度を証明しません。

トピック

  • DWPose

モデルについて

このページの内容

DWPoseは画像から人の身体、手、顔、足のキーポイントを推定します。画像生成の工程では、別のシステムへポーズ情報を渡す役割を担います。DWPose自体がプロンプトから完成したキャラクターを作るわけではありません。もっともらしい生成画像に手の誤り、人物の欠落、関節の左右の逆転が隠れかねない場合など、確認と原因調査ができるポーズ参照が必要なときに評価するものです。

本稿は研究プロジェクトと公式ONNX統合について、2026年9月10日に確認した資料に基づくレビューです。ポーズ推論、処理時間の測定、生成画像の比較は実施していません。以下の例は評価計画の提案であり、成功した試験の報告ではありません。

確認したソースの版: コード 3dca5db7, モデルカード 1a714410.

DWPoseが担当する工程を理解する

DWPoseの論文は、全身のポーズ推定と、その推定器を学習する二段階の蒸留手法を説明しています。これらは学習の段階であり、写真ごとにユーザーが実行する二つの推論手順ではありません。複数サイズのモデルが公開されているため、名前だけで共通のパラメータ数や速度は決まりません。DWPoseの研究論文

原因を調べる際は、入力画像、検出された人物とキーポイント、後段へ渡すポーズ表現、最終生成画像の四つを分け、評価中はすべて保存します。ポーズマップが間違っていれば、テキストプロンプトを変えても元の原因は説明できないでしょう。マップが正しくても生成画像が従わない場合、次に調べるのは後段です。

この区別はキャラクターの参照に特に役立ちます。イラストレーターが、胴体の前で小さな箱を持つ人物を描きたいとします。手は箱に重なり、片方の肘は一部隠れ、写真の端には別の人も写っています。完成画像の衣装や顔が自然でも、必要なポーズが移った証拠にはなりません。全体の見栄えを判断する前に、対象の人物と重要な関節を決めます。

DWPoseは、計測に基づく三次元リグ、モーションキャプチャ、用途別の安全性評価の代わりにはなりません。骨格の表示からそうした機能を推測しないでください。ポーズ前処理が役立つことと、「ポーズ」という語を使うあらゆる用途に対応することは別です。

生の座標と描画したマップを分ける

公式ONNXの例では、全身を扱うラッパーが人物検出器を呼び、その後でポーズ推定器を呼びます。さらに首の位置を計算し、OpenPose形式の表現に合わせてインデックスを並べ替えます。研究モデルの元の順序を期待する受け手は、すべての出力配列が同じ意味だと思わず、実際のインターフェースを確認する必要があります。全身推定のラッパー

描画用ラッパーは座標を正規化し、信頼度の低い点を除外して、身体、手、顔の情報を描きます。最終的な返り値はポーズのラスター画像であり、元のキーポイント配列全体ではありません。コードは足の点を取り出していますが、描画関数へ渡すポーズ辞書には含めていません。ControlNetのプレビューが全身の生の点をすべて表示すると約束できない具体的な理由です。ポーズマップの実装

独自の受け手を接続する前に、必要なのが画像か座標か、単位がピクセルか正規化値か、人物と関節の順序、欠損値の扱いを記録します。わかりやすい点を元画像と照合します。プレビューで左手首が正しい側にあっても、独自の数値出力ではラベルが間違っているかもしれません。

構造化された座標が必要なら、それを実際に返すインターフェースを使い、信頼度や欠損点の情報を残します。圧縮したスクリーンショットの色から正確な座標を復元しようとしないでください。情報を失う変換が増え、原因調査が難しくなります。

インストール方法を一つ選び依存関係を記録する

リポジトリでは、MMPoseを使う研究用環境とControlNet統合が区別されています。ONNXブランチには、統合のためにMMPose全体を入れずに済む方法があり、別のOpenCVベースのブランチも案内されています。全員がまとめて入れるパッケージ一覧ではなく、異なる導入経路です。インストール手順

文書化されたONNXの例では、人物検出とポーズ推定の両方のチェックポイントが重要です。ポーズモデルのファイル名だけを保存しても、処理の一部が特定できません。リポジトリのコミットとブランチ、両方の重みの識別子、実行プロバイダー、画像前処理、後段モデルのバージョンを一つの実行記録にまとめます。公式ONNXの例

実際に使うコードのデバイス選択を確認します。調べたラッパーはコンストラクターでCUDAを選びます。式の中にCPUの分岐があるだけでは、変更していないコードが手元の機器で自動的にCPUを選ぶ証拠にはなりません。コミュニティ製ノードでは挙動が違う場合もあるため、すべてのDWPose統合を互換とせず、ラッパーを特定する必要があります。

試験には隔離した環境を使い、依存関係の記録を残します。古い解説で固定されたバージョンは以前の構成を再現する助けになりますが、現在のグラフィックドライバーやアプリとの互換性は示しません。本稿では環境をインストールしていないため、特定のOSとGPUの組み合わせを保証しません。

処理全体の権利を確認する

DWPoseリポジトリのコードはApache 2.0です。公式READMEはモデルの配布先としてHugging Faceのyzd-v/DWPoseも案内しています。本稿で確認した固定リビジョンではApache 2.0が宣言され、公式例が指定するONNXの組、人物検出用yolox_l.onnxとポーズ推定用dw-ll_ucoco_384.onnxが収録されています。リポジトリのライセンス固定リビジョンのモデルカードのライセンス

この根拠が対象とするのは、確認した公式コードと二つの重みファイルです。名前を変えたミラー、派生重み、ControlNetやStable Diffusionのモデル、ラッパー、ホストサービス、元写真、生成結果を一括して許諾するものではありません。対象素材の再配布時は必要な告知を保持し、ダウンロードしたファイルを確認済みの配布元と照合して、他の各構成要素の条件を調べます。

キャラクター参照の例では、写真の提供者と、予定する変換や公開が許されるかを記録します。ポーズ表現にしても元資料に伴う義務は消えません。生成した人を実在の顧客、従業員、推奨者として見せないようにします。骨格情報だけならプライバシーや肖像に関する問題が自動的に解決すると考えてはいけません。

商用導入で別のチェックポイントに置き換えたり、条件が不明な構成要素に依存したりする場合は、条件がわかるまでその導入判断を止めます。確認した公式の組に付いたApache 2.0の表示を、名前が似ている、ダウンロードボタンの隣にあるといった理由で別ファイルに適用してはいけません。本稿は法律相談ではなく、組み合わせた処理全体への許可を与えるものでもありません。

失敗から原因を学べるポーズ試験を設計する

箱を持つ参照画像を、意図的に範囲を絞った試験に使います。対象人物と、どちらの手が箱を支えるか、肘が胴体の前を横切るか、肩がどちらを向くかという重要な関係を指定します。単純なポーズの二枚目も比較用に保存します。これは評価入力の想定であり、処理済みの画像ではありません。

参照画像の寸法と、すべての切り抜き・リサイズを記録します。人物を切り出した画像と全体画像を両方保管します。狭い切り抜きは検出器に与える情報を変えるためです。最終的に複数人を扱うなら、その状況も標本に含めます。一人だけの画像では人物の選択や順序を検証できません。

まず画像を生成せず、検出とポーズマップを確認します。見える関節を参照と比較し、曖昧な部分や隠れた部分には不確実と記します。元画像に見えない解剖学的な位置を、もっともらしい推測だけで確認済みと評価してはいけません。別のデバッグ表示ではなく、次のモデルへ実際に渡すマップを保存します。

この段階が合格してから後段の生成器を試します。一つの関連入力を変える間は、プロンプト、seed、モデル、条件付けの設定、出力寸法を固定します。そうしないと、見栄えの改善がポーズ推定ではなく、別のseedやチェックポイントによるものかもしれません。

四段階の受け入れ確認表を使う

この表はイラストレーターの作業に向けた独自の提案です。ポーズの正しさと画風を意図的に分けています。自分の観察で埋め、不合格の例も残します。

段階確認する問い受け入れの根拠
人物の選択端の人物をポーズに混ぜず、対象人物を表しているか対象を示した元画像と、それに対応する検出・ポーズ出力。
関節の配置見える肩、肘、手首が必要な身振りと一致するか参照との並列比較。隠れた関節や不確かな関節は推測で埋めず明示する。
表現の受け渡し後段が必要なマップや座標形式を受け取るか保存した素材、寸法、インデックス・座標の規則、確認済みの読み込み。
生成結果設定を固定したとき、最終キャラクターが身振りを保つか事前に定めた手、肘、胴体の関係との比較。

ある段階が合格でも次が失敗することはあります。一つの品質点数にまとめず、その結果を残します。正しく検出した手首から後で誤った手が描かれることと、生成前から手首が欠けていることは別の失敗です。修正方法も、その確認に必要な根拠も異なります。

試験前に編集の予算を決めます。少数の関節を人が短時間で直せるなら、半手動の工程で要件を満たせるかもしれません。すべての参照に大きな再構成が必要なら、同じシステムでもその作業には不向きです。成功した生成だけでなく、修正時間と不採用の入力も記録します。

最初に問題が見える工程から調べる

以下は診断の仮説であり、DWPoseで測定した失敗率ではありません。保存した中間結果を使い、手元の事例に当てはまる説明を調べます。

症状最初の確認条件を管理した次の手順
対象人物がいない実際に前処理した入力で検出器が対象を見つけたか全体画像と意図して切り抜いた画像を比較し、両結果を保存する。
マップに手がない描画前の見え方、スケール、信頼度による除外元の該当部分と、取得できる場合は生の値を確認する。すぐ生成器を変えない。
左右が逆に見える書き出し・読み込み時の関節インデックスと座標規則明確な関節を一つ選び、変換を追って元画像と比較する。
マップは正しいが生成した身振りが変わる条件付けの入力、対応形式、後段の設定同じ生成設定と、合格するとわかっているマップで繰り返す。
動画のポーズがフレーム間でちらつく各フレームの検出、遮蔽、人物の対応付け画像生成設定で解決したとする前に、隣り合うマップを調べる。

動画では、静止画の推論を繰り返すことを検証済みの追跡と同一視しません。必要なのが人物の一貫した識別か、滑らかな軌跡か、独立したポーズマップだけかを決めます。それぞれ一枚を超える明示的な試験が必要で、本稿ではそのような連続フレームの試験は行っていません。

目立つフレームレートより修正込みの総コストを比べる

画像準備、人物検出、ポーズ推定、描画または書き出し、後段の生成を別々に測ります。初期化とウォームアップ後の推論を分け、実際に使った機器と実行プロバイダーも記録します。範囲を示さないフレームレートだけでは、使える参照までの時間をテクニカルアーティストは判断できません。

入力範囲の拡大、モデルの別版、検出器の変更は処理量を変えます。最大モデルが常に最適と考えず、同じ重要関節と修正予算で候補を比較します。論文のベンチマークは特定の研究課題の測定であり、手元のラッパーの遅延や生成キャラクターの手の品質を保証しません。

自動抽出より正確にポーズを作り込むことが重要なら、手で編集したポーズや制御したリグが直接的な出発点になります。時間をまたぐ人物の識別が中心なら、追跡を明示的に扱う工程を評価します。元画像が曖昧で身振りを特定できない場合、パラメータを繰り返し変えるより明確な参照を入手するほうが有用かもしれません。

次に決めることは限定的です。選んだDWPose実装が、許容できる修正量で必要なポーズ表現を返せるかを確かめます。画像処理全体の成功を主張するのはその後です。モデル一覧では他の分類も確認できますが、本稿はモデル横断の順位や万能な代替手段を示すものではありません。

よくある質問

DWPoseは画像処理のどの部分を担当しますか?

確認した経路では、人物を検出してポーズのキーポイントを推定し、マップを描画できます。その後の画像生成自体は行いません。

DWPoseの描画マップには生のキーポイントがすべて含まれますか?

そうとは限りません。確認した描画経路は低信頼度の点を除外し、身体、手、顔の描画データを渡します。計算した足の部分は描画用辞書に含まれません。

DWPoseはオープンソースですか?

確認した公式コードと、正確な公式ONNX検出・ポーズ素材はApache 2.0を示します。この分類は後段のモデル、ラッパー、ユーザー入力、生成結果を対象にしません。

本稿ではDWPoseの精度や速度を試しましたか?

いいえ。資料に基づく評価です。手元の工程におけるフレームレート、ハードウェア要件、ポーズ精度、後段の画像品質を確定するものではありません。