SUPIR
同じ入力でQ/Fと説明文を比較し、SUPIRが生成した細部を原本と照合します。重みの利用許諾を確認してから試すための資料に基づく評価です。
モデル情報と利用方法
- モデル名
- SUPIR
- 利用方法
- 公開参照コードと文書中のQ/Fリンク。評価前に、専有の重みの利用許諾を確認する必要があります。
- モデルの種類
- 拡散モデルによる画像復元
- アーキテクチャ
- SDXLを基盤に、復元誘導サンプリングと任意のLLaVA説明文を用いる構成
- 対象ユーザー
- 許可された画像を原本と比較できる画像編集者と開発者。
- 入力
- 許可された劣化画像、変更していない原本、可能なら劣化の少ない対照画像。
- 出力
- テクスチャ、文字、顔、形状を原本と照合すべき生成復元候補。
- 費用
- 取得、起動、説明文、サンプリング、メモリ、目視確認を実測する。
- 避けるべき場合
- 本人特定、証拠の回復、真正性の証明には不適切です。重みの権利が不明なまま試験を始めないでください。
情報源と評価方法
ライセンスと権利
- ライセンス
- SUPIR Software License Agreement
- ライセンスの種類
- ソースコード公開
- ライセンスの適用範囲
- LICENSE第2(b)項は専有ニューラル構成要素に書面許可を求め、第3(a)項は非商用利用を記載しています。両者の関係と具体的なQ/Fの重みの許諾は未解決です。第3(b)項は別の商用契約を求めます。本稿は利用を許可するものではありません。
- オープンソース
- いいえ
提供状況
- 状態
- 提供中
- 状態の適用範囲
- 提供状況の確認は、調査したコミットのソースと文書中の取得リンクに限ります。重みの取得、GitHubのリリース添付ファイル、実行、互換性、保守、外部サービスは検証していません。
要点
同一条件でQ/Fを比較
同じ入力で比較するためにQとFを選べます。特徴の説明は保守者によるもので、本稿が再現した順位ではありません。
説明文の影響を追跡
CLIは説明文を表示し、空の説明文も使えます。最終PNGは保存しますが、説明文用の中間画像は書き出しません。
許諾は確認が必要
書面許可の条項と非商用の記述を、対象の重みと活動について確認する必要があります。
利用例と制約
条件を限定した比較を計画
処理できる劣化写真と対照画像を使い、他の条件を固定してQ、F、説明文なしを比較します。許諾の確認が前提で、導入や実行は本稿で試していません。
派生画像の受入判断を記録
原本、設定、構造、質感、加工の表示を確認します。元にない文字や変わった顔は却下し、採用と却下の理由を残します。
利点
- Q/Fの選択により、同じ入力で条件を固定した比較ができます。
- 任意の説明文生成により、文章による誘導の影響を調べられます。
- 公開された参照コードで、サンプリング、数値型、分割処理の設定を確認できます。
制約
- 生成された質感が、原本にない文字や顔の特徴、形状を作るおそれがあります。
- 重みの利用許諾は未解決で、公開リンクだけでは許可を確認できません。
- 参照手順はCUDAと複数のモデル構成要素を必要とし、作業全体の資源測定が必要です。
トピック
- SUPIR
モデルについて
このページの内容
SUPIRは、SDXLと画像の説明文を用いる生成型画像復元の研究システムです。もっともらしい質感が生まれても、その細部が原本に存在した証拠にはなりません。本稿は公式資料に基づく評価で、資料は2026年9月20日に再確認しました。モデルの重みの取得、画像処理、速度や品質の測定は実施していません。重みの利用許諾についても未解決の点があります。
復元で守るべき情報を先に決める
処理が許可された一枚の劣化写真から、見る人にとって重要な事実を変えずに、表示に役立つ派生画像を作れるかを考えます。原本で確認できる特徴、不確かな特徴、変更してはいけない特徴を記録してください。目や文字、表面が鮮明になっても、それが生成された細部である可能性は残ります。
論文は、規模を拡張した生成事前分布、文章による注釈付きの大規模学習データ、低品質を表すネガティブプロンプト、復元誘導サンプリングを説明しています。これは提案手法に関する研究上の主張で、本稿の測定結果ではありません。著者の所属にはShenzhen Institute of Advanced Technology、Shanghai AI Laboratory、University of Sydney、Hong Kong Polytechnic University、Tencent PCGのARC Lab、Chinese University of Hong Kongが含まれます。研究の出自を一社だけで説明するのは不正確です。著者の所属。 公式論文。
未知の人物の特定、読めない車両番号の判読、証拠となる情報の回復、真正性の証明には使わないでください。自然な再構成は不確実性を隠すおそれがあります。傷んだ原本を残す、利用できる別の参照画像を得る、欠落情報の回復をうたわない非生成型の補正を選ぶ方が適切な場合があります。
構成要素と重みファイルを個別に確認する
公式の構成は単一のモデルファイルで完結しません。READMEはSDXLのCLIPエンコーダー、SDXLの基本モデル、LLaVA CLIP、LLaVA v1.5 13Bを挙げています。SUPIR-v0QとSUPIR-v0FはBaidu NetdiskとGoogle Driveへのリンクで案内され、任意のJuggernautモデルは別項目です。構成要素と取得先。
構成要素ごとに取得元と利用条件を確認します。本稿ではリンク先の重みを取得せず、ハッシュ値も計算していません。GitHubのリリース添付ファイルも確認していません。READMEのリンクは取得経路の記載であり、ファイルの完全性、継続的な入手可能性、互換性、特定用途への許諾を証明しません。
CKPT_PTH.pyには保守者の環境の絶対パスが入っています。パスとYAML内の重みの場所を設定します。READMEではHugging Faceに接続できる場合、指定のCLIPパスをNoneにして自動取得を使えますが、すべてのモデルのパスを消す指示ではありません。比較前にリポジトリのコミット、各取得元URL、ローカルファイルのチェックサム、依存関係の版を記録してください。似た名前のミラーを説明なく代用してはいけません。パスの設定。
同一条件でQとFを比較する
参照CLIは既定で--SUPIR_sign Qを使い、QまたはFを指定できます。READMEはQを論文の既定の学習設定で広い汎化を狙うもの、Fを軽い劣化で学習し第一段のエンコーダーがより多くの細部を保つものと説明しています。これは保守者の案内であり、独立した比較試験による順位ではありません。 CLIの選択肢。Q/Fの説明。
入力、切り抜き、出力倍率、乱数シード、正負のプロンプト、サンプリング設定を固定してください。複数の条件を同時に変えると、違いの原因を一つに絞れません。却下した画像も理由とともに残します。
難しい画像に加えて、劣化の少ない対照画像も使います。すでに見えている質感が不要に変わるかを確認するためです。原本で確認できる文字、顔の構造、製品の形状が、利用目的に応じた許容範囲を超えて変われば、その候補を却下します。 QとFで自動説明文が異なる場合は、重みだけではなく処理全体の比較として解釈してください。
説明文と処理寸法を把握する
参照スクリプトは、説明文用にノイズを減らした画像を作り、短辺を512ピクセルにすることを目標にします。通常はLLaVAがこの画像を説明し、その文章が拡散サンプリングに使われます。--no_llavaを指定するとLLaVAを読み込まず、説明文は空になります。ただし事前のノイズ除去は実行され、正負のプロンプトも有効なままです。CUDAが必要な点も変わりません。説明文を作る処理。
スクリプトは引数と説明文を端末に表示し、最終結果をPNGで保存します。説明文に用いた中間画像は保存しません。これを確認するには、画像を書き出す処理を明示的に追加する必要があります。その変更は本稿では実装も検証もしていません。追加しない場合は原本、記録した説明文、最終PNGを比較し、中間画像の診断はできないと記録してください。端末のログは中間画像の書き出しではありません。
正負のプロンプトを全文保存し、内容の作り込みが心配な場合は自動説明文と空の説明文を比較します。原本が裏付けない事実を要求しないでください。たとえば「鮮明な青い文字」という指定は、元の文字を回復する代わりに、読めるように見える文字を生成する可能性があります。
CLIの既定値は乱数シード1234、EDM 50ステップ、誘導強度4.0、第二段の制御強度1.0、min_size 1024、upscale 1です。画像処理関数は、まず入力寸法に拡大率を掛けた保存先の寸法を記録します。その後で短辺の内部最小寸法を適用し、処理寸法を64の倍数に丸めます。保存時には記録した寸法へ戻します。この既定設定では512 × 512の入力を倍率1で処理すると、内部は1024 × 1024、保存結果は512 × 512になります。これはコードから導いた寸法で、実行して観測した値ではありません。CLIの既定値、寸法と保存の関数。
READMEの品質重視と忠実度重視の設定は出発点であり、常に最適とは限りません。一度に一つの条件だけを変え、保存する寸法と内部処理についての想定を分けて記録します。PNGの寸法を調べても、内部のテンソルの寸法はわかりません。保守者の設定例。
実行前に重みの利用許諾を確認する
SUPIR Software License Agreementを、単に「非商用なら利用可能」と要約することはできません。第2(b)項は、専有ニューラルネットワーク構成要素の使用、複製、変更、配布などの権利を、明示的な書面による許可なしには与えていません。一方、第3(a)項は専有の重み、バイアス、アーキテクチャの利用を非商用目的に限定し、第3(b)項は別途の商用契約を求めています。書面許可の条件と非商用の記述の関係は、本稿では解決できていません。LICENSEの第2項と第3項。
どの条項が優先されるかを本稿は判断せず、Q/Fの重みの利用も許可しません。評価計画を実行する前に、対象の重みと予定する活動についてライセンス提供者に確認してください。コードが公開され、取得リンクがあることは許諾の証明ではありません。SDXL、LLaVA、任意のJuggernautモデル、入力画像、出力の条件も個別に確認します。公開または有料の画面があるだけでは、これらの権利は確定しません。
READMEにはSupPixelのオンラインアプリへのリンクがあります。本稿では画像を送らず、現在の規約、プライバシー、価格、稼働状況も試していません。送信前に運営者を確認し、その日に適用される条件、データの取扱い、出力の利用許諾を保存してください。確認できた提供範囲は閲覧可能なソースと文書中のリンクまでです。重みを取得できたことやサービスの稼働を示すものではありません。文書中のオンラインアプリ。
範囲を限定して比較を計画する
最初に重みの許諾を確認します。そのうえで処理可能な写真と、劣化の少ない対照画像を用意してください。原本を保管し、必要なら作業用コピーから機微なメタデータを除き、用途と変更できない特徴を書き出します。隔離した環境を使い、実際の依存関係とドライバーの版を記録します。READMEのPython 3.8の手順は、現在のあらゆるOSとの互換性を保証しません。導入手順。
次のコマンドは未実行の比較計画です。重みの設定とCUDAを前提としています。シェルの出力先指定により、表示された引数や説明文を含む標準出力とエラーを、実行ごとのログに残します。次の実行へ進む前にログを確認してください。本稿で成功を確認したコマンドではありません。CUDAがなければスクリプトはエラーになります。機器と引数の処理。
mkdir -p logs
python test.py --img_dir inputs/control --save_dir results/q --SUPIR_sign Q --seed 1234 > logs/q.log 2>&1
python test.py --img_dir inputs/control --save_dir results/f --SUPIR_sign F --seed 1234 > logs/f.log 2>&1
python test.py --img_dir inputs/control --save_dir results/no-caption --SUPIR_sign Q --seed 1234 --no_llava > logs/no-caption.log 2>&1入力フォルダーには対象のテスト画像だけを置き、ファイル名の本体が重複しないようにします。最終PNGの命名規則は<input-stem>_<sample-index>.pngです。入力がcontrol.pngで出力が一枚なら、Qの結果はresults/q/control_0.pngになります。表示される説明文には入力名が付かないため、一回につき一画像にすれば対応を明確に保てます。ファイル処理と命名。
原本、ログ内の説明文、PNGを、最終表示寸法と重要な切り抜きの両方で比較します。形式、色プロファイル、入出力寸法、省略された既定値も記録してください。内部寸法や計算資源の実測には、別の測定または記録処理が必要です。通常のログに自動で含まれるとは限りません。対照画像が受入表の条件を満たしてから難しい画像に同じ計画を適用します。追加の書き出しを行わない限り、中間画像は確認できません。
受入表で派生画像を判断する
次の表は本稿独自の評価補助資料で、実測したベンチマーク結果ではありません。対象を増やす前に、実際の観察内容で埋めてください。
| 段階 | 判断すること | 残す証拠 |
|---|---|---|
| 原本 | 何が見え、何が不明で、何が欠けているか | 変更していない入力と不確実性のメモ。 |
| 設定 | どの重み、説明文、プロンプト、サンプリング値を使ったか | 完全なコマンド、環境、ファイルのチェックサム。 |
| 構造 | 顔、文字、輪郭、製品の形状が変わったか | 原本と候補を同じ尺度で切り抜いた画像。 |
| 質感 | 偽の事実を示さず、追加された質感が役立つか | 採用と却下の切り抜き、その理由。 |
| 提供 | 原本と加工画像を受け手が区別できるか | 別々のファイル名と加工したことの注記。 |
見栄えがよくても、人物を特徴づける部分を変えたり、原本に裏付けのない読める文字を作ったり、重要な輪郭を動かしたりする画像は却下します。少しぼやけている方が忠実な場合があります。一般的な鮮明度の点数ではなく、実際の表示目的から許容範囲を決めてください。
手元にある証拠から原因を絞る
品質設定を上げる前に、原本、ログ、Q/Fの選択、プロンプト、サンプリング、色補正、PNGを確認します。標準のCLIは説明文用の画像を保存しないため、その画像が最初に変わった箇所を観察できません。また、手作業で修正した説明文を渡す引数もありません。どちらも、別途レビューと試験を行うスクリプト変更が必要です。CLIの選択肢と説明文。
| 観察 | 最初に確認する証拠 | 条件を固定した次の操作 |
|---|---|---|
| 異なる対象が現れた | 原本、ログ内の説明文、PNG | 他の設定を固定し--no_llavaと比較。中間画像の診断は不可。 |
| 文字が読めるが内容が異なる | 同じ尺度の原本とプロンプト | その細部を却下し、内容を断定する指示を除く。 |
| 色が変わった | 色補正値と原本のヒストグラム | 文書にある色補正方式を一つずつ比較。 |
| 軽い劣化が過剰に処理された | 同一入力のQ/Fの組 | 同じ条件でFを試すか、両方を却下。 |
| メモリが不足した | 寸法、機器への配置、完全なログ | 文書にある負荷要因を一つ減らして再測定。 |
これらは診断の仮説であり、測定済みの失敗率ではありません。最初に得られる失敗の証拠と正確なコマンドを残します。ログと保存ファイルから原因を絞れなければ不明と記録し、見られない内部段階を確認済みとはしないでください。
作業全体の資源とプライバシーを確認する
参照スクリプトは、使用可能なGPUが二台以上ならSUPIRとLLaVAを別の機器に配置し、一台なら同じ機器を使います。CUDAがなければエラーになります。機器への配置。 READMEの低メモリで遅いGradio例には、拡散処理に12 GB、LLaVAに16 GBという注記があります。普遍的な最低要件ではなく、一台の12 GB GPUで全工程が動く証拠でもありません。Gradioの例。
重みの取得、起動、説明文の生成、サンプリング、保存、人による確認を別々に測定します。入力と出力の寸法、Q/F、ステップ数、出力枚数、数値型、分割処理の設定、機器の型番、最大メモリ使用量、所要時間を記録してください。確認したオートエンコーダーはfp32またはbf16を受け付け、fp16はNaNが生じるエラー経路として拒否します。拡散側の精度は別の設定です。すべての数値型の組み合わせや機器で安全に動くと確認したわけではありません。モデルの数値型。
非公開画像やライセンス画像では、ローカル処理が必要かを判断します。自分で運用するだけでは、画像の権利、写っている人の同意、依存ソフトウェアが送信する利用情報の問題は解決しません。公式Gradio例は履歴を記録できるため、有効になっているログを確認してください。外部サービスは、プライバシーと保存期間を別に確認する必要があります。履歴の設定。
証拠に基づいて次の手順を選ぶ
条件を固定した候補が予定する表示を改善し、原本で確認できる構造を保ち、重みと用途の許諾が明らかで、修正と確認の負担が許容できる場合だけ進めます。原本、設定、説明文、プロンプト、ログ、採用と却下の画像、加工の注記をまとめて保存してください。
重要な細部を作り込む、必要な権利が不明、資源上限を超える、手直しを繰り返す場合は中止します。通常の拡大縮小、ノイズ除去、手作業の修整、よりよいスキャン、あるいは復元しない選択が合うこともあります。本稿は他のモデルとの順位付けをせず、論文の実験も再現していません。
不足している機能を明確にしてからモデル一覧を参照し、同じ許可済み入力と受入表で代替手段を比較します。公開リポジトリ、鮮明な画像、終了したコマンドだけでは、用途への適合性は判断できません。