フレームペインター
無料
FramePainter は、ICCV 2025 に含まれるオープン ソースの画像編集ツールです。これは、ビデオ拡散事前 (Stable Video Diffusion) を使用して、スケッチベースのインタラクティブな画像編集を実装します。ユーザーは画像上にスケッチを描くだけで、AI が編集の意図を理解してプロレベルの効果を生成し、一般的な編集シナリオとドメイン外の一般化シナリオの両方で優れたパフォーマンスを発揮します。
フレームペインター
コアパラメータと統計
| プロジェクト | 仕様 |
|---|---|
| 製品名 | フレームペインター |
| カテゴリー | AIビジュアルデザイン・画像編集 |
| 納品形態 | デスクトップツール (Python/PyTorch) |
| サポートプラットフォーム | デスクトップ |
| サポートされている言語 | zh-CN、en-US |
| 対象ユーザー | AI研究者、デザイナー、クリエイティブワーカー |
| ユーザースケール | GitHub 406 スター (学術プロジェクト) |
| 価格モデル | 無料 (MIT オープンソース) |
プラットフォームのカバレッジとユーザー規模のデータは、公式のリアルタイム ページとサードパーティの統計に基づいています。
ユーザーと市場の認識
FramePainter の論文は ICCV 2025 に受理され、インタラクティブな画像編集の方向で SOTA の主要な結果を達成しました。以前の方法と比較して、FramePainter は大幅に少ないトレーニング データでより優れた編集品質と一般化機能を実現します。 GitHub で 406 スターを獲得している HuggingFace は、完全な事前トレーニング済みウェイトを提供します。 Art WeeklyやKDJingpaiなど多くのAIツール集約サイトに収録されています。 「画像編集を画像からビデオへの生成に再構築する」という提案された技術的アイデアは、その後のインタラクティブ編集研究に新しいパラダイム参照を提供します。
コストメリット
| コスト ディメンション | 説明 | |
|---|---|---|
| ソフトウェアライセンス | MIT オープンソース、完全に無料 | |
| 事前にトレーニングされた重み | HuggingFace | から無料ダウンロード |
| 商用利用 | MIT ライセンス、商用利用許可 | |
| ハードウェアのコスト | 独自の NVIDIA GPU を持参する必要があります (8 GB 以上のビデオ メモリを推奨) |
この論文では、Stable Video Diffusion のビデオ拡散を事前に使用しているため、トレーニング データ量と計算コストが、テキストから画像への拡散モデルに基づく以前の方法よりもはるかに低いと指摘しています。
主な機能
- スケッチベースの編集: ユーザーが画像上にスケッチを描いて編集意図を指定すると、AI がスケッチの意味を自動的に理解し、指示に従った画像を生成します。スケッチの厚さ、位置、形状は、正確なマスキングを必要とせずに、編集結果に直接影響します。
- クリックベースの編集: クリック操作で編集範囲とターゲットを指定します。画像のローカル コンテンツをすばやく調整するのに適しています。
- ドラッグベースの編集: 画像内のキーポイントをドラッグして、オブジェクトの姿勢、形状、または位置の変化を制御します。映像の拡散により動作ルールをアプリオリに理解し、変形をより自然にすることができます。
- ドメイン外の一般化された編集: コア ハイライト - 事前にビデオ拡散を使用すると、トレーニング データでカバーされていない編集シナリオ (カクレクマノミをサメの形に変えるなど) においても、妥当な結果を生成できます。
- 一致注意メカニズム: 受容野を拡張し、編集画像とソース画像トークン間の密な対応を強化し、大幅な編集後のコンテンツの一貫性を確保します。
モデルとバージョンの進化
| バージョン | 日付 | 主な変更点 |
|---|---|---|
| v1.0 (ICCV 2025) | ~2025-01 | 完全な推論デモ、HuggingFace ウェイト、すべての編集モードをサポート |
| arXiv v1 | 2025-01-14 | 論文が初めて公開され (2501.08225)、技術ソリューションが公開されました。 |
技術的な利点
- 問題再構成パラダイム: インタラクティブな画像編集を「画像からビデオへの生成」問題として再定義します。安定したビデオ拡散の前のビデオ拡散を継承することにより、オブジェクトの動きの変化の法則を自然に理解し、トレーニング コストを大幅に削減できます。
- 軽量スパース コントロール エンコーダー: 編集信号を挿入するために軽量エンコーダーのみが導入されており、新しいパラメーターの量は最小限であり、トレーニングと推論は非常に効率的です。
- 注意の一致: 交差注意の検索範囲を拡大し、高密度の点ごとの対応を確立し、姿勢や形状が大きく変化した場合でもコンテンツの一貫性を維持します。
- マルチモーダル編集信号の統合: 同じアーキテクチャが、異なるモデルを個別にトレーニングする必要なく、スケッチ、クリック、ドラッグなどの複数の対話方法をサポートします。
使い方
| 入口 | インストール・使用方法 |
|---|---|
| GitHub ソース コード | git clone → conda create → pip install → ダウンロードweight → python app.py |
事前トレーニングされた重みを HuggingFace (Yabo/FramePainter) から Checkpoints/ ディレクトリにダウンロードします。推論中に、stabilityai/stable-video-diffusion-img2vid-xt-1-1 がベース モデルとして自動的にダウンロードされます。
製品の価格設定
| プロジェクト | コスト |
|---|---|
| ソフトウェアライセンス | 無料 (MIT ライセンス) |
| 事前にトレーニングされた重み | 無料(ハグフェイス) |
| 商用利用 | 許可 (MIT ライセンス) |
| クラウドサービス | 公式のクラウド サービスはないため、ローカルにデプロイする必要があります。 |
アプリケーションのシナリオ
- インタラクティブな画像デザインとクリエイティブ編集: デザイナーはスケッチを使用して、画像構成の調整、オブジェクトの置換、スタイルの変更を迅速に行うことができるため、従来のソフトウェアでの複雑なマスキングやレイヤー操作が不要になります。
- 広告およびマーケティングのビジュアル素材制作: マーケティング チームは、ドラッグ アンド ドロップやスケッチを通じて複数のバージョンの広告素材を迅速に生成し、要件から図面作成までのプロセスを数分に短縮します。
- 映画およびテレビのポストプロダクションおよびコンセプト デザイン: ドメイン外で一般化できる機能により、トレーニング データではカバーされないクリエイティブなシナリオで役割を果たすことができ、映画のストーリーボードやゲームのコンセプト デザインに適しています。
該当する人
- 個人ユーザー: AI 研究者および開発者。インタラクティブな画像編集研究のベースライン システムとして適した、完全なトレーニングおよび推論コードを提供します。
- SME チーム: デザイナーとクリエイティブ ワーカーは、ビジュアル ソリューションを迅速に反復する必要があります。
- 大企業: 適切ではありません - 商用グレードの UI/UX の洗練とカスタマー サービス サポートのない、純粋に学術的なプロジェクト。
- 不適合な境界: ピクセルレベルの正確な制御が必要な制作環境 (印刷仕上げなど)。高いリアルタイム パフォーマンスを必要とするバッチ処理シナリオ。 NVIDIA GPU を持たないユーザー。
競合製品の比較
| 寸法の比較 | フレームペインター | コントロールネット | ドラッグガン |
|---|---|---|---|
| 主要な違い | ビデオの普及以前、領域外の一般化 | 条件付き制御の生成 | ドラッグ アンド ドロップ編集 |
| 価格 | 無料 (MIT オープンソース) | 無料 (オープンソース) | 無料 (オープンソース) |
| 表紙シーン | インタラクティブな編集、クリエイティブなデザイン | 条件付き生成 | 姿勢編集 |
| ユーザー評価 | 強力な汎化能力 | 正確な制御 | 直感的なインタラクション |
| 技術的なしきい値 | 中 (GPU + インストールが必要) | 中 (GPU が必要) | 中 (GPU が必要) |
概要と展望
FramePainter は、「画像編集を画像からビデオへの生成に再構築する」というパラダイム イノベーションを中核とし、ビデオ拡散プリアを使用してインタラクティブな画像編集のトレーニング コストを大幅に削減します。ドメイン外で一般化できる機能がその重要なハイライトです。
調達/採用リスク評価: FramePainter は純粋に学術研究プロジェクトであり、商品化チームや企業レベルのサポートはありません。コードの更新とメンテナンスは元の作成者の個人的な時間に依存しており、SLA の義務はありません。運用プロジェクトでの使用のリスクを評価するか、サードパーティが商用化可能な製品/サービスにパッケージ化するのを待つことをお勧めします。 |---|---| |製品タイプ |スケッチベースの対話型画像編集ツール (学術オープンソース プロジェクト) | |プラットフォームのサポート |デスクトップ (Python/PyTorch) | |論文発表時間 | 2025 年 1 月 (arXiv)、ICCV 2025 に含まれる | |現在のバージョン | 1.0(ICCV2025対応版) | |ベーシックモデル|安定したビデオ拡散 (SVD) | |コアアーキテクチャ |スパース コントロール エンコーダー + マッチング アテンション | |入力方法 |画像 + スケッチ | |信号を編集する |描画、クリック、ドラッグなどの視覚的なインタラクティブな操作 | |ライセンス | MITライセンス | | GitHub スター | 406名(2026年7月現在) | |ハグ顔の重量 |ヤボ/フレームペインター |
FramePainter は、ハルビン工業大学 (HIT) とファーウェイのノアの方舟研究所が共同提案した ICCV 2025 に含まれる論文の正式な実装です。これは商用の SaaS 製品ではなく、オープンソースの学術研究プロジェクトです。インタラクティブな画像編集を「画像からビデオの生成」問題として再定義し、それによってビデオ拡散モデルの強力な時間的事前機能を継承します。重要な洞察は、ビデオ データには物理的な相互作用の下でオブジェクトが変化するプロセスが自然に含まれているということです。 2 つのフレーム間の「疑似ビデオ生成」として画像編集をモデル化すると、トレーニング コストを大幅に削減し、タイミングの一貫性を確保できます。
ユーザーと市場の認識
FramePainter は、学術コミュニティや AI 画像編集の分野で広く注目を集めています。
- 学術的評価: この論文は ICCV 2025 に受理され、インタラクティブな画像編集の方向で SOTA の主要な成果を達成しました。以前の方法と比較して、FramePainter は大幅に少ないトレーニング データでより優れた編集品質と一般化機能を実現します。
- オープンソース コミュニティ: GitHub は 406 個のスターを獲得し (2026 年 7 月現在)、完全な事前トレーニングされた重みが HuggingFace で提供されており、コミュニティ開発者は自由にダウンロードしてデプロイできます。
- メディア報道: Art Weekly や KDJingpai などの複数の AI ツール集約サイトに含まれ、報告されています。
- 技術的影響: 「画像編集を画像からビデオへの生成に再構築する」という提案された技術的アイデアは、その後のインタラクティブ編集研究に新しいパラダイム参照を提供します。
コストメリット
FramePainter は、使用コストがゼロの完全なオープン ソース プロジェクト (MIT ライセンス) です。
- ソフトウェア費用: サブスクリプション料金やライセンス料金は必要ありません。コードは GitHub から自由に複製され、事前トレーニングされた重みは HuggingFace から自由にダウンロードされます。
- ハードウェア コスト: 推論を実行するには、NVIDIA GPU (推奨ビデオ メモリ ≥ 8GB) を搭載したコンピューターが必要です。クラウド サービスの従量課金制の商用画像編集ツールと比較して、頻繁に使用すると、ローカル展開の限界コストはゼロに近づきます。
- トレーニング コスト: 論文では、以前に Stable Video Diffusion のビデオ拡散を使用していたことにより、FramePainter のトレーニング データ量と計算コストが、テキストから画像への拡散モデルに基づく以前の方法よりもはるかに低くなったと指摘しています。これが、その中核となるコスト上の利点の源です。
主な機能
- スケッチベースの編集: ユーザーが画像上にスケッチを描いて編集の意図 (オブジェクトの形状の変更、姿勢の調整、ローカル コンテンツの置き換えなど) を指定すると、FramePainter がスケッチのセマンティクスを自動的に理解し、編集指示に準拠した画像を生成します。スケッチの厚さ、位置、形状は編集結果に直接影響し、操作は直感的で正確なマスキングを必要としません。
- クリックベースの編集: クリック操作による編集領域とターゲットの指定をサポートし、画像のローカル コンテンツを迅速に調整するのに適しています。ポイント アンド クリック操作はスケッチよりも速く、単純な交換や修復のタスクに適しています。
- ドラッグベースの編集: ユーザーは画像内のキーポイントをドラッグして、オブジェクトの姿勢、形状、または位置の変化を制御します。 FramePainter はオプティカル フローに基づくドラッグ アンド ドロップ編集とは異なり、ビデオ拡散を通じてオブジェクトの動きのパターンをアプリオリに理解するため、生成される変形はより自然です。
- ドメイン外の一般化: これは FramePainter の核となるハイライトです。事前にビデオ拡散を使用することで、モデルはトレーニング データに現れていない編集シナリオでも妥当な結果を生成できます。例えば、カクレクマノミをサメの形に変えたり、カップに元々存在しなかった光の反射効果を加えるなど、従来の編集の枠を超えた創造性を発揮しています。
- 注意の一致: 大きな動きを処理する際の時間的注意の制限を考慮して、受容野を拡大し、編集画像とソース画像トークンの間の密な対応を強化し、内容と構造における編集結果の一貫性を確保するために、一致注意レイヤーが提案されています。
モデルとバージョンの進化
| バージョン | 時間 | 主要な変更点 |
|---|---|---|
| arXiv v1 | 2025-01-14 | 論文は初めて公開され (2501.08225)、技術計画、実験結果、コードの一部が公開されました。 |
| v1.0 (ICCV 2025) | ~2025-01 | 完全な推論デモがリリースされ、事前トレーニングされた重みが HuggingFace にアップロードされ、完全な編集プロセスをサポート |
この論文が 2025 年 1 月に初めて公開された後、完全な推論コードと事前トレーニングの重みが同月にリリースされました。 ICCV 2025 が正式に受け入れられた後は、新しいコード バージョンはリリースされません。現在のウェアハウスは、論文によって正式に実装された安定バージョンです。
技術的な利点
- 問題再構成パラダイム: FramePainter の中核となる技術革新は、インタラクティブな画像編集を「画像からビデオへの生成」問題として再定義することです。従来の方法では、編集を条件付きの画像生成タスクとみなします。これには、物理的なダイナミクスを学習するために大量のペアのトレーニング データと追加のリファレンス エンコーダーが必要です。 FramePainter は、Stable Video Diffusion より前の既存のビデオ拡散を継承することにより、動いているオブジェクトの変化するパターンを自然に理解し、トレーニング コストとペア データの量への依存を大幅に削減します。
- 軽量スパース コントロール エンコーダー: ControlNet のような U-Net エンコーダー全体を複製するのではなく、編集信号 (スケッチ、クリック、ドラッグなど) を挿入するために、軽量のスパース コントロール エンコーダーのみを導入します。これにより、モデルは SVD の基本機能を維持しながら、最小限の新しいパラメーターを追加し、トレーニングと推論をより効率的にすることができます。
- 注意の一致: 標準の時間的注意メカニズムでは、2 つのフレーム間の大きな動きを扱う場合、受容野が限られているため、一貫性のない編集が容易に発生する可能性があります。アテンションの一致では、クロスアテンションの検索範囲を拡大することで、編集画像とソース画像トークンの間に密なポイントごとの対応関係が確立され、オブジェクトのポーズや形状が大幅に変更された場合でもコンテンツの一貫性が維持されます。
- マルチモーダル編集信号の統合: 同じアーキテクチャが、スケッチ、クリック、ドラッグなどの複数のインタラクション方法を同時にサポートし、異なるインタラクション信号に対して異なるモデルをトレーニングする必要がなくなります。この統合されたフレームワークにより、さまざまな編集方法 (最初に輪郭をスケッチし、次にドラッグして位置を調整するなど) を組み合わせることが可能になります。
- ドメイン外の汎化能力: 以前のビデオ拡散に含まれる豊富な物理世界の知識のおかげで、FramePainter は、トレーニング データでカバーされていない編集シナリオ (魚をサメの形に変えるなど) においても視覚的に合理的な結果を生成できます。これは、以前は純粋な画像拡散モデルでは達成することが困難でした。
使い方
FramePainter はローカルで実行されるオープンソース プロジェクトであり、アカウント登録や有料サブスクリプションは必要ありません。
準備
「」バッシュ
リポジトリのクローンを作成する
git クローン https://github.com/YBYBZhang/FramePainter.git cd フレームペインタ
Conda コンテキストを作成する
conda create -n Framepainter python=3.10 conda はフレームペインターをアクティブ化します
依存関係をインストールする
pip install -r 要件.txt 「」
ダウンロード重量
HuggingFace から事前トレーニング済みの重みをダウンロードし、checkpoints/ ディレクトリに置きます。推論中に、「app.py」は自動的に「stabilityai/stable-video-diffusion-img2vid-xt-1-1」を基本モデルとしてダウンロードします。
推論を実行する
「」バッシュ pythonapp.py 「」
起動後、インタラクティブ インターフェイスで画像をアップロードし、スケッチを描き、編集効果をリアルタイムでプレビューできます。詳細な手順については、GitHub ウェアハウスの README および論文の原文を参照してください。
製品の価格設定
FramePainter は完全にオープン ソース (MIT ライセンス) であり、支払いはありません。
| プロジェクト | コスト |
|---|---|
| ソフトウェアライセンス | 無料 (MIT オープンソース) |
| 事前にトレーニングされた重み | 無料 (HuggingFace ダウンロード) |
| 商用利用 | 許可 (MIT ライセンス) |
| サブスクリプション/クラウドサービス | 公式のクラウド サービスがないため、ローカルに展開する必要があります。 |
ハードウェアに関しては、独自の NVIDIA GPU を持参する必要があります。オンラインで体験したい場合は、コミュニティが展開するサードパーティのデモ (非公式メンテナンス) に注目してください。
アプリケーションのシナリオ
- インタラクティブな画像デザインとクリエイティブ編集: デザイナーはスケッチを使用して、画像の構成を素早く調整し、オブジェクトを置き換え、スタイルを変更します。 FramePainter の直感的なスケッチ操作により、従来のソフトウェアに見られる複雑なマスキングやレイヤー操作が不要になり、クリエイティブな反復がより効率的になります。マッチング アテンション メカニズムにより、大規模な編集後でも画像コンテンツの一貫性が保たれます。
- 広告およびマーケティングのビジュアル素材の制作: マーケティング チームは、ドラッグ アンド ドロップによって複数のバージョンの広告素材を迅速に生成します (製品パッケージの置き換え、モデルの姿勢の調整、背景の変更など)。教師データが不要なため、完成した地図上で直接操作が可能となり、リクエストから地図作成までの時間が数分に短縮されます。
- 映画およびテレビのポストプロダクションおよびコンセプト デザイン: 映画およびテレビのポストプロダクション担当者は、コンセプト デザインの段階でレンズ エフェクトのプレビューを迅速に作成します。 FramePainter のドメイン外一般化機能により、トレーニング データではカバーされないクリエイティブなシナリオ (歴史的シーンに非現実的な要素を追加するなど) で役割を果たすことができ、映画のストーリーボードやゲームのコンセプト デザインに適しています。
- 学術研究とアルゴリズムの検証: ICCV 2025 論文の公式オープンソース実装として、FramePainter はコンピュータ ビジョン研究者に直接実行可能な対話型編集ベースライン システムを提供します。その後の研究では、それに基づいて改良や比較実験を行うことができます。
該当する人
- AI 画像編集の研究者および開発者: FramePainter は完全なトレーニングと推論コードを提供し、インタラクティブな画像編集研究のベースライン システムとして適しています。論文内の方法設計とアブレーション実験は、その後の改善のための明確な参考資料を提供します。
- プロのデザイナーおよびクリエイティブ ワーカー: 編集の精度をあまり要求せずに、ビジュアル ソリューションを迅速に反復する必要があるデザイナー。スケッチとドラッグのインタラクションは、従来のツールの正確なマスキング操作よりも高速かつ直接的なため、クリエイティブ段階でのコンセプトの検討に適しています。
- AI 絵画およびテクノロジ愛好家: 最新の ICCV 論文の結果を理解して使用したいと考えている AI 愛好家。ローカル デプロイメント プロセスは明確であり (Conda + pip + ウェイト ダウンロード)、NVIDIA GPU による SOTA インタラクティブ編集効果を体験できます。
- 群集には適していません: ピクセルレベルの正確な制御を必要とする制作状況 (印刷仕上げなど) は、拡散モデルに基づく編集ツールの使用には適していません。厳密なリアルタイム要件があるシナリオ (バッチ自動処理パイプラインなど) では、時間のかかる推論を考慮する必要があります。 NVIDIA GPU ハードウェアを持たないユーザーはローカルで実行できません。さらに、研究プロジェクトである FramePainter には、商用レベルの UI/UX の洗練やカスタマー サポートは付属していません。
概要と展望
「画像編集を画像からビデオへの生成に再構築する」というパラダイム革新を核として、FramePainter はインタラクティブな画像編集のトレーニング コストを大幅に削減する前に Stable Video Diffusion のビデオ拡散を活用し、スパース コントロール エンコーダとマッチング アテンション メカニズムを通じて高品質のマルチモーダル編集効果を実現します。そのドメイン外の一般化機能は、以前の方法と区別する重要なハイライトです。トレーニング データでカバーされていない編集シナリオでも、妥当な視覚的結果を生成できます。
不適合な境界: ピクセルレベルの正確な制御を必要とする運用シナリオ、高いリアルタイム要件を伴うバッチ処理シナリオ、および NVIDIA GPU を持たないユーザー グループ。 調達/採用のリスク: FramePainter は純粋に学術研究プロジェクトであり、商品化チームや企業レベルのサポートはありません。コードの更新とメンテナンスは元の作成者の個人的な時間に依存しており、SLA の義務はありません。運用プロジェクトでの使用リスクを評価するか、サードパーティが商用化可能な製品/サービスにパッケージ化するのを待つことをお勧めします。
関連ツール: midjourney、stable-diffusion
バージョン情報
- ICCV 2025 正式版 :ICCV 2025 には、対応するバージョンの論文が含まれており、スケッチベースのインタラクティブな画像編集をサポートし、Stable Video Diffusion と軽量のスパース コントロール エンコーダに基づいています。公式の正確な発売日はまだありません。
- arXiv プレプリント :この論文は最初に arXiv (2501.08225) で公開され、技術的解決策と実験結果が開示されました。
ユーザーレビュー