프레임페인터 무료

-

FramePainter는 ICCV 2025에 포함된 오픈 소스 이미지 편집 도구입니다. 사전 비디오 확산(Stable Video Diffusion)을 사용하여 스케치 기반 대화형 이미지 편집을 구현합니다. 사용자는 이미지에 스케치만 그리면 되며 AI는 편집 의도를 이해하고 전문가 수준의 효과를 생성할 수 있어 일반적인 편집 시나리오와 도메인 외부 일반화 시나리오 모두에서 잘 수행됩니다.

프레임페인터 제품 인터페이스

프레임페인터

핵심 매개변수 및 통계

프로젝트 사양
제품명 프레임페인터
카테고리 AI 시각디자인/이미지 편집
배송형태 데스크탑 도구(Python/PyTorch)
지원 플랫폼 데스크탑
지원되는 언어 zh-CN, en-US
대상 사용자 AI 연구자, 디자이너, 크리에이티브 작업자
사용자 규모 GitHub 406 Stars(학술 프로젝트)
가격 모델 무료(MIT 오픈 소스)

플랫폼 적용 범위 및 사용자 규모 데이터는 공식 실시간 페이지 및 타사 통계를 기반으로 합니다.

사용자 및 시장 인지도

FramePainter 논문은 ICCV 2025에 승인되었으며 대화형 이미지 편집 분야에서 선도적인 SOTA 결과를 달성했습니다. 이전 방법에 비해 FramePainter는 훨씬 적은 훈련 데이터로 더 나은 편집 품질과 일반화 기능을 달성합니다. GitHub의 406 Stars인 HuggingFace는 사전 훈련된 전체 가중치를 제공합니다. Art Weekly, KDJingpai 등 많은 AI 도구 집계 사이트에 포함되어 있습니다. "이미지 편집을 이미지-비디오 생성으로 재구성"이라는 제안된 기술 아이디어는 후속 대화형 편집 연구에 대한 새로운 패러다임 참조를 제공합니다.

비용 이점

비용 차원 설명
소프트웨어 라이센스 MIT 오픈 소스, 완전 무료
사전 훈련된 가중치 HuggingFace에서 무료 다운로드
상업적 이용 MIT 라이센스, 상업적 사용 허용
하드웨어 비용 자신만의 NVIDIA GPU를 가져와야 함(권장 ≥8GB 비디오 메모리)

논문에서는 Stable Video Diffusion의 비디오 확산을 사전에 사용했기 때문에 훈련 데이터 양과 계산 비용이 텍스트-이미지 확산 모델을 기반으로 한 이전 방법보다 훨씬 낮다는 점을 지적합니다.

주요 기능

  • 스케치 기반 편집: 사용자가 이미지에 스케치를 그려 편집 의도를 지정하면, AI가 자동으로 스케치의 의미를 이해하고 지시 사항에 맞는 이미지를 생성합니다. 스케치의 두께, 위치, 모양은 정밀한 마스킹 없이도 편집 결과에 직접적인 영향을 미칩니다.
  • 클릭 기반 편집: 클릭 작업을 통해 편집 영역과 대상을 지정하여 이미지의 로컬 내용을 빠르게 조정하는 데 적합합니다.
  • 드래그 기반 편집: 이미지의 주요 지점을 드래그하여 개체 자세, 모양 또는 위치의 변경을 제어합니다. 영상 확산을 통해 움직임의 규칙을 선험적으로 이해하고 변형을 보다 자연스럽게 만들 수 있습니다.
  • 도메인 외부 일반 편집: 핵심 하이라이트 - 사전 비디오 확산을 사용하면 훈련 데이터에서 다루지 않는 편집 시나리오(예: 흰동가리를 상어 모양으로 변경)에서 합리적인 결과를 생성할 수 있습니다.
  • 매칭 어텐션 메커니즘: 수용 영역을 확장하고 편집된 이미지와 원본 이미지 토큰 사이의 조밀한 대응성을 강화하여 실질적인 편집 후 콘텐츠 일관성을 보장합니다.

모델 및 버전의 진화

버전 날짜 주요 변경 사항
v1.0(ICCV 2025) ~2025-01 완전한 추론 데모인 HuggingFace 가중치는 모든 편집 모드를 지원합니다
arXiv v1 2025-01-14 논문 최초 공개(2501.08225) 및 기술 솔루션 공개

기술적인 장점

  • 문제 재구성 패러다임: 대화형 이미지 편집을 "이미지-비디오 생성" 문제로 재정의합니다. Stable Video Diffusion의 영상 확산 기술을 계승함으로써 물체의 움직임 법칙 변화를 자연스럽게 이해하고 훈련 비용을 획기적으로 절감할 수 있습니다.
  • 경량 스파스 제어 인코더: 편집 신호를 주입하기 위해 경량 인코더만 도입되었으며, 새로운 매개변수의 양이 최소화되고 훈련 및 추론이 매우 효율적입니다.
  • Matching Attention: 교차 어텐션 검색 범위를 확장하고, 촘촘한 포인트별 대응을 설정하며, 자세나 모양이 크게 바뀌더라도 콘텐츠 일관성을 유지합니다.
  • 다중 모드 편집 신호 통합: 동일한 아키텍처는 서로 다른 모델을 별도로 교육할 필요 없이 스케치, 클릭, 드래그 등 다양한 상호 작용 방법을 지원합니다.

사용방법

입구 설치/사용
GitHub 소스 코드 git clone → conda create → pip install → 다운로드 무게 → python app.py

HuggingFace(Yabo/FramePainter)에서 사전 훈련된 가중치를 checkpoints/ 디렉터리에 다운로드합니다. 추론 중에 Stabilityai/stable-video-diffusion-img2vid-xt-1-1이 자동으로 기본 모델로 다운로드됩니다.

제품 가격

프로젝트 비용
소프트웨어 라이센스 무료(MIT 라이센스)
사전 훈련된 가중치 무료(HuggingFace)
상업적 이용 허용됨(MIT 라이센스)
클라우드 서비스 공식 클라우드 서비스가 없으므로 로컬로 배포해야 함

애플리케이션 시나리오

  • 대화형 이미지 디자인 및 창의적 편집: 디자이너는 스케치를 사용하여 신속하게 이미지 구성을 조정하고, 개체를 교체하고, 스타일을 변경하므로 기존 소프트웨어의 복잡한 마스킹 및 레이어 작업이 필요하지 않습니다.
  • 광고 및 마케팅 시각 자료 제작: 마케팅 팀은 드래그 앤 드롭과 스케치를 통해 여러 버전의 광고 자료를 신속하게 생성하여 요구 사항에서 도면까지의 프로세스를 몇 분으로 단축합니다.
  • 영화 및 TV 후반 작업 및 컨셉 디자인: 도메인 외부에서 일반화할 수 있는 기능을 통해 훈련 데이터에서 다루지 않는 창의적인 시나리오에서 역할을 수행할 수 있어 영화 스토리보드 및 게임 컨셉 디자인에 적합합니다.

해당자

  • 개인 사용자: AI 연구원 및 개발자는 대화형 이미지 편집 연구를 위한 기본 시스템으로 적합한 완벽한 교육 및 추론 코드를 제공합니다.
  • SME 팀: 디자이너와 크리에이티브 작업자는 시각적 솔루션을 빠르게 반복해야 합니다.
  • 대기업: 적합하지 않음 - 상용 수준의 UI/UX 개선 및 고객 서비스 지원이 없는 순수 학술 프로젝트입니다.
  • 부적합한 경계: 픽셀 수준의 정밀한 제어(예: 인쇄 마감)가 필요한 제작 환경 높은 실시간 성능이 필요한 일괄 처리 시나리오 NVIDIA GPU가 없는 사용자.

경쟁제품 비교

차원 비교 프레임페인터 컨트롤넷 드래그GAN
핵심 차이점 영상확산 사전, 도메인 외 일반화 조건부 제어 생성 드래그 앤 드롭 편집
가격 무료(MIT 오픈 소스) 무료(오픈 소스) 무료(오픈 소스)
표지 장면 인터랙티브 편집, 창의적인 디자인 조건부 생성 자세 편집
사용자 평가 강력한 일반화 능력 정밀한 제어 직관적인 상호작용
기술적 한계점 중간(GPU + 설치 필요) 중간(GPU 필요) 중간(GPU 필요)

요약 및 전망

FramePainter는 "이미지 편집을 이미지-비디오 생성으로 재구성"하는 패러다임 혁신을 핵심으로 삼고 비디오 확산 사전을 사용하여 대화형 이미지 편집의 교육 비용을 크게 줄입니다. 도메인 외부를 일반화하는 능력이 주요 특징입니다.

조달/채택 위험 평가: FramePainter는 상용화 팀이나 기업 수준의 지원이 없는 순수 학술 연구 프로젝트입니다. 코드 업데이트 및 유지 관리는 원 작성자의 개인 시간에 의존하며 SLA 약정은 ​​없습니다. 생산 프로젝트에서 사용에 따른 위험을 평가하거나 제3자가 이를 상용화 가능한 제품/서비스로 패키징할 때까지 기다리는 것이 좋습니다. |---|---| | 제품 유형 | 스케치 기반 인터랙티브 이미지 편집 도구(학술 오픈소스 프로젝트) | | 플랫폼 지원 | 데스크탑(Python/PyTorch) | | 논문발간 시기 | 2025년 1월(arXiv), ICCV 2025에 포함됨 | | 현재 버전 | 1.0(ICCV 2025 대응 버전) | | 기본 모델 | 안정적인 비디오 확산(SVD) | | 핵심 아키텍처 | 희소 제어 인코더 + 매칭 어텐션 | | 입력방법 | 이미지 + 스케치 | | 신호 편집 | 그리기, 클릭, 끌기 및 기타 시각적 대화형 작업 | | 라이센스 | MIT 라이센스 | | GitHub 스타 | 406명(2026년 7월 기준) | | 포옹얼굴 무게 | 야보/프레임페인터 |

FramePainter는 Harbin Institute of Technology(HIT)와 Huawei의 Noah's Ark Laboratory가 공동으로 제안한 ICCV 2025에 포함된 논문의 공식 구현입니다. 이는 상용 SaaS 제품이 아니라 오픈 소스 학술 연구 프로젝트입니다. 대화형 이미지 편집을 "이미지에서 비디오 생성" 문제로 재정의하여 비디오 확산 모델의 강력한 시간적 사전 기능을 계승합니다. 핵심 통찰은 비디오 데이터가 물리적 상호작용을 통해 사물이 변화하는 과정을 자연스럽게 담고 있다는 점입니다. 두 프레임 간의 "의사 비디오 생성"으로 이미지 편집을 모델링하면 교육 비용을 크게 줄이고 타이밍 일관성을 보장할 수 있습니다.

사용자 및 시장 인지도

FramePainter는 학계와 AI 이미지 편집 분야에서 광범위한 주목을 받았습니다.

  • 학술적 인정: 해당 논문은 ICCV 2025에 승인되었으며 대화형 이미지 편집 분야에서 선도적인 SOTA 결과를 달성했습니다. 이전 방법에 비해 FramePainter는 훨씬 적은 훈련 데이터로 더 나은 편집 품질과 일반화 기능을 달성합니다.
  • 오픈 소스 커뮤니티: GitHub는 406개의 별을 받았습니다(2026년 7월 기준). 사전 학습된 전체 가중치는 HuggingFace에서 제공되며 커뮤니티 개발자는 자유롭게 다운로드하고 배포할 수 있습니다.
  • 미디어 보도: Art Weekly, KDJingpai 등 여러 AI 도구 집계 사이트에 포함 및 보도되었습니다.
  • 기술적 영향: "이미지 편집을 이미지-비디오 생성으로 재구성"이라는 제안된 기술 아이디어는 후속 대화형 편집 연구에 대한 새로운 패러다임 참조를 제공합니다.

비용 이점

FramePainter는 사용 비용이 전혀 들지 않는 완전한 오픈 소스 프로젝트(MIT 라이선스)입니다.

  • 소프트웨어 비용: 가입비나 라이선스 비용이 필요하지 않습니다. 코드는 GitHub에서 자유롭게 복제되며 사전 훈련된 가중치는 HuggingFace에서 무료로 다운로드됩니다.
  • 하드웨어 비용: 추론을 실행하려면 NVIDIA GPU(권장 비디오 메모리 ≥ 8GB)가 장착된 컴퓨터가 필요합니다. 클라우드 서비스 종량제 상용 이미지 편집 도구와 비교할 때, 많이 사용하면 로컬 배포의 한계 비용이 0에 가까워집니다.
  • 훈련 비용: 논문에서는 Stable Video Diffusion의 비디오 확산 이전 사용으로 인해 FramePainter의 훈련 데이터 양과 계산 비용이 텍스트-이미지 확산 모델을 기반으로 한 이전 방법보다 훨씬 낮다고 지적합니다. 이것이 핵심 비용 이점의 원천입니다.

주요 기능

  • 스케치 기반 편집: 사용자가 이미지에 스케치를 그려서 편집 의도(예: 개체의 모양 변경, 자세 조정, 로컬 콘텐츠 교체 등)를 지정하면 FramePainter가 자동으로 스케치의 의미를 이해하고 편집 지침에 맞는 이미지를 생성합니다. 스케치의 두께, 위치, 모양이 편집 결과에 직접적인 영향을 미치며 상호 작용이 직관적이고 정밀한 마스킹이 필요하지 않습니다.
  • 클릭 기반 편집: 클릭 작업을 통해 편집 영역 및 대상 지정을 지원하므로 이미지의 로컬 내용을 빠르게 조정하는 데 적합합니다. 포인트 앤 클릭 작업은 스케치보다 빠르며 간단한 교체 및 수리 작업에 적합합니다.
  • 드래그 기반 편집: 사용자는 이미지의 주요 지점을 드래그하여 개체 자세, 모양 또는 위치의 변경을 제어합니다. FramePainter는 광학적 흐름을 기반으로 한 드래그 앤 드롭 편집과 달리 영상 확산을 통해 객체의 움직임 패턴을 선험적으로 이해하고 생성된 변형이 더 자연스럽습니다.
  • 도메인 외부 일반화: 이는 FramePainter의 핵심 하이라이트입니다. 사전 비디오 확산을 사용하면 모델은 훈련 데이터에 나타나지 않은 편집 시나리오에서 여전히 합리적인 결과를 생성할 수 있습니다. 예를 들어 흰동가리를 상어 모양으로 바꾸는 것, 원래 존재하지 않았던 반사광 효과를 컵에 추가하는 것 등은 기존 편집의 경계를 뛰어넘는 창의성을 보여줍니다.
  • Matching Attention: 큰 움직임을 처리할 때 시간적 주의가 제한된다는 점을 고려하여, 수용 영역을 확장하고 편집된 이미지와 원본 이미지 토큰 사이의 조밀한 일치성을 강화하여 내용과 구조에서 편집 결과의 일관성을 보장하기 위해 일치하는 주의 레이어가 제안됩니다.

모델 및 버전의 진화

버전 시간 핵심 변경 사항
arXiv v1 2025-01-14 논문이 처음으로 공개(2501.08225)되어 기술 계획, 실험 결과 및 코드 일부가 공개되었습니다
v1.0(ICCV 2025) ~2025-01 완전한 추론 데모 출시, 사전 훈련된 가중치가 HuggingFace에 업로드되어 완전한 편집 프로세스 지원

2025년 1월 논문이 처음 공개된 후 같은 달 완전한 추론 코드와 사전 훈련 가중치가 공개되었습니다. ICCV 2025가 공식적으로 승인된 후에는 새로운 코드 버전이 출시되지 않습니다. 현재 웨어하우스는 논문에서 공식적으로 구현한 안정적인 버전입니다.

기술적인 장점

  • 문제 재구성 패러다임: FramePainter의 핵심 기술 혁신은 대화형 이미지 편집을 "이미지-비디오 생성" 문제로 재정의하는 것입니다. 전통적인 방법에서는 편집을 조건부 이미지 생성 작업으로 간주합니다. 이 작업에는 물리적 역학을 학습하기 위해 대량의 훈련 데이터와 추가 참조 인코더가 필요합니다. FramePainter는 Stable Video Diffusion의 기존 비디오 확산 방식을 계승하여 움직이는 물체의 변화하는 패턴을 자연스럽게 이해하여 훈련 비용과 페어링된 데이터 양에 대한 의존도를 크게 줄입니다.
  • 경량 스파스 제어 인코더: ControlNet처럼 전체 U-Net 인코더를 복제하는 대신 편집 신호(스케치, 클릭, 드래그 등)를 주입하기 위해 경량 스파스 제어 인코더만 도입합니다. 이를 통해 모델은 SVD의 기본 기능을 유지하면서 최소한의 새로운 매개변수를 추가하고 훈련 및 추론을 보다 효율적으로 수행할 수 있습니다.
  • 일치하는 주의: 표준 시간 주의 메커니즘은 두 프레임 사이의 큰 움직임을 처리할 때 수용 필드가 제한되어 있어 일관성 없는 편집이 쉽게 발생할 수 있습니다. 매칭 어텐션(Matching attention)은 교차 어텐션(cross-attention)의 검색 범위를 확장하여 편집된 이미지와 원본 이미지 토큰 사이의 조밀한 점별 대응을 설정하고 객체의 자세나 모양이 급격하게 변경되는 경우에도 콘텐츠 일관성을 유지합니다.
  • 다중 모드 편집 신호 통합: 동일한 아키텍처는 스케치, 클릭, 드래그 등의 여러 상호 작용 방법을 동시에 지원하므로 서로 다른 상호 작용 신호에 대해 서로 다른 모델을 훈련할 필요가 없습니다. 이 통합 프레임워크를 사용하면 다양한 편집 방법(예: 윤곽선을 먼저 스케치한 다음 드래그하여 위치 조정)을 결합할 수 있습니다.
  • 도메인 외부 일반화 능력: 이전 비디오 확산에 포함된 풍부한 물리적 세계 지식 덕분에 FramePainter는 훈련 데이터에서 다루지 않은 편집 시나리오(예: 물고기를 상어 모양으로 바꾸는 등)에서 시각적으로 합리적인 결과를 생성할 수 있습니다. 이는 이전에 순수 이미지 확산 모델로는 달성하기 어려웠습니다.

사용방법

FramePainter는 로컬에서 실행되는 오픈 소스 프로젝트이며 계정 등록이나 유료 구독이 필요하지 않습니다.

준비

``배쉬

저장소 복제

자식 클론 https://github.com/YBYBZhang/FramePainter.git CD 프레임페인터

콘다 컨텍스트 생성

conda create -n 프레임페인터 python=3.10 콘다는 프레임페인터를 활성화합니다

종속성 설치

pip 설치 -r 요구사항.txt


### 무게 다운로드

[HuggingFace](https://huggingface.co/Yabo/FramePainter)에서 사전 훈련된 가중치를 다운로드하여 `checkpoints/` 디렉터리에 넣습니다. 추론 중에 'app.py'는 기본 모델로 'stabilityai/stable-video-diffusion-img2vid-xt-1-1'을 자동으로 다운로드합니다.

### 추론 실행

``배쉬
pythonapp.py

시작 후 대화형 인터페이스에서 실시간으로 이미지를 업로드하고, 스케치를 그리고, 편집 효과를 미리 볼 수 있습니다. 자세한 지침은 GitHub 창고 README와 논문 원본을 참조하세요.

제품 가격

FramePainter는 완전 오픈 소스(MIT 라이선스)이며 결제 없음입니다.

프로젝트 비용
소프트웨어 라이센스 무료(MIT 오픈 소스)
사전 훈련된 가중치 무료(HuggingFace 다운로드)
상업적 사용 허용됨(MIT 라이센스)
구독/클라우드 서비스 공식 클라우드 서비스가 없으므로 로컬로 배포해야 함

하드웨어 측면에서는 자체 NVIDIA GPU를 가져와야 합니다. 온라인으로 경험하고 싶다면 커뮤니티에서 배포한 타사 데모(비공식 유지 관리)에 주목할 수 있습니다.

애플리케이션 시나리오

  • 대화형 이미지 디자인 및 창의적인 편집: 디자이너는 스케치를 사용하여 신속하게 이미지 구성을 조정하고, 개체를 교체하고, 스타일을 변경합니다. FramePainter의 직관적인 스케치 상호 작용은 기존 소프트웨어에서 발견되는 복잡한 마스킹 및 레이어 조작을 제거하여 창의적인 반복 작업을 보다 효율적으로 만듭니다. 매칭 어텐션 메커니즘은 광범위한 편집 후에도 이미지 콘텐츠의 일관성을 유지합니다.
  • 광고 및 마케팅 시각 자료 제작: 마케팅 팀은 드래그 앤 드롭(제품 포장 교체, 모델 자세 조정, 배경 변경 등)을 통해 여러 버전의 광고 자료를 빠르게 생성합니다. 학습 데이터가 필요하지 않기 때문에 완성된 지도에서 직접 조작이 가능하며, 요청부터 지도 제작까지의 시간이 분 단위로 단축됩니다.
  • 영화 및 TV 후반 제작 및 컨셉 디자인: 영화 및 TV 후반 제작 담당자는 컨셉 디자인 단계에서 렌즈 효과 미리보기를 신속하게 생성합니다. FramePainter의 도메인 외부 일반화 기능을 사용하면 훈련 데이터에서 다루지 않는 창의적인 시나리오(예: 역사적 장면에 비현실적인 요소 추가)에서 역할을 수행할 수 있으므로 영화 스토리보드 및 게임 컨셉 디자인에 적합합니다.
  • 학술 연구 및 알고리즘 검증: ICCV 2025 논문의 공식 오픈 소스 구현인 FramePainter는 컴퓨터 비전 연구자들에게 직접 실행 가능한 대화형 편집 기준 시스템을 제공합니다. 후속 연구는 이를 바탕으로 개선과 비교 실험을 수행할 수 있습니다.

해당자

  • AI 이미지 편집 연구원 및 개발자: FramePainter는 완전한 교육 및 추론 코드를 제공하며 대화형 이미지 편집 연구를 위한 기본 시스템으로 적합합니다. 논문의 방법 설계 및 절제 실험은 후속 개선을 위한 명확한 참고 자료를 제공합니다.
  • 전문 디자이너 및 크리에이티브 작업자: 편집 정확성을 지나치게 요구하지 않고 시각적 솔루션을 빠르게 반복해야 하는 디자이너. 스케치 및 드래그 상호 작용은 기존 도구의 정확한 마스킹 작업보다 빠르고 직접적이므로 창의적인 단계의 개념 탐색에 적합합니다.
  • AI 페인팅 및 기술 매니아: 최신 ICCV 논문 결과를 이해하고 활용하고자 하는 AI 매니아입니다. 로컬 배포 프로세스가 명확하며(Conda + pip + 가중치 다운로드) NVIDIA GPU를 사용하여 SOTA 대화형 편집 효과를 경험할 수 있습니다.
  • 군중에게 적합하지 않음: 픽셀 수준의 정밀한 제어(예: 인쇄 마무리)가 필요한 제작 상황은 확산 모델 기반 편집 도구를 사용하기에 적합하지 않습니다. 엄격한 실시간 요구 사항(예: 일괄 자동화 처리 파이프라인)이 있는 시나리오에서는 시간이 많이 걸리는 추론을 고려해야 합니다. NVIDIA GPU 하드웨어가 없는 사용자는 로컬로 실행할 수 없습니다. 또한 연구 프로젝트로서 FramePainter에는 상용 수준의 UI/UX 개선 및 고객 지원이 제공되지 않습니다.

요약 및 전망

"이미지 편집을 이미지-비디오 생성으로 재구성"하는 패러다임 혁신을 핵심으로 하는 FramePainter는 Stable Video Diffusion의 비디오 확산을 활용하여 대화형 이미지 편집의 교육 비용을 크게 줄이고 희소 제어 인코더 및 매칭 어텐션 메커니즘을 통해 고품질 다중 모드 편집 효과를 달성합니다. 도메인 외부 일반화 기능은 이전 방법과 구별되는 주요 특징입니다. 훈련 데이터에서 다루지 않는 편집 시나리오에서도 여전히 합리적인 시각적 결과를 생성할 수 있습니다.

부적합한 경계: 픽셀 수준의 정밀한 제어가 필요한 프로덕션 시나리오, 실시간 요구 사항이 높은 일괄 처리 시나리오, NVIDIA GPU가 없는 사용자 그룹. 조달/채택 위험: FramePainter는 상용화 팀이나 기업 수준의 지원이 없는 순수 학술 연구 프로젝트입니다. 코드 업데이트 및 유지 관리는 원 작성자의 개인 시간에 의존하며 SLA 약속은 없습니다. 생산 프로젝트에서 사용 위험을 평가하거나 제3자가 이를 상용화 가능한 제품/서비스로 패키징할 때까지 기다리는 것이 좋습니다.

관련 도구: midjourney, stable-diffusion

버전 정보

  • ICCV 2025 공식 버전 :ICCV 2025는 해당 버전의 논문을 포함하고, 스케치 기반 대화형 이미지 편집을 지원하며, Stable Video Diffusion 및 경량 스파스 제어 인코더를 기반으로 합니다. 아직 공식적인 정확한 출시일은 없습니다.
  • arXiv 사전 인쇄 :해당 논문은 arXiv(2501.08225)에 처음 게재되었으며, 기술적 솔루션과 실험 결과를 공개했습니다.

사용자 후기

  • 후기를 불러오는 중...