플로우디렉터
무료
FlowDirector는 Westlake University AGI Lab과 Central South University에서 출시한 교육이 필요 없는 비디오 편집 프레임워크입니다. 이는 상미분 방정식(ODE) 기반 편집 흐름 생성 기술을 기반으로 하며 공간 주의 흐름 수정(SAFC) 및 미분 평균 안내(DAG) 메커니즘을 결합하여 고정밀 의미 수준의 비디오 콘텐츠 편집을 달성합니다. 객체 교체, 텍스처 변환, 속성 수정 등의 작업을 지원하며, 별도의 학습 없이 사전 학습된 T2V 모델을 이용하여 편집이 가능합니다.
플로우디렉터
핵심 매개변수 및 통계
| 프로젝트 | 정보 |
|---|---|
| 도구 이름 | 플로우디렉터 |
| 개발팀 | Westlake University AGI 연구소 / Central South University |
| 코어입구 | GitHub: github.com/Westlake-AGI-Lab/FlowDirector |
| 배송형태 | 오픈소스 연구 프레임워크(Python) |
| 핵심기술 | ODE 기반 편집 흐름(Editing Flow), SAFC, DAG |
| 라이센스 | 오픈 소스(특정 라이선스는 GitHub 저장소 참조) |
| 필수 사전 학습 모델 | 주류 T2V(텍스트-비디오) 모델과 호환 가능 |
| 유형 편집 | 객체 교체, 텍스처 변환, 속성 수정, 객체 추가/삭제 |
FlowDirector의 핵심 기여는 비디오 편집의 두 가지 오랜 문제점인 타이밍 불일치와 구조적 왜곡을 해결하는 것입니다. 기존 방법은 잠재 공간 반전(Latent Space Inversion)에 의존하는데, 이는 비디오를 잠재 공간으로 인코딩한 다음 디코딩하는 과정에서 타이밍 깜박임과 콘텐츠 왜곡이 발생하기 쉽습니다. FlowDirector는 편집 프로세스를 데이터 공간에서 직접 모델링하고 ODE 기반의 원활한 전환 경로를 사용하여 역 매핑으로 인한 정보 손실을 방지합니다.
사용자 및 시장 인지도
- 학술적 영향: 이 논문은 Westlake University AGI Lab과 Central South University가 공동으로 제작한 arXiv(2506.05046)에 게재되었습니다. 여러 비디오 편집 벤치마크 테스트에서 FlowDirector는 지침 따르기, 시간적 일관성 및 배경 보존이라는 세 가지 주요 지표에서 뛰어난 성능을 보였습니다.
- 오픈 소스 생태계: 코드는 GitHub에서 오픈 소스로 공개되었으며, 커뮤니티 개발자는 실험, 2차 개발을 재현하고 자체 데이터 세트에 대한 효과를 확인할 수 있습니다. 오픈 소스는 기술 검증의 임계값을 낮추고, 다른 연구팀은 기준 비교를 위해 FlowDirector의 결과를 직접 사용할 수 있습니다.
- 유사한 프레임워크와의 비교: InstructVideo, Video-P2P, TokenFlow 등 기존 비디오 편집 방법과 비교할 때 FlowDirector의 핵심 장점은 교육이 필요 없음(각 비디오에 대해 모델을 미세 조정할 필요가 없음)과 구조 보존(ODE 흐름이 역 매핑보다 자연스럽게 더 안정적임)입니다. 단점은 현재 연구 프로토타입에 더 중점을 두고 있으며 기본 제품 수준 도구와는 여전히 거리가 멀다는 것입니다.
비용 이점
- 완전한 오픈 소스 및 무료: API 호출 비용 없이 GitHub에서 코드 및 모델 가중치를 사용할 수 있습니다. 필요한 컴퓨팅 리소스는 실행 중인 장치의 GPU 사양에 따라 달라집니다. 즉, 메모리가 클수록 처리할 수 있는 해상도와 프레임 속도가 높아집니다.
- 비교 참고: 상용 영상 편집 도구(예: Runway Gen-2, Pika Labs, Topaz Video AI)는 초 또는 월 단위로 요금이 청구되며, 30초 편집 작업 비용은 몇 위안에서 수십 위안까지 다양합니다. FlowDirector는 직접적인 사용 비용이 없지만 GPU 컴퓨팅 성능 오버헤드를 부담해야 합니다. 이미 GPU 장치(RTX 4090 이상)가 있는 경우 단일 편집을 실행하는 데 드는 전기 비용은 무시할 수 있습니다. 클라우드 GPU 임대(AutoDL 및 기타 플랫폼)에 의존하는 경우 단일 편집 비용은 시간당 약 몇 위안입니다.
- 비용에 민감하지만 GPU 리소스가 있는 팀이나 일괄 편집 시나리오에서 한계 비용을 제어해야 하는 사용자에게 적합합니다.
주요 기능
- 정확한 의미 편집: 자연어 지침을 기반으로 비디오 콘텐츠를 의미 수준에서 수정합니다. 예를 들어, 동영상의 "곰"을 "공룡"으로 바꾸거나 "낮"을 "밤"으로 변경하세요. 편집 프로세스에는 수동 키프레임 주석이나 프레임별 처리가 필요하지 않습니다.
- 공간적 및 시간적 일관성 보호: 편집 과정에서 비디오의 시간적 일관성과 공간 구조 무결성을 유지합니다. 이것이 FlowDirector의 핵심 경쟁력입니다. 다른 방법은 긴 비디오 편집 시 화면 깜박임이나 콘텐츠 정렬 불량이 발생하기 쉽습니다. FlowDirector는 ODE 스트리밍을 통해 이 문제를 어느 정도 완화합니다.
- 로컬 편집 및 전역 보호: SAFC(Spatial Attention Flow Correction) 메커니즘을 기반으로 편집 명령과 관련된 대상 영역만 작동하고, 대상이 아닌 영역의 원본 콘텐츠 및 동작 상태는 고정됩니다. AI에게 추측을 맡기는 것이 아니라, 사용자가 "변경할 부분"과 "변경하지 않을 부분"을 정확하게 제어할 수 있습니다.
- 교육 없는 편집: 추가 모델 교육이나 각 비디오 또는 각 편집 작업에 대한 미세 조정 없이 사전 교육된 T2V(텍스트-비디오) 모델을 직접 사용합니다. 새 비디오를 처리하려면 한 번의 정방향 패스만 필요하며, 비디오별로 미세 조정이 필요한 방법보다 시간과 컴퓨팅 성능 비용이 훨씬 낮습니다.
- 다양한 유형의 편집 지원: 오브젝트 교체(자동차→드래곤), 텍스처 변환(가죽→메탈릭), 로컬 속성 수정(머리 색깔 변경), 오브젝트 추가/삭제(모자 추가, 사람 제거) 등 다양한 편집 작업을 지원합니다.
모델 및 버전의 진화
- arXiv 논문 발표(2025년 6월): 편집 흐름 생성, SAFC 및 DAG라는 세 가지 핵심 혁신을 포함하는 FlowDirector 기술 솔루션이 처음으로 공개되었습니다. 여러 벤치마크에 대한 평가 데이터를 게시했습니다.
- GitHub 오픈 소스: 추론 코드, 샘플 스크립트 및 사전 훈련 가중치 호출 인터페이스를 포함하여 오픈 소스 코드 저장소가 논문과 동기화됩니다.
- 현재 버전은 연구 프로토타입 단계로 상용화 로드맵은 없습니다. 후속 반복 방향에는 더 높은 해상도 지원(현재 GPU 메모리로 제한됨), 더 많은 T2V 모델 기반 통합, 컴퓨팅 리소스 요구 사항 감소 등이 포함될 수 있습니다.
기술적인 장점
- 데이터 공간 편집 흐름: 잠재 공간 역 매핑에 의존하지 않고 원본 픽셀 공간에서 원본 비디오와 대상 비디오 간의 속도 필드 차이를 직접 계산하여 원활한 편집 경로를 생성합니다. 이는 역 매핑 방법의 일반적인 구조적 왜곡을 근본적으로 방지합니다. 예를 들어 전자는 원본 이미지에서 직접 수정되고 후자는 썸네일로 압축된 다음 압축을 풀고 다시 수정됩니다. 정보 손실의 차이가 결정적입니다.
- SAFC(공간 주의 흐름 보정): 편집 작업과 관련된 주의 지도를 추출하고 정확한 공간 마스크를 생성합니다. ODE 기반 편집 프로세스 중에 마스크가 속도 필드에 중첩되어 대상이 아닌 영역의 속도 필드 구성 요소를 동결하고 배경 및 관련 없는 영역의 원래 상태를 보호합니다. SAFC에 대한 직관적인 이해: 모델은 주의를 집중할 위치를 알고 있으며 "초점" 영역만 변경합니다.
- DAG(Differential Average Guidance): Classifier-Free Guidance에서 영감을 받아 여러 후보 편집 스트림을 생성하고 이들 간의 차이 신호를 계산하며, 차이 신호를 사용하여 의미 정렬의 정확성을 향상시킵니다. 설명: 단일 편집 결과를 신뢰하는 것보다 여러 후보 솔루션 중에서 "합의 방향"을 찾아 무작위 편견을 줄이는 것이 좋습니다.
사용방법
FlowDirector의 사용은 연구 및 기술 검증에 편향되어 있으며 웹 응용 프로그램에 패키지되어 있지 않습니다.
코드 받기:
자식 클론 https://github.com/Westlake-AGI-Lab/FlowDirector.git
환경에 따라 다름: -파이썬 3.8+
- PyTorch(2.0 이상 권장)
- CUDA(11.8 이상 권장)
- 사전 훈련된 T2V 모델 가중치
일반적인 단계:
- Python 환경을 구성하고 웨어하우스 README에 따라 종속성을 설치합니다.
- 호환 가능한 사전 훈련된 T2V 모델 체크포인트를 다운로드합니다.
- 영상 입력 및 안내 문구 편집을 준비합니다.
- 편집 스크립트 실행: 입력 비디오 경로, 편집 프롬프트, 출력 경로 및 매개변수 구성을 지정합니다.
- 추론이 완료될 때까지 기다리고 출력 디렉터리에서 편집 결과를 확인합니다.
기술적 임계값 설명: FlowDirector는 현재 딥 러닝 배경이 있는 연구원과 엔지니어를 대상으로 합니다. 실용적으로 만들어야 한다면 Streamlit 또는 Gradio 웹 인터페이스로 캡슐화하거나 ComfyUI 노드 생태계에 통합하는 것을 고려할 수 있습니다.
제품 가격
| 프로젝트 | 설명 |
|---|---|
| 소프트웨어 라이센스 | 완전 오픈 소스 및 무료 |
| 컴퓨팅 자원 | 자체 GPU를 가져와야 함(RTX 4090 이상 권장) |
| 클라우드 GPU 솔루션 | 임대 비용은 시간당 2~8위안 정도이며(인스턴스 사양에 따라 다름), 한 번의 편집에 몇 분에서 수십 분이 소요됩니다 |
| 상업용 라이센스 | GitHub 저장소의 특정 오픈 소스 라이선스 조건을 확인하세요 |
상업용 비디오 편집 API(예: Runway의 초당 청구)와 비교할 때 FlowDirector는 일괄 및 고주파수 편집 시나리오에서 한계 비용 이점을 가지고 있습니다. 즉, 컴퓨팅 성능에 대한 고정 투자 후에는 추가 편집에 대한 증분 비용이 0에 가까워집니다.
애플리케이션 시나리오
- 비디오 특수 효과 제작: 텍스트 명령을 사용하여 비디오의 일반 개체를 특수 효과 요소로 대체합니다. 영화 및 TV 산업의 초기 개념 증명 단계에서 FlowDirector를 사용하면 특수 효과 아티스트가 샘플의 각 버전에 대해 많은 시간을 소비하지 않고도 편집 효과를 평가하기 위한 샘플을 신속하게 생성할 수 있습니다.
- 광고 동영상의 빠른 반복: 카피라이팅 변경에 따라 동영상 콘텐츠를 빠르게 조정합니다. 제품 외관을 교체하고 배경 컨텍스트를 변경합니다. 광고 대행사는 여러 편집 계획의 비교 샘플을 동시에 실행하고 최상의 계획을 선택한 다음 정밀한 제작 단계에 들어갈 수 있습니다.
- 애니메이션 및 게임 자료: 애니메이션 단편 영화의 캐릭터 외모나 장면 스타일을 빠르게 수정하여 프레임별로 수동으로 조정해야 하는 작업량을 줄입니다. 초기 프로토타이핑 단계에서 시각적 솔루션을 신속하게 검증하려는 독립 애니메이터 및 소규모 게임 스튜디오에 적합합니다.
- 단편 영상 콘텐츠 제작: 콘텐츠 제작자는 기존 영상 자료에 창의적인 2차 편집을 하여 평범한 풍경을 사이버펑크 스타일로 바꾸고, 실제 영상에 판타지 요소를 더합니다. 편집에는 몇 분에서 10분이 소요되는데, 이는 기존의 프레임별 처리보다 1~2배 더 빠릅니다.
- 맞춤형 비디오 편집: 개인 사용자는 자신의 창의적인 아이디어에 따라 애완동물 비디오 및 여행 단편 영화의 요소를 수정하여 더욱 흥미롭게 만들 수 있습니다. GPU 장치 지원이 필요하지만 편집 과정에는 전문 기술이 필요하지 않습니다.
해당자
- AI 연구원 및 컴퓨터 비전 엔지니어: FlowDirector의 대상 사용자 그룹입니다. 논문의 결과를 재현하고, 소스 코드를 기반으로 알고리즘을 개선하고, 자신의 데이터 세트에 대한 편집 효과를 확인할 수 있습니다.
- 영화 및 TV 후반 작업 특수 효과 아티스트: AI 비디오 편집 기술에 관심이 있고 이를 워크플로우에 통합하려는 기술 특수 효과 담당자입니다. 이를 구성하고 사용하려면 특정 Python 기반이 필요하지만 편집 효과는 초기 창의적인 제안에 통합될 수 있습니다.
- AI 콘텐츠 제작자 및 독립 개발자: GPU 리소스를 보유하고 있으며 최첨단 영상 편집 기술을 사용해 볼 의향이 있는 사람들입니다. FlowerDirector의 편집 품질은 훈련이 필요 없는 동등한 방법 중에서 최고 수준이며 일괄 비디오 처리 파이프라인의 기본 구성 요소로 적합합니다.
경계는 적용할 수 없습니다:
- 실시간 또는 거의 실시간 처리 속도가 필요한 시나리오 - FlowDirector 추론은 몇 분 정도 걸리며 라이브 방송이나 실시간 편집에는 적합하지 않습니다.
- 4K 이상의 화질에는 극단적인 요구 사항이 있습니다. 현재 GPU 메모리로 인해 출력 해상도가 제한됩니다.
- 비기술적인 사용자 - 현재 웹 제품으로 패키징되어 있지 않으며, 명령줄 작업 및 Python 경계 구성에 대한 임계값이 높습니다.
- 출력 결과의 상업적 저작권에 대해 엄격한 요구 사항이 있는 프로젝트 - AI 생성/편집 콘텐츠의 저작권 소유권은 여전히 법적 회색 영역입니다.
요약 및 전망
FlowDirector는 비디오 편집 분야에서 간단하고 효과적인 기술 솔루션을 제안합니다. 데이터 공간 ODE 흐름을 사용하여 잠재 공간 역 매핑을 대체하여 아키텍처 수준의 타이밍 불일치 및 구조적 왜곡 문제를 해결합니다. SAFC와 DAG는 각각 "편집 영역의 정확한 위치 지정"과 "향상된 의미 체계 정렬"이라는 두 가지 측면에서 신뢰성을 향상시킵니다. 연구자들에게 이는 명확한 아이디어가 담긴 기본 프레임워크입니다. 실제 프로젝트에서 영상 편집 기능을 구현하려는 팀에게는 교육 없이도 영상 편집의 품질이 실무 수준에 도달할 수 있음을 입증합니다.
현재 제한사항:
- 아직은 연구용 프로토타입으로, 상업적으로 배포할 수 있는 제품 형태로 패키징되지는 않았습니다.
- GPU 메모리 요구 사항이 높기 때문에 처리할 수 있는 비디오 해상도와 프레임 수가 제한됩니다.
- 사용자는 환경을 구성하고, 매개변수를 조정하고, 문제를 해결하기 위해 자신의 기술적 능력을 가져와야 합니다.
추가 관찰 포인트:
- 팀이 이를 ComfyUI 노드 또는 웹 서비스로 캡슐화할지 여부는 실용성 정도를 직접적으로 결정합니다.
- 더 높은 해상도와 더 긴 비디오를 지원할지 여부 - 영화 및 TV 제작 과정에 들어갈 수 있는지 여부를 결정합니다.
- 커뮤니티 기여 및 포크 수는 오픈 소스 생태계의 상태를 반영합니다.
관련 도구: runway, pika
버전 정보
- 최초 출시 :초기 공개 버전은 정확한 의미론적 비디오 편집 SAFC 로컬 보호 메커니즘과 ODE 편집 흐름을 기반으로 하는 DAG 의미론적 향상을 지원합니다.
- 종이 릴리스 :기술 세부 사항과 벤치마크 결과를 공개하는 arXiv 문서가 공개되었습니다.
사용자 후기