ACE-1.5단계
무료
ACE-Step 1.5는 ACE Studio와 StepFun이 공동으로 출시한 오픈소스 음악 기본 모델입니다. 로컬 배포, 고속 생성 및 다국어 가사 노래에 중점을 둡니다. 텍스트로 생성된 노래, 표지, 다시 그리기, 오디오 트랙 분리 및 기타 편집 기능을 지원하며 4GB의 비디오 메모리로 실행할 수 있습니다.
ACE-1.5단계 전체 검토
핵심 매개변수 및 통계
| 프로젝트 | 사양 |
|---|---|
| 제품 포지셔닝 | 오픈소스 음악 기본 모델 |
| 개발자 | ACE 스튜디오 + StepFun |
| 건축 | LM(곡 기획) + DiT(어쿠스틱 렌더링) Mix |
| 세대 속도 | A100 ≒ 2초/곡, RTX 3090 ≒ 10초/싱글 |
| 최소 비디오 메모리 | 4GB(일부 구성) |
| 지원되는 플랫폼 | CUDA, 애플 실리콘, ROCm, 인텔 XPU |
| 오픈 소스 라이센스 | MIT |
| 가사 언어 | 50개 이상의 언어 |
ACE-Step 1.5는 아마도 현재 사용 가능한 가장 하드웨어 친화적인 오픈 소스 음악 생성 모델일 것입니다. 4GB의 비디오 메모리 임계값은 지난 5년 동안의 소비자급 그래픽 카드를 실행할 수 있음을 의미하며, 이는 종종 A100이 필요한 음악 세대 트랙에 신선한 공기를 불어넣는 것입니다.
사용자 및 시장 인지도
ACE-Step 1.5는 오픈 소스 음악 생성 커뮤니티에서 빠르게 주목을 받고 있습니다. Suno와 같은 비공개 소스 제품과 비교하면 다음과 같은 차이점이 있습니다. ① MIT 라이센스, 상업적 사용 및 2차 개발이 무료입니다. ② 로컬 배포를 지원하며 데이터가 장치를 떠나지 않습니다. ③ 완전한 편집 파이프라인(생성 → 커버 → 다시 그리기 → 트랙 분할)을 제공합니다. 이는 단순히 "곡 생성"만큼 간단하지 않습니다. SongGeneration과 비교하여 ACE-Step의 뛰어난 장점은 추론 속도가 낮고 메모리 요구 사항이 낮다는 것입니다.
공개성 검증: "4~8단계 증류 추론, A100은 약 2초 만에 전체 곡 생성" - 이 속도는 짧은 클립(10~30초)으로도 달성 가능하지만, 3~5분 분량의 완전한 곡을 생성할 경우 추론 시간이 크게 늘어납니다. 증류 추론은 음질을 유지하면서 분명한 가속 효과를 가지지만, 매우 낮은 걸음 수에서는 음질이 디테일 손실로 인해 어려움을 겪을 수 있습니다.
비용 이점
| 치수 | 설명 |
|---|---|
| 코드 | MIT 라이센스에 따라 무료 |
| 모델 중량 | 공개 다운로드 |
| 온라인 데모 | 무료 평가판 |
| 자체 전개 | RTX 3090/4090은 원활하게 실행될 수 있습니다 |
자유로운 진실: MIT 라이센스, 코드 및 모델 가중치를 무료로 다운로드할 수 있습니다. 자체 배포 하드웨어의 최저 비용은 기존 그래픽 카드에 반영됩니다. RTX 3090 이상의 모델을 보유하고 있는 경우 증분 비용은 거의 0입니다. 새 하드웨어를 구입해야 하는 경우 약 2,000~3,000위안의 RTX 4060(4GB 비디오 메모리)이 최소 요구 사항을 충족할 수 있습니다. 시험해 보고 싶은 사용자에게는 온라인 데모가 가장 저렴한 옵션입니다.
주요 기능
- 텍스트 생성 노래: 가사와 스타일 설명을 입력하면 AI가 완전한 노래를 생성합니다. 10초에서 10분까지의 기간이 지원됩니다.
- 50개 이상의 언어 가사 및 노래: 중국어, 영어, 일본어, 한국어 등 주류 언어와 여러 보조 언어를 지원합니다. 이는 다국어 음악 콘텐츠(예: 다른 언어로 노래된 버전이 필요한 게임 사운드트랙)가 필요한 제작자를 위한 핵심 차별화 기능입니다.
- 덮고 다시 그리기: 오디오를 입력하면 AI가 이를 다른 스타일이나 음성으로 재해석합니다. 기존 노래를 적용하는 데 적합합니다.
- 트랙 분리 및 완성: 노래를 보컬 및 백킹 트랙으로 분리하거나 전체 세그먼트로 분리합니다. "곡 생성"부터 "곡 편집"까지 음악 제작의 다양한 측면을 다룹니다.
- LoRA 맞춤형 트레이닝: 적은 수의 노래로 개인 스타일의 LoRA를 트레이닝하세요. 고정된 스타일을 갖고 있는 크리에이터의 경우, 미세 조정 후의 일관성이 일반 모델보다 훨씬 좋습니다.
모델 및 버전의 진화
| 무대 | 시간 | 주요 변경사항 | 현재의 의미 |
|---|---|---|---|
| ACE-스텝 1.0 | ~2026-03 | 기본적인 음향 생성 기능을 형성하기 위한 주요 텍스트-노래 링크 구축 | 오픈 소스 음악 모델이 완전한 노래를 생성할 수 있음을 증명 |
| ACE-단계 1.5 | ~2026-06 | 50개 이상의 언어 가사, 커버, 다시 그리기, 트랙 분할 및 LoRA 교육으로 확장 | "생성 가능"에서 "편집 및 사용자 정의 가능"으로 업그레이드됨 |
ACE-Step의 버전 관리 경로는 매우 명확합니다. 먼저 텍스트에서 노래를 생성하는 프로세스를 완료한 다음 제작자가 실제로 사용할 편집 단계를 완료합니다. 1.0은 오픈 소스 기준에 더 가까운 반면, 1.5는 완전한 음악 워크플로우, 특히 커버, 다시 그리기 및 트랙 분할 기능에 가까워지기 시작하여 모델을 일회성 생성기에서 반복적으로 수정할 수 있는 제작 도구로 발전시킵니다.
현재 버전의 포지셔닝은 가장 강력한 완제품 사운드 품질을 위해 비공개 소스 플랫폼과 경쟁하는 것이 아니라 "로컬에서 실행 가능한 음악 기본 모델"을 엔지니어링에서 구현 가능한 선택으로 만들기 위해 더 낮은 하드웨어 임계값과 더 느슨한 라이센스를 사용하는 것입니다. 연구원과 개발자에게 1.5는 이미 순수한 데모보다 더 완전한 이정표입니다.
기술적인 장점
| 기술 포인트 | 행동 메커니즘 | 실제 효과 |
|---|---|---|
| LM + DiT 하이브리드 아키텍처 | 먼저 노래 구조를 계획한 다음 음향 세부 사항을 렌더링 | 멜로디, 리듬, 음색에 대한 보다 안정적인 제어감 |
| 정제된 추론 | 더 적은 단계로 샘플링 완료 | 로컬로 배포 시 대기 시간 대폭 단축 |
| 다국어 가사 모델링 | 가사이해와 가창세대 결합 | 다국어 노래 및 현지화된 콘텐츠를 더욱 원활하게 만들기 |
| LoRA 맞춤형 트레이닝 | 소수의 샘플을 사용하여 스타일 선호도 주입 | 고정된 스타일을 사용하는 제작자의 재사용에 더 적합 |
ACE-Step 1.5의 장점은 "오픈 소스"일 뿐만 아니라 속도, 메모리 임계값 및 편집 기능을 결합한다는 것입니다. 많은 유사한 오픈 소스 모델이 사운드를 생성할 수 있지만 생성 속도, 사후 편집 및 상용 라이선스를 동시에 고려하기는 어렵습니다. ACE-Step 1.5의 차별점은 이러한 세부 사항을 비교적 완전한 창의적 기반으로 패키지화하는 것입니다.
공개 검증: 관계자는 4GB의 비디오 메모리를 실행할 수 있으며 4~8단계의 증류 가속이 기본적으로 설정되어 있다고 강조합니다. 이 셀링 포인트는 기본적으로 '런닝'에 해당되지만, '고음질 전곡의 안정적인 출력'을 위해서는 추가 조건이 있습니다. 단기 스니펫, 초안 생성 및 부분 편집이 편안한 영역에 더 가깝습니다. 장기적인 고충실도 완제품을 추구한다면 하드웨어, 추론 시간, 후처리 비용은 계속 증가할 것입니다.
사용방법
| 입구 | 최소 요구사항 | 시작하는 방법 |
|---|---|---|
| 온라인 데모 | 브라우저 액세스 가능 | 가사와 스타일 설명을 직접 입력하고 먼저 음색과 리듬 방향을 확인하세요 |
| 지역적 추론 | 4GB 이상의 비디오 메모리, CUDA 또는 Apple Silicon 권장 | 가중치를 다운로드한 후 공식 웨어하우스에 따라 컨텍스트를 구성하고 기본 추론 스크립트 실행 |
| 맞춤형 교육 | 추가 비디오 메모리 및 소수의 훈련 샘플 | LoRA 미세 조정을 통해 개인 스타일이나 브랜드 톤을 강화하세요 |
시작하는 가장 빠른 방법은 먼저 온라인 데모를 사용하여 프롬프트 단어 구조를 확인한 다음 로컬에 배포할지 여부를 결정하는 것입니다. 대부분의 팀에서는 처음부터 그래픽 카드를 조작하는 것보다 "가사 스타일 설명이 안정화되어 사용 가능한 초안을 생성할 수 있는지" 먼저 테스트하는 것이 비용 효율적입니다.
로컬로 사용하는 경우 최소 구성 주소는 "높은 처리량"이 아니라 "실행 가능" 주소입니다. 긴 노래를 동시에 생성하고, 커버하고, 추적하려면 3090/4090 장치가 분명히 더 편리할 것입니다. 기업이나 스튜디오의 경우 전체 제작 링크를 직접 교체하기보다는 '초안 생성 + 수동 개선' 과정에 넣는 것이 좋습니다.
제품 가격
가격 모델은 공식 실시간 페이지를 따릅니다. 보통 부분 유료화(Freemium)나 구독제(Subscription System)를 사용하며 기본 기능은 무료로 사용할 수 있다. 고급 기능을 사용하거나 빈도가 높은 경우에는 유료 구독이 필요하며, 사용자는 실제 사용량을 바탕으로 최적의 솔루션을 평가하는 것이 좋습니다.
애플리케이션 시나리오
- 빠른 사운드트랙 생성: 비디오, 팟캐스트, 게임을 위한 맞춤형 배경 음악을 생성합니다. "중국 스타일, 멜로디 2분"을 입력하고 30초 이내에 사용 가능한 사운드트랙 초안을 받으세요.
- 커버 및 각색: 노래를 다양한 스타일로 커버합니다. 팝송을 재즈 버전으로 변경하거나 영어 노래를 중국어 버전으로 번역합니다. 콘텐츠 제작자가 2차 창작을 하는 데 적합합니다.
- 음악 교육 및 실험: AI를 사용하여 교육 사례로 다양한 스타일의 음악 악절을 생성하거나 음향 실험을 수행합니다.
단념 시나리오: 출판 수준의 전문적인 믹싱 품질이 필요한 경우 AI가 생성한 노래는 음질 레이어링 및 믹싱 세부 사항 측면에서 여전히 전문 녹음 스튜디오보다 열등합니다. ACE-Step은 최종 릴리스가 아닌 초안 및 데모 단계에 적합합니다.
해당자
- 인디 뮤지션: 창작 과정에서 멜로디와 편곡 방향을 빠르게 확인할 수 있으며 MIT 라이선스를 통해 상업적 사용이 허용됩니다. 저작권 분쟁이나 플랫폼 공유 문제에 대해 걱정할 필요가 없습니다.
- 콘텐츠 제작자: 비디오 및 팟캐스트용 사운드트랙과 배경 음악을 빠르게 생성하여 저작권 위험을 줄입니다. 음악 플랫폼에서 상업용 라이선스를 구매하는 것과 비교하면 자체 생성 비용이 훨씬 저렴합니다.
- 오디오 AI 개발자: MIT 라이선스에 따른 제한이 적은 ACE-Step을 기반으로 음악 생성 애플리케이션을 구축합니다. 모델 출력의 음질이 사용자의 기대를 충족시킬 수 있는지, 스케일 업 후 추론 비용이 경제적인지 여부에 주목할 필요가 있습니다.
- 게임 오디오 팀: 게임에 대한 맞춤형 배경 음악과 주제가를 생성합니다. MIT 라이선스는 상용 제품에 내장될 수 있으나 음질과 음향 효과의 일관성을 위해서는 추가적인 처리가 필요합니다.
현재 제한사항: ACE-Step 1.5는 가사의 발음 정확도 측면에서 일부 소수 언어에 대한 지원이 제한되어 있습니다. 라틴 알파벳이 아닌 언어(예: 중국어, 일본어)의 가사에는 발음 편차가 있는 경우가 있어 수동 수정이나 사후 녹음이 필요합니다.
요약 및 전망
해당 분야에서 경쟁력 있는 솔루션을 제공하며, 이 분야에서 AI 활용의 문턱을 낮추는 것이 핵심 가치입니다.
현재 제한 사항: 일부 고급 기능에는 유료 구독이 필요하며 무료 버전에는 기능 또는 사용 제한이 있습니다. 구체적인 기술 세부 사항과 성능 벤치마크는 아직 완전히 공개되지 않았습니다.
관련 도구: elevenlabs, udio
버전 정보
- ACE-1.5단계 :50개 이상의 언어로 된 노래 가사의 텍스트 생성, 표지 다시 칠하기, 오디오 트랙 분리 및 LoRA 맞춤형 교육을 지원합니다.
- ACE-단계 1.0 :텍스트를 노래로 변환하는 기본 음악 생성 모델입니다.
사용자 후기