3D 스피커
무료
3D-Speaker는 단일/다중 모드 화자 검증, 화자 식별 및 화자 로그 분리를 위한 Alibaba Cloud ModelScope의 오픈 소스 툴킷입니다. ERes2Net, CAM++, ECAPA-TDNN 등 사전 훈련된 모델과 대규모 3D-Speaker 음성 데이터 세트를 제공하고 음성과 시각을 통합하는 다중 모드 스피커 로그를 지원합니다.
3D-스피커
3D-Speaker의 핵심 매개변수 및 통계
3D-Speaker는 Alibaba Cloud ModelScope 커뮤니티의 오픈 소스 단일/다중 모드 스피커 검증, 인식 및 로그 분리 툴킷입니다. 음성 기술 개발자와 AI 연구자를 위한 모델 훈련부터 생산 추론까지 완전한 도구 체인을 제공합니다. 이름의 "3D"는 3차원 비전보다는 데이터 세트의 3차원(다중 장치, 다중 거리, 다중 방언)을 나타냅니다.
| 프로젝트 | 공공정보 |
|---|---|
| 제품 포지셔닝 | 오픈 소스 단일/다중 모달 스피커 검증 및 로그 분리 툴킷 |
| 핵심 기술 스택 | 딥러닝(ResNet, Res2Net, ECAPA-TDNN, ERes2Net, CAM++, SDPN 등) |
| 사전 훈련된 모델 수 | 10+ (화자 확인, 언어 식별, 자기 지도 학습 포함) |
| 라이센스 계약 | 아파치 라이센스 2.0 |
| 지원되는 플랫폼 | 리눅스, macOS, 데스크탑, API |
| 프로그래밍 언어 | Python(54%), Shell(27%), Perl(15%), C++(3%) |
| GitHub 스타 | ~3,100 |
| GitHub 포크 | ~267 |
| 기여자 | 8명(2026~07년 기준) |
| 산하기관 | 알리바바 DAMO 아카데미 / ModelScope |
| 소속 장소 | 중국 |
| 연결된 데이터세트 | 3D-스피커-데이터세트(10,000명 이상의 스피커, 190GB 교육 데이터) |
| 학술 논문 | ICASSP 2025 수락 |
한 문장으로 요약: 3D-Speaker는 음성 비서 제품이 아니라 ModelScope에서 제작한 전문적인 성문 인식 오픈 소스 도구 라이브러리입니다. 이를 통해 개발자는 저렴한 비용으로 "목소리를 듣고 사람 식별"하는 생산 수준의 기능을 구축하고 이에 맞는 대규모 벤치마크 데이터 세트를 제공할 수 있습니다.
핵심 기능 경계: 3D-Speaker는 "누가 말하는지" 작업에 중점을 두고 ASR(음성 텍스트 변환), TTS(음성 합성) 또는 NLP 의미론적 이해를 제공하지 않습니다. 이는 음성 상호 작용 파이프라인의 신원 인식 문제를 해결하며 완전한 대화 시스템을 형성하려면 다른 음성 모듈과 결합해야 합니다.
3D-Speaker의 사용자 및 시장 인지도
성문 인식 기술은 학술 연구에서 대규모 산업 응용으로 전환하는 중요한 단계에 있습니다. 금융 신원 인증, 지능형 회의 분석, 스마트 홈 개인화와 같은 시나리오에서 "음성을 듣고 사람 식별"에 대한 수요가 계속 증가하고 있습니다. 그러나 고품질 오픈 소스 도구 체인의 부족으로 인해 오랫동안 산업 구현 속도가 제한되었습니다. 이러한 맥락에서 3D-Speaker는 ModelScope 생태계(Alibaba Cloud의 AI 오픈 소스 플랫폼)에 의존하며 중국어 화자 인식 분야에서 가장 영향력 있는 오픈 소스 프로젝트 중 하나가 되었습니다.
커뮤니티 인정: GitHub 저장소는 약 3,100개의 별과 267개의 포크를 받았습니다. 유사한 오픈 소스 프로젝트(예: WeSpeaker 약 4,500개 별, SpeechBrain 약 9,000개 별)와 비교할 때 3D-Speaker는 중국 음성 기술 커뮤니티에서 첫 번째 단계로 인정받고 있습니다. 핵심적인 차이점은 대규모 다중 장치/다거리/다언어 데이터 세트와 전체 기본 모델 세트의 "데이터 + 코드" 통합 솔루션을 제공한다는 것입니다.
학술적 영향: 3D-Speaker 관련 논문은 ICASSP 2025(음성 분야 최고의 학술 컨퍼런스)에서 승인되었으며, 논문 제목은 "3D-Speaker-Toolkit: An Open Source Toolkit for Multi-modal Speaker Verification and Diarization"입니다. 함께 제공되는 3D-Speaker 데이터 세트 논문(arXiv 2306.15354)은 음성 표현 분리 연구를 위해 14개 중국어 방언의 10,000명 이상의 화자에 대한 대규모 벤치마크를 제공하며 많은 연구자들에 의해 인용되었습니다.
산업적 채택: 성문 인식은 금융 규정 준수 시나리오에서 "향상된 신원 인증"을 위한 핵심 기술 중 하나입니다. Alibaba Cloud 생태계를 기반으로 하는 3D-Speaker는 ModelScope 플랫폼의 사전 훈련된 모델 다운로드 및 온라인 추론 서비스를 통해 금융, 보안, 회의 및 기타 산업 분야의 개발자 사용자를 대상으로 합니다. 특정 기업 수준 채택 데이터는 공개되지 않지만 ModelScope 플랫폼 발표자 검증 모델 페이지 다운로드는 간접적인 참조로 사용될 수 있습니다.
경쟁 제품과의 차별화된 포지셔닝: pyannote.audio(프랑스 팀이 개발, 분할에 중점을 두고 개발), SpeechBrain(종합 음성 툴킷), WeSpeaker(화자 인식에 중점을 둠) 등 국제적인 주류 도구와 비교했을 때, 3D-Speaker 핵심 장점은 세 가지 점에 있습니다. 첫째, 대규모 중국어 다방어 데이터 세트(3D-Speaker-Dataset)를 제공합니다. 둘째, 단일 모드(순수 오디오) 및 다중 모드(오디오 및 비디오 융합) 솔루션을 모두 다루고 있습니다. 셋째, ERes2NetV2 및 CAM++와 같은 모델 아키텍처에서 최고의 벤치마크 결과를 계속 유지하고 있습니다.
3D-Speaker의 가격적 장점
3D-Speaker의 가격 모델은 매우 간단합니다. Apache 2.0 오픈 소스 라이선스에 따라 완전 무료입니다. 그러나 "오픈 소스 및 무료"의 실제 비용 구조는 역할별로 분류되어야 합니다.
C 클라이언트/개인 개발자: 코드와 사전 학습된 모델은 완전히 무료로 다운로드하여 사용할 수 있습니다(Apache 2.0 라이선스). 개별 개발자는 라이선스 비용 없이 기본 GPU(예: RTX 3090/4090)에서 추론을 실행할 수 있습니다. 3D-Speaker 데이터 세트(~190GB)도 무료로 사용할 수 있지만 다운로드하려면 대역폭과 시간 비용이 필요합니다.
API/개발자: 공식적인 호스팅 API 가격이 없습니다. 3D-Speaker는 DeepSeek API와 같은 기본 모델용 상용 API 모델과 달리 ModelScope 플랫폼에서 독립형 유료 API를 제공하지 않습니다. 개발자는 다음을 선택할 수 있습니다.
- 자체 배포 모드: 자체 서버에서 추론을 실행하면 비용은 전적으로 하드웨어 투자에 따라 달라집니다. 단일 화자 검증 추론은 소비자급 GPU에서 수십 밀리초 내에 완료될 수 있으며 처리량 병목 현상은 주로 특징 추출 전 음성 활동 감지(VAD) 및 오디오 디코딩 단계에서 발생합니다.
- ModelScope 온라인 추론: ModelScope 플랫폼은 사전 훈련된 일부 모델에 대한 온라인 경험 서비스를 제공하지만 주로 기능 검증에 사용되며 높은 동시성 생산 시나리오에는 적합하지 않습니다. 구체적인 사용 제한은 공식 ModelScope 페이지에 따릅니다.
기업/개인: Apache 2.0 라이센스는 라이센스 비용 없이 무료 상업적 사용, 수정 및 재배포를 허용합니다. 그러나 기업은 다음과 같은 명시적인 투자를 부담해야 합니다.
- GPU 인프라: 단일 카드 A100-80G는 ERes2NetV2(17.8M 매개변수)와 같은 주류 모델의 일괄 추론을 수행할 수 있습니다. 대규모 분할 작업(예: 수십 시간의 회의 오디오)에는 더 높은 사양의 CPU/GPU 리소스 구성이 필요합니다.
- 데이터 수집 및 주석: 성문 인식 시스템의 실제 성능은 대상 장면과 일치하는 데이터에 크게 의존합니다. 장치 전반(예: PC 마이크에서 전화 채널로 전환) 및 거리 전반(근거리 필드와 원거리 필드)의 인식 정확도가 크게 감소합니다. 기업에서는 일반적으로 대상 장면의 음성 데이터를 추가로 수집하고 도메인 미세 조정을 수행해야 합니다. 이러한 암묵적 비용은 종종 모델 자체를 사용하는 비용을 초과합니다.
- 시스템 통합 투자: 성문 인식 모듈은 기존 ASR, VAD, NLP 및 기타 파이프라인과 결합되어야 하며 엔지니어링 인력 투자가 필요합니다.
비용 비교: 오픈 소스 도구와 상용 API:
| 비용 항목 | 3D-Speaker(오픈소스 및 자체 배포) | 상업용 성문 API(예: Alibaba Cloud 성문 인식) |
|---|---|---|
| 라이센스 비용 | 제로 | 통화량에 따라 요금 청구 |
| GPU 서버(월별 예상) | 5,000~50,000위안(규모에 따라 다름) | 0(API 호출) |
| 운영 및 유지관리 인력 | 엔지니어 유지보수 필요 | 제로 |
| 장면 적응 미세 조정 | 자기투자 | 사용자 정의는 일반적으로 지원되지 않습니다 |
| 데이터 개인정보 보호 | 완전히 현지화됨 | 클라우드 서비스 제공업체에 대한 의존도 |
| 규모 이후의 한계비용 | 0에 가까움(전기요금만) | 통화량에 따른 선형 증가 |
숨겨진 비용 팁: 3D-Speaker의 EER은 VoxCeleb 및 CNCeleb과 같은 표준 테스트 세트에서 0.52%까지 낮을 수 있지만 이 수치는 통제된 실험실 조건에서 얻은 것입니다. 무음이 아닌 상황, 모바일 인터넷 통화, 어린이 또는 노인 화자와 같은 실제 시나리오에서는 인식 정확도가 크게 떨어집니다. 모델을 프로덕션에 투입하기 전에 대상 장면 데이터에 대해 최소 2주 동안 그레이스케일 테스트를 수행하여 사전 훈련된 모델과 미세 조정된 모델 간의 성능 차이를 비교해야 합니다.
3D-Speaker의 주요 기능
3D-Speaker의 핵심 기능은 "음성에서 화자 신원 식별" 작업을 중심으로 이루어지며 상호 관련된 네 가지 기능 모듈이 포함됩니다.
-
발표자 인증: 1:1 본인 인증을 통해 해당 발언이 선언된 발언자의 것인지 확인합니다. 금융 신원 확인 및 시스템 로그인을 위한 핵심 시나리오입니다. 3D-Speaker는 ERes2NetV2, CAM++, ECAPA-TDNN 등과 같은 여러 모델을 제공하며 VoxCeleb 테스트 세트의 EER 범위는 0.52%(ERes2Net-Large)에서 1.56%(Res2Net)입니다. 구현 문제: 확인 임계값 선택은 보안과 사용자 경험을 직접적으로 절충합니다. 임계값이 너무 엄격한 경우 보안은 향상되지만 사용자 거부율은 높아집니다. 판단할 비즈니스 보안 수준에 따라 ROC 곡선 분석을 수행하는 것이 좋습니다.
-
스피커 식별: 1:N 신원 매칭, 등록된 화자 세트 중 현재 음성이 어느 신원에 속하는지 식별합니다. VIP 고객의 용의자 조사, 자동 식별 등의 시나리오에 적합합니다. 구현 문제: 등록 세트의 크기가 증가하면 인식 정확도가 감소합니다. 대규모 시나리오(10,000명 이상)에서는 계층적 인덱싱 또는 ANN 가속을 도입하는 것이 좋습니다.
-
화자 분할: "누가 언제 말했는지"에 따라 여러 사람의 오디오를 분할하고 레이블을 지정하고 타임스탬프 + 화자 레이블을 출력합니다. 이는 회의 분석 및 고객 서비스 품질 검사를 위한 핵심 전제 조건입니다. 3D-Speaker의 분할 파이프라인에는 5개의 플러그형 모듈이 포함되어 있습니다: 중첩 음성 감지(선택 사항) → 음성 활동 감지 → 음성 분할 → 화자 임베딩 추출 → 화자 클러스터링. Aishell-4 데이터 세트에서 DER(Diarization Error Rate)은 10.30%에 도달할 수 있습니다. 구현 문제: 중복 감지는 현재 프로젝트의 병목 현상입니다. 두 명 이상의 사람이 동시에 말할 때 기존 분할 방식은 중복 영역을 스피커 중 하나에 잘못 할당하거나 소음으로 표시하여 정보 손실을 초래합니다. 3D-Speaker는 이 문제를 완화하기 위해 선택적인 중첩 감지 모듈을 제공합니다.
-
언어 식별: 발언의 언어 유형을 식별합니다(현재 중국어, 영어 중심). CAM++ 모델을 기반으로 3D-Speaker 데이터 세트에서 29.36%의 EER이 달성되었습니다(언어 인식은 주로 정확성을 기반으로 하며 이 EER은 참조용일 뿐입니다). 다국어 콜센터 자동 라우팅 시나리오에 적합합니다.
-
멀티모달 스피커 분할: 오디오 및 비디오 이미지 입력의 융합. TalkNet-ASD 모델을 통해 영상에서 입술 움직임과 얼굴 활동 특징을 추출하고, 중첩되는 음성 시나리오에서 오디오 특징과의 공동 추론이 오디오 전용 솔루션보다 훨씬 뛰어납니다. 오디오와 비디오 데이터가 모두 포함된 화상회의, 인터뷰 기록 등의 시나리오에 적합합니다.
-
자기 지도형 화자 검증(Self-Supervised SV): 레이블이 지정되지 않은 음성 데이터에 대한 화자 표현을 학습할 수 있는 두 가지 자가 지도형 교육 솔루션인 RDINO 및 SDPN을 제공하여 주석이 달린 고품질 데이터에 대한 의존도를 줄입니다. 레이블이 지정되지 않은 대규모 음성 데이터에 대한 사전 학습 시나리오에 적합합니다.
[전문가 견해: 기능적 시너지]: 이 네 가지 기능은 완전한 "음성→화자 태그" 처리 파이프라인을 형성합니다. 분할은 서로 다른 화자의 음성 세그먼트를 분리합니다. → 확인/식별은 각 세그먼트에 ID를 표시합니다. → 언어 식별은 언어 메타 정보를 보완합니다. 실제 엔지니어링 배포에서 Diarization의 분할 정확도(특히 겹치는 음성 분할의 품질)는 전체 파이프라인의 병목 현상입니다. 분할 오류는 확인 섹션으로 직접 전달되어 ID 주석 오류가 발생합니다. 검증 모델 자체의 정확성에만 집중하기보다는 VAD 및 파이프라인 세분화에 더 많은 튜닝 리소스를 투자하는 것이 좋습니다.
3D-Speaker의 모델과 버전의 진화
3D-Speaker는 "기능 반복이 버전 진화를 주도한다" 모드로 지속적으로 업데이트됩니다. GitHub 리포지토리에는 전통적인 의미 버전 번호(v1.0, v2.0 등 릴리스 없음)가 없지만 "새 모델 또는 새 기능의 월별/분기별 릴리스" 형식으로 승격됩니다. 다음은 README의 새로운 기능 타임라인을 기반으로 버전 컨텍스트를 재구성한 것입니다.
1단계: 데이터 세트 및 기준 모델 출시(2023.06~2023.11)
- 2023.06: 14개 중국어 방언, 다중 장치(PC, 레코더, 어레이, 모바일 iPad) 및 다중 거리(0.1m~4m) 레이블을 사용하는 10,000개 이상의 화자를 포함하는 3D-Speaker 데이터 세트가 공식적으로 출시되었습니다. 동시에 ERes2Net, CAM++ 및 RDINO와 같은 기본 모델과 지원 벤치마크가 출시되었습니다.
- 2023.07: CAM++, ERes2Net-Base 및 ERes2Net-Large 사전 학습 모델이 ModelScope 플랫폼에서 출시되었습니다. 대화 감지 및 의미 화자 전환 감지 모듈이 출시되어 분할의 의미 차원을 향상시킵니다.
- 2023.08: CN-Celeb 데이터 세트에 대한 CAM++, ERes2Net-Base 및 ERes2Net-Large 벤치마크 결과가 공개되었습니다. 중국어, 영어 인식 모델을 출시했습니다.
- 2023.09: CN-Celeb 데이터세트에서 RDINO 자체 감독 화자 검증 모델에 대한 교육 및 추론 레시피를 출시했습니다.
- 2023.10: 3개 데이터세트(3D-Speaker, VoxCeleb, CN-Celeb)에 대한 ECAPA-TDNN의 훈련 및 추론 레시피를 출시했습니다.
- 2023.11: ERes2Net 기반 사전 학습 모델 출시, 200,000명의 중국어 북경어 데이터 세트를 기반으로 학습.
2단계: 모델 시스템 확장(2024.01 - 2024.08)
- 2024.01: 세 가지 데이터 세트를 다루는 ResNet34 및 Res2Net 모델 레시피를 출시했습니다. 마진이 큰 미세 조정 레시피와 분할 추론 레시피를 출시했습니다.
- 2024.02: 음소 정보를 통합하여 언어 인식 정확도를 향상시키는 언어 인식 레시피 출시 오디오 및 비디오 입력을 통합하는 다중 모드 분할 레시피를 출시했습니다.
- 2024.04: ONNX 형식으로의 모델 내보내기 및 CPU/에지 장치에서의 효율적인 추론을 지원하는 ONNX 런타임 추론 런타임을 출시했습니다. VoxCeleb에서 더 적은 수의 매개변수와 더 빠른 추론을 갖춘 ERes2NetV2 모델을 출시했습니다.
- 2024.05: SDPN 자체 감독 모델 X-벡터 모델 교육 및 추론 레시피 출시 멀티모달 화자 인식 기능을 확장하기 위한 비전 모듈(TalkNet-ASD) 및 의미론적 모듈(BERT) 레시피를 출시했습니다.
- 2024.08: EER과 매개변수 크기 간의 더 나은 균형을 달성하기 위해 200k 화자 데이터 세트에서 훈련된 ERes2NetV2 및 ERes2NetV2_w24s4ep4 사전 훈련된 모델을 출시했습니다.
3단계: 엔지니어링 및 벤치마크 개선(2024.12)
- 2024.12: Aishell-4, Alimeeting, AMI, VoxConverse, Meeting-CN 등과 같은 여러 공개 다중 스피커 데이터 세트에서 재현 가능한 DER 벤치마크를 제공하기 위해 완전히 업데이트된 분할 레시피입니다. 이는 최신 주요 버전이며 3D-Speaker가 순수한 연구 도구에서 재현 가능한 엔지니어링 벤치마크로 전환되었음을 나타냅니다.
버전 정책 설명: 3D-Speaker는 의미론적 버전 번호 릴리스를 따르지 않으며 GitHub 릴리스 페이지에는 공식 릴리스 기록이 없습니다. 사용자는 Git 커밋 기록 ModelScope 모델 페이지와 README 업데이트 로그에 주의하여 최신 변경 사항을 추적해야 합니다. 이 릴리스 방법은 유지 관리 비용을 줄여 주지만 사용자가 단일 버전 번호를 통해 코드 안정성을 판단하기 어렵게 만듭니다. 프로덕션 용도로 특정 커밋을 잠그는 것이 좋습니다.
3D-Speaker의 기술적 장점
3D-Speaker의 기술적 이점은 특정 모델 아키텍처의 혁신뿐 아니라 데이터에서 모델, 교육에서 배포까지 완전한 링크 범위에 있습니다. 다음은 건축혁신과 엔지니어링이라는 두 가지 차원을 해체한 것이다.
모델 아키텍처 계통: 3D-Speaker는 다양한 규모와 애플리케이션 시나리오를 포괄하는 8개 이상의 스피커 검증 모델 아키텍처를 통합합니다.
| 모델 | 매개변수 | 복스셀럽 EER | 씨엔셀럽 EER | 3DSpeaker EER | 특징 |
|---|---|---|---|---|---|
| Res2Net | 403만 | 1.56% | 7.96% | 8.03% | 경량 기준 |
| ResNet34 | 634만 | 1.05% | 6.92% | 7.29% | 고전 건축 |
| ECAPA-TDNN | 2080만 | 0.86% | 8.01% | 8.87% | 경쟁 기준 |
| ERes2Net 기반 | 661만 | 0.84% | 6.69% | 7.21% | 높은 비용 성능 |
| 캠++ | 720만 | 0.65% | 6.78% | 7.75% | 효율적인 컨볼루션 |
| ERes2NetV2 | 1780만 | 0.61% | 6.14% | 6.52% | 고정밀 추천 |
| ERes2Net-대형 | 2246만 | 0.52% | 6.17% | 6.34% | 최고의 정확도 |
메커니즘 → 효과 → 장면의 인과사슬: 화자 검증의 기술적 핵심은 가변 길이 음성에서 고정차원의 "차별적 화자 임베딩"(Speaker Embedding)을 추출하는 것입니다. ERes2NetV2는 잔여 연결의 계층적 설계를 통해 다중 규모 시간-주파수 기능을 통합하여 매개변수 수를 14% 줄이면서 EER을 0.84%(ERes2Net-base)에서 0.61%로 줄입니다. 이는 오류율이 0에 가까운 시나리오(예: 금융 위험 제어)에서 ERes2NetV2가 더 낮은 계산 비용으로 동일한 보안 임계값을 달성할 수 있음을 의미합니다. 적용 가능한 시나리오는 고정밀 화자 검증이 필요하고 추론 지연에 민감한 프로덕션 환경입니다.
CAM++의 혁신적인 장점: CAM++(Contextual Attention Module)은 3D-Speaker 팀이 제안한 효율적인 컨벌루션 아키텍처입니다. VoxCeleb에서 7.2M의 매우 낮은 매개변수 양으로 0.65% EER에 도달하여 ERes2NetV2(17.8M) 수준에 접근합니다. 매개변수 효율(EER/매개변수량 비율)은 전 모델 중 가장 높다. 장치나 모바일 장치에 배포해야 하는 성문 인식 시나리오의 경우 CAM++가 가장 우선적으로 평가할 가치가 있습니다.
분할 파이프라인 엔지니어링: 3D-Speaker의 분할은 모듈식 파이프라인 설계를 채택하고 각 단계는 독립적으로 교체되거나 최적화될 수 있습니다.
- 중복 음성 감지(시퀀스 라벨링 모델 기반) → 여러 사람이 동시에 말하고 있는 영역을 식별하는 옵션 모듈
- 음성 활동 감지(VAD) → 소리가 나지 않는 클립 제거
- 화자 분할(BERT 또는 고정 창 기반) → 음성을 화자 동종 세그먼트로 분할
- 스피커 임베딩 추출 → ERes2NetV2/CAM++ 등의 모델을 이용하여 세그먼트 레벨 임베딩 추출
- 스피커 클러스터링(스펙트럼 클러스터링/친화성 전파) → 다른 스피커에 클러스터 임베딩
Aishell-4 및 Alimeeting 벤치마크에서 파이프라인은 각각 10.30% 및 19.73%의 DER을 달성했는데, 이는 같은 기간 Kaldi 기준(각각 약 12.2% 및 24.4%)보다 훨씬 더 나은 수치이며, 모듈식 설계의 시너지 효과를 입증합니다.
다중 모드 융합 메커니즘: 3D-Speaker의 오디오 및 비디오 융합 분할 솔루션은 TalkNet-ASD를 통해 비디오에서 입술 움직임과 얼굴 활동 특징을 추출하고 이를 임베딩 수준에서 오디오 특징과 접합한 다음 통합 클러스터링 모듈로 보냅니다. 음성이 겹치는 비율이 높은 시나리오에서 시각적 정보는 오디오가 누락된 화자 전환 경계 신호를 제공하여 DER을 약 3~5% 포인트 줄입니다. 적용 가능한 시나리오에는 화상 회의, 실시간 인터뷰, 뉴스 프로그램 및 다중 카메라 비디오 데이터를 사용하는 기타 분야가 포함됩니다.
ONNX 런타임 배포 최적화: 3D-Speaker는 ONNX 모델 내보내기 및 추론 스크립트를 제공하여 PyTorch 교육 모델을 ONNX 형식으로 변환하고 CPU 또는 에지 장치에 배포하도록 지원합니다. 모델을 정량적으로 최적화한 후에는 추론 지연 시간을 PyTorch 동적 그래프의 1/3~1/2로 줄일 수 있으며, 메모리 사용량도 약 40% 감소합니다. GPU가 없는 서버 환경에서 ONNX 배포는 성문 인식 기능을 프로덕션 환경에 도입하는 가장 저렴한 경로입니다.
제한 사항 및 적응 경계: 3D-Speaker의 사전 훈련된 모델은 주로 샘플링 속도가 16kHz(8kHz 전화 음성에는 추가 적응이 필요함)의 음성 신호를 지향하며 현재 모델은 중국어 및 영어 장면에서 가장 잘 작동합니다. 소규모 언어, 매우 낮은 리소스 언어 또는 비전통적인 샘플링 속도를 사용하는 시나리오의 경우 자체 감독 체계(RDINO/SDPN)를 사용하여 대상 데이터를 사전 훈련하거나 미세 조정해야 합니다.
3D-스피커 사용법
3D-Speaker는 로컬 코드 실행과 ModelScope 플랫폼 온라인 추론이라는 두 가지 사용 경로를 제공합니다.
경로 1: 로컬 복제 코드 실행(개발자에게 권장)
``배쉬
저장소 복제
자식 클론 https://github.com/modelscope/3D-Speaker.git CD 3D 스피커
Python 3.8 컨텍스트를 생성하고 종속성을 설치합니다.
conda create -n 3D 스피커 python=3.8 conda는 3D 스피커를 활성화합니다 pip 설치 -r 요구사항.txt
**훈련 레시피의 예**(3D-Speaker 데이터 세트에서 ERes2NetV2의 스피커 검증을 예로 들어):
``배쉬
CD egs/3dspeaker/sv-eres2netv2/
배쉬 run.sh
추론을 위해 사전 훈련된 모델 사용: ModelScope 라이브러리를 통해 추론을 위해 사전 훈련된 모델을 로드합니다.
``배쉬 pip 설치 모델 범위
``파이썬
# 단일 파일 화자 검증 추론
model_id = "iic/speech_eres2netv2_sv_zh-cn_16k-common"
파이썬 스피커랩/bin/infer_sv.py --model_id $model_id
# 일괄 추론
파이썬 스피커랩/bin/infer_sv_batch.py --model_id $model_id --wavs wav_list.txt
# 자기 지도 모델 추론(SDPN, VoxCeleb 트레이닝 기반)
model_id = "iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k"
파이썬 스피커랩/bin/infer_sv_ssl.py --model_id $model_id
화자 로그 추론(분할):
``배쉬
순수한 오디오 분할
파이썬 스피커랩/bin/infer_diarization.py --wav audio.wav --out_dir ./output
중복 음성 감지 활성화(HuggingFace 토큰 필요)
파이썬 스피커랩/bin/infer_diarization.py --wav audio.wav --out_dir ./output \ --include_overlap --hf_access_token $hf_access_token
### 경로 2: ModelScope 온라인 경험
[ModelScope 스피커 검증 모델 페이지](https://www.modelscope.cn/models, page=1&tasks=speaker-verification&type=audio)를 방문하여 사전 훈련된 해당 모델을 선택하고 테스트를 위해 온라인으로 오디오를 업로드하세요. 모델 기능을 빠르게 검증하는 데 적합하지만 생산 컨텍스트 통합에는 적합하지 않습니다.
### 경로 3: ONNX 배포(에지 장치/CPU 추론)
``배쉬
CD 런타임/onnxruntime
# PyTorch 모델을 ONNX로 내보내고 추론을 실행하려면 이 디렉터리의 문서를 참조하세요.
사용 가능한 사전 훈련된 모델 목록(모두 ModelScope를 통해 배포됨):
| 모델 ID | 설명 | 데이터세트 |
|---|---|---|
iic/speech_eres2net_sv_zh-cn_16k-common |
ERes2Net, 200,000명의 스피커 | 중국어 |
iic/speech_eres2netv2_sv_zh-cn_16k-common |
ERes2NetV2, 200k 스피커 | 중국어 |
iic/speech_campplus_sv_zh-cn_16k-common |
CAM++, 200,000개 스피커 | 중국어 |
iic/speech_sdpn_ecapa_tdnn_sv_en_voxceleb_16k |
SDPN 자체 모니터링 | 복스셀럽 (영어) |
iic/speech_campplus_lre_en-cn_16k |
CAM++ 언어 인식 | 중국어와 영어 |
iic/speech_eres2net_base_lre_en-cn_16k |
Eres2Net 언어 식별 | 중국어와 영어 |
3D 스피커 데이터 세트 다운로드:
``배쉬
훈련 세트(~190GB)
wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/train.tar.gz
테스트 세트(~1.1GB)
wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/test.tar.gz
텍스트 전사
wget https://speech-lab-share-data.oss-cn-shanghai.aliyuncs.com/3D-Speaker/transcription.tar.gz
**팁**: 3D-Speaker에는 공식 Docker 이미지가 없으며 공식 문서는 주로 중국어 README입니다. 프로덕션 사용자의 경우 특정 Git 커밋을 잠그고 Docker 이미지를 직접 빌드하여 종속성 버전 변경으로 인한 일관되지 않은 동작을 방지하는 것이 좋습니다.
## 3D 스피커 제품 가격
3D-Speaker는 Apache 2.0 오픈 소스 프로토콜을 채택하며 상용 과금 모델이 없습니다. 특정 용어:
- **사용 범위**: 소프트웨어의 사본을 자유롭게 사용, 복사, 수정, 병합, 배포, 재라이센스 부여 및/또는 판매할 수 있는 권한이 부여됩니다.
- **상업적 제한**: 없음 - Apache 2.0 프로토콜은 상용 친화적이며 오픈 소스 파생 작업이 필요하지 않습니다.
- **귀속 요구 사항**: 파생 저작물의 원래 저작권 표시 및 기여자 목록을 유지합니다.
- **보증 부인**: 해당 법률에서 요구하거나 서면으로 동의한 경우 명시적이든 묵시적이든 어떠한 보증도 제공되지 않습니다.
- **모델 가중치 라이선스**: 사전 훈련된 모델 가중치는 ModelScope 플랫폼에서 호스팅되며, 해당 사용 약관은 ModelScope의 해당 모델 카드 페이지에 명시된 라이선스의 적용을 받으며, 이는 코드 저장소의 Apache 2.0 계약과 다를 수 있습니다.
- **데이터세트 라이선스**: 3D-Speaker 데이터세트 메타데이터는 CC BY-SA 4.0 라이선스에 따라 공개되며, 오디오 콘텐츠의 원본 저작권은 원본 데이터 소유자에게 있습니다.
**가격 참조**: 라이센스 비용이 없습니다. 기업 사용자의 총 소유 비용 계산 공식은 `TCO = GPU/서버 구매 또는 임대 비용 + 운영 및 유지 관리 인력 × 개월 수 + 시나리오 적응 데이터 수집 비용`입니다. 하루에 1,000시간 미만의 오디오를 처리하는 중간 규모 시나리오의 경우 자체 배포의 TCO는 종량제 상용 API의 TCO보다 훨씬 낮습니다.
## 3D-Speaker의 응용 시나리오
성문 인식이 실험실에서 산업 구현으로 전환되는 핵심 동인은 규정 준수 신원 인증, 회의 인텔리전스, 스마트 홈 개인화라는 세 가지 방향에서 나옵니다. 다음은 3D-Speaker의 기능 경계를 기반으로 한 시나리오 기반 분석입니다.
- **금융 신원 인증 및 사기 방지**: 텔레뱅킹, 모바일 고객 서비스 등 원격 신원 확인 시나리오에서 성문 확인은 비밀번호/PIN 코드를 보완하거나 대체하는 역할을 합니다. 3D-Speaker의 화자 확인 모델은 IVR 시스템에 통합되어 사용자 통화 후 처음 3~5초 내에 신원 비교를 완료할 수 있습니다. **비용 절감 및 효율성 향상**: 성문 인증 도입 이전에는 금융고객 서비스 비밀번호 재설정 및 본인 인증에 평균 45~60초의 수작업 처리 시간이 소요되었으며, 성문 검증을 통합한 후 일상적인 신원 검증을 10초 이내에 자동으로 완료할 수 있어(음성 활동 감지 + 특징 추출 + 비교 포함) 수동 개입이 약 70% 감소합니다. **검증 핵심 사항**: 전화 채널에서의 인식 정확도(8kHz 샘플링 속도), 단음성(3초 미만) 시나리오에서의 진위 거부율, 비자발적 녹음(사기꾼이 재생한 녹음)에 대한 생체 탐지 방어 기능. 3D-Speaker 자체는 스푸핑 방지 모듈을 제공하지 않으며 ASVspoof와 같은 실시간 탐지 솔루션의 추가 통합이 필요합니다.
- **회의 분석 및 지능형 회의록**: 기업 회의 녹음은 자동으로 여러 발언자의 음성 클립을 분리하고 ASR과 결합하여 발언자 레이블이 있는 회의록을 생성합니다. 3D-Speaker의 분할 파이프라인은 이 시나리오의 핵심입니다. **비용 절감 및 효율성 향상**: 기존에는 1시간 분량의 회의록을 수동으로 작성하는 데 약 2~3시간이 소요되었습니다. 자동 분할 + ASR 파이프라인을 사용하면 1시간 분량의 오디오 처리를 15~30분 안에 완료할 수 있으며 효율성이 4~10배 향상됩니다(GPU 추론 시간 기준). **검증 초점**: 여러 사람이 동시에 말할 때(중복 음성) 분할 정확도 - 회의실에서 흔히 발생하는 "중단" 및 "동시 음성" 시나리오입니다. 기존의 분할 솔루션은 겹치는 영역을 잘못된 화자로 표시합니다. 개선 솔루션은 3D-Speaker의 선택적 중첩 감지 모듈을 통해 완화되어야 합니다. 화상 회의의 경우 다중 모드 분할(오디오 및 비디오 융합)을 활성화하여 겹치는 장면의 인식 견고성을 향상시키는 것이 좋습니다. **인간-기계 협업 경계**: 자동 라벨링 결과에 대한 수동 검토를 설정하는 것이 좋습니다. 화자 라벨링 오류는 20% 중복 시나리오에서도 여전히 5~10%에 도달할 수 있으며 규정 준수에 필요한 회의 기록은 수동으로 확인해야 합니다.
- **스마트 스피커 및 홈 개인화**: 다양한 가족 구성원의 목소리를 인식하고 개인화된 콘텐츠 추천을 제공하며 권한 제어를 운영합니다. 3D-Speaker의 경량 모델(CAM++, 7.2M 매개변수)은 클라우드 호출 없이도 스마트 스피커의 엔드사이드 칩에서 실행될 수 있습니다. **비용 절감 및 효율성 향상**: 클라우드 솔루션과 비교하여 기기 내 성문 인식은 단일 상호 작용에 대해 네트워크 전송 지연을 200~500ms 절약하고 클라우드 추론 비용이 없습니다. 하루 50회/가구 사용자 1,000만 명을 기준으로 연간 클라우드 추론 비용 절감액은 약 5,000만~1억 위안(1회 0.001위안 기준으로 계산)입니다. **검증 대상**: 가족 수를 2인에서 6인으로 확대 시 인식 안정성; 원거리장(>2미터) 및 소음 환경(주방 연기, TV 배경음)에서의 EER 저하 정도. 3D-Speaker 사전 훈련된 모델은 주로 16kHz 근거리 장면을 최적화하고 원거리장은 3D-Speaker 데이터 세트의 장거리 하위 집합을 사용하여 미세 조정해야 합니다.
- **콜센터 품질 점검**: 고객 응대와 고객 간의 대화 구간을 자동으로 분리하고, 고객 응대 응대 속도, 감정, 서비스 용어에 대한 품질 점검 분석을 수행합니다. **검증 핵심 사항**: 전화 시나리오의 샘플링 속도 적응(8kHz 대 16kHz) 고객 서비스와 고객의 목소리가 매우 유사할 때 분리 정확도. 3D-Speaker의 ECAPA-TDNN 또는 ResNet34 모델(CNCeleb 전화 데이터에 대한 벤치마크 결과 포함)을 시작 템플릿으로 사용하는 것이 좋습니다.
- **공소 및 법적 증거 수집**: 오디오 증거에서 다양한 화자를 식별하고 분리하여 증거 분석을 지원합니다. **검증 초점**: 법적 준수 요구 사항에 따른 해석 가능성 - 스펙트럼 클러스터링 결과의 분리 경계를 추적할 수 있어야 합니다. 현재 3D-Speaker의 클러스터링 프로세스는 상세한 신뢰도 출력을 제공하지 않으며, 증거 수집 프로세스에서 수동 검토가 보완되어야 합니다. 이 시나리오는 화자 수에 대한 사전 지식에 크게 의존합니다(대부분의 클러스터링 알고리즘은 화자 수를 미리 설정하거나 복잡한 추정기를 사용해야 함). 2단계에서는 선호도 전파와 같은 자동 추정 클러스터링 알고리즘을 사용하는 것이 좋습니다.
## 3D-Speaker 적용그룹
3D-Speaker는 전문가 수준의 오픈 소스 도구로 자리잡고 있으며, 사용자 프로필은 일반 최종 소비자가 아닌 음성 기술 분야의 개발자 및 연구원에 중점을 두고 있습니다.
- **음성 기술 개발자 및 통합자**: 성문 인식 기능을 제품에 통합해야 하는 기술 팀. Pipeline을 사용하는 것이 좋습니다. ModelScope를 직접 사용하여 직접 학습할 필요 없이 추론을 위해 사전 학습된 모델을 로드할 수 있습니다. 일반적인 통합 주기는 약 2~4주입니다(모델 검증 및 API 패키징 포함). **경계에 적합하지 않음**: Python/Shell 프로그래밍 및 딥 러닝 기반에 대한 명확한 요구 사항이 있으며 AI 엔지니어링 경험이 없는 프런트 엔드 또는 풀 스택 개발자에게는 적합하지 않습니다. 순수 HTTP API 호출이 필요하고 자체 배포를 허용하지 않는 경우 상용 성문 인식 API를 평가해야 합니다.
- **AI 연구원(화자 인식 방향)** : 성문 인식, 음성 생체 인식, 자기주도 표현 학습에 종사하는 연구원입니다. 3D-Speaker는 3D-Speaker, VoxCeleb 또는 CNCeleb 데이터 세트에서 SOTA 결과를 신속하게 재현할 수 있는 전체 교육 레시피 및 벤치마크 세트를 제공합니다. **전제 조건**: PyTorch 및 딥 러닝 교육 프로세스에 익숙합니다. 자신의 개인 데이터에 대한 사전 학습을 위해 RDINO 또는 SDPN 자체 감독 방식을 사용하는 것이 좋습니다.
- **금융/보안 기술팀**: 신원 인증 또는 오디오 포렌식 시나리오에서 성문 확인 기능이 필요한 엔터프라이즈 팀. 권장 경로: 먼저 사전 훈련된 모델을 사용하여 대상 장면 데이터(특정 마이크, 주변 소음)에 대해 POC를 수행하고 정확도 요구 사항이 충족되는지 확인한 다음 프로덕션 통합에 적용합니다. **부적합 경계**: 완전한 생체 감지(스푸핑 방지) 기능이 필요한 시나리오는 3D-Speaker 자체에서 제공되지 않으며 ASVspoof 또는 기타 스푸핑 방지 엔진을 추가로 통합해야 합니다.
- **스마트 하드웨어 및 IoT 팀**: 스마트 스피커, 웨어러블 장치 및 차량 시스템에 최종 성문 인식을 배포합니다. CAM++ 모델은 7.2M 매개변수의 경량 이점을 통해 리소스가 제한된 엣지 장치에 적합합니다. **전제 조건**: 모델 정량화 및 ONNX/TensorRT 배포 경험이 필요합니다.
- **회의 시스템 및 공동 작업 도구 개발자**: 회의 제품 경험을 개선하기 위해 자동 발언자 로깅 기능이 필요한 팀. 분할 레시피로 시작하고 사전 훈련된 모델 + 스펙트럼 클러스터링을 사용하여 POC를 완료하는 것이 좋습니다. **부적합한 경계**: 실시간 요구 사항이 매우 높은 스트리밍 시나리오(지연 <500ms) - 현재 분할 파이프라인에서는 클러스터링을 수행하기 위해 완전한 오디오가 필요하며 프레임별 출력 스트리밍 처리에는 적합하지 않습니다. 스트리밍 솔루션이 필요한 경우 클러스터링 알고리즘을 온라인 버전으로 수정해야 합니다.
**전역 부적합 경계 요약**: 3D-Speaker는 ASR(음성 텍스트 변환), TTS(음성 합성) 또는 NLU(자연어 이해) 기능을 제공하지 않으며 완전한 음성 상호 작용 시스템을 구축하려면 다른 음성 모듈과 결합해야 합니다. 8kHz 전화 채널, 강한 배경 소음(신호 대 잡음비 <10dB), 어린이 또는 노인 화자와 같은 롱테일 시나리오에서의 인식 성능은 대상 데이터에 대한 실제 측정을 통해 검증해야 합니다. GPU 오프라인 추론을 사용하지 않으면 CPU ONNX 추론의 대기 시간이 수백 밀리초에 이를 수 있으며 이는 동시성이 높은 실시간 시나리오에 적합하지 않습니다.
## 요약 및 전망
3D-Speaker는 중국 성문 인식 오픈 소스 커뮤니티에서 "데이터 세트 + 툴킷" 통합이라는 고유한 생태학적 틈새 시장을 구축했습니다. pyannote.audio(연구 기반 분할에 중점을 둡니다) 및 WeSpeaker(화자 인식 기준에 중점을 둡니다)와 달리 3D-Speaker의 초점은 대규모 다차원 데이터 세트에서 재현 가능한 산업 등급 벤치마크까지 완전한 링크를 제공하는 것입니다. 핵심 가치는 세 가지 문장으로 요약할 수 있습니다. 3D 스피커 데이터 세트를 사용하여 중국 다중 장치/다거리/다중 방언 성문 데이터의 공백을 메웁니다. ERes2NetV2 및 CAM++와 같은 모델을 사용하여 여러 벤치마크에서 EER 기록을 지속적으로 새로 고칩니다. Apache 2.0 오픈 소스 프로토콜을 사용하여 성문 인식 기술의 상용 임계값을 낮춥니다.
**현재 주요 제한 사항**: 첫째, GitHub 저장소에는 공식 릴리스 및 의미 체계 버전 번호가 없습니다. 사용자가 버전 번호를 통해 코드의 안정성과 변경 범위를 평가하기는 어렵습니다. 프로덕션 사용자는 특정 커밋을 잠가야 합니다. 둘째, 사전 훈련 모델은 주로 16kHz 샘플링 속도를 사용하는 중국어 및 영어 시나리오를 지향하며 8kHz 전화 음성 및 자원이 적은 언어의 적용 범위가 제한되어 있습니다. 셋째, 스푸핑 방지 기능을 제공하지 않으며, 금융 수준 신원 인증 시나리오에는 추가적인 생체 탐지 솔루션이 통합되어야 합니다. 넷째, 문서는 주로 중국어로 되어 있고(README는 영어로 되어 있음) 국제 커뮤니티 구축은 아직 초기 단계이며 영어 기술 블로그와 튜토리얼 리소스가 거의 없습니다. 다섯째, 공식적인 Docker 이미지 및 CI 빌드 상태 식별이 없으며 사용자가 컨텍스트 일관성 문제를 스스로 해결해야 합니다.
**후속 발전 방향**: GitHub 활동(2026-07년 기준으로 여전히 새로운 커밋이 있음)과 ICASSP 2025 논문 승인으로 판단하면 3D-Speaker 팀은 여전히 투자를 계속하고 있습니다. 주목할만한 진화 방향에는 클라이언트 측 추론의 추가 최적화(TFLite/CoreML 내보내기 실행 가능), 스트리밍 분할 지원(현재 오프라인 클러스터링만 지원), 리소스가 더 적은 언어를 위한 다국어 확장, ModelScope 생태계와의 심층 통합(예: AutoML 자동 매개변수 조정)이 포함됩니다.
**조달 및 채택 위험 평가**: Apache 2.0 오픈 소스 프로젝트인 3D-Speaker는 인증 위험 및 공급업체 종속 위험이 없으며 성문 인식 기능을 위한 초보 수준 검증 및 프로토타입 개발 플랫폼으로 적합합니다. 기업 통합은 "3단계 방법"을 채택해야 합니다. 첫 번째(2~4주): 사전 훈련된 모델을 사용하여 대상 장면 데이터(대상 마이크, 주변 소음 샘플, 대상 스피커 크기)에 대한 POC를 수행하여 EER이 비즈니스 임계값을 충족하는지 확인합니다. 두 번째(4~8주): POC가 표준을 충족하는 경우 격리된 환경(비프로덕션)에서 ONNX 내보내기 및 API 패키징을 완료하고 기존 ASR/NLP 파이프라인과 통합합니다. 세 번째(지속적): 그레이스케일이 온라인화된 후 환경 생산을 모니터링합니다. EER 드리프트(예: 새로 등록된 사용자 또는 새 시나리오로 인한 배포 변화) 및 GitHub Commit 업데이트 빈도에 주의합니다. 6개월 이상 활성 커밋이 없는 경우 선택해야 하는 대체 도구가 있는지 평가해야 합니다. 규정 준수에 민감한 산업(금융, 보안)에서 사용하기 전에 ModelScope 플랫폼 모델 가중치(Apache 2.0과 다를 수 있음)의 사용 약관과 데이터 세트의 CC BY-SA 4.0 계약이 상업적 파생 저작물에 적용되는지 확인해야 합니다.
관련 도구: elevenlabs, udio
버전 정보
- 분할 벤치마크 업데이트 :Aishell-4, Alimeeting, AMI, VoxConverse 등과 같은 여러 공개 데이터 세트에서 재현 가능한 DER 벤치마크 결과를 제공하기 위해 스피커 로그(Diarization) 레시피를 업데이트했습니다. 아직 공식적인 정확한 날짜는 없습니다.
- ERes2NetV2 릴리스 :200k 화자 데이터 세트를 기반으로 더 적은 매개변수와 더 빠른 추론을 통해 훈련된 ERes2NetV2 및 ERes2NetV2_w24s4ep4 사전 훈련된 모델을 출시했습니다. 아직 공식적인 정확한 날짜는 없습니다.
- 다중 모드 및 SSL 확장 :SDPN 자체 감독 모델 X-벡터 훈련 레시피, 시각적 모듈(TalkNet) 및 의미론적 모듈(BERT) 훈련 레시피를 출시했습니다. 아직 공식적인 정확한 날짜는 없습니다.
- ONNX 런타임 및 Eres2NetV2 VoxCeleb :ONNX Runtime 추론 런타임이 출시되었습니다. VoxCeleb 데이터 세트를 기반으로 ERes2NetV2 모델을 출시했습니다. 아직 공식적인 정확한 날짜는 없습니다.
- 언어 ID 및 다중 모드 분할 :음소정보를 융합한 언어인식 공식을 공개합니다. 오디오와 비디오 이미지를 융합하는 다중 모드 스피커 로그 공식을 게시합니다. 아직 공식적인 정확한 날짜는 없습니다.
- ResNet 및 Res2Net 레시피 :3D-Speaker, VoxCeleb 및 CN-Celeb 데이터 세트에서 ResNet34 및 Res2Net의 교육 및 추론 레시피를 공개합니다. 마진이 큰 미세 조정 레시피를 공개합니다. 아직 공식적인 정확한 날짜는 없습니다.
- ERes2Net-Base 사전 훈련됨 :200,000명의 중국어 북경어 데이터세트로 훈련된 ERes2Net 기반 사전 훈련 모델을 출시했습니다. 아직 공식적인 정확한 날짜는 없습니다.
- 핵심 모델 출시 :CAM++, ERes2Net-Base 및 ERes2Net-Large 사전 훈련 모델 출시 대화 감지 및 의미론적 화자 전환 감지 모듈을 출시했습니다. 아직 공식적인 정확한 날짜는 없습니다.
- 데이터 세트 및 최초 릴리스 :3D-Speaker 데이터 세트와 ERes2Net, CAM++, RDINO 등의 기준 모델 및 벤치마크를 공식 출시했습니다. 아직 공식적인 정확한 날짜는 없습니다.
사용자 후기