FunASR
무료
FunASR은 Alibaba Tongyi Lab의 오픈 소스 산업용 음성 인식 툴킷입니다. ASR, VAD, 구두점 복구, 화자 분리, 감정 감지 및 오디오 이벤트 인식을 통합합니다. 통합 Python 인터페이스와 OpenAI 호환 API를 제공하고 50개 이상의 언어로 340배 실시간 속도 추론을 지원하며 배포를 위해 완전히 민영화될 수 있습니다.
FunASR: Alibaba Tongyi Lab의 오픈 소스 산업 등급 음성 인식 툴킷
FunASR의 핵심 매개변수 및 통계
| 프로젝트 | 세부정보 |
|---|---|
| 제품명 | FunASR(재미있는 오디오 음성인식) |
| 제품 유형 | 오픈 소스 음성 인식 툴킷 |
| 배송 양식 | Python SDK / CLI / OpenAI 호환 API 서버 / Docker / llama.cpp 엣지 배포 |
| 지원되는 언어 | 50개 이상의 언어(Fun-ASR-Nano는 중국어/영어/일본어 및 중국어 방언을 지원하고, MLT-Nano는 31개 언어를 지원하고, Qwen3-ASR은 52개 언어를 지원합니다) |
| 모델 사이즈 | 0.4M(fsmn-vad) ~ 1.7B(Qwen3-ASR) |
| GitHub 스타 | 19.3k |
| 오픈소스 계약 | MIT(툴킷); 모델 중량은 해당 계약에 따라 라이센스가 부여됩니다 |
| 대상 사용자 | 개발자, 기업 AI 팀, 음성 제품 통합업체 |
FunASR은 단일 SaaS 제품이 아니라 완전한 오픈 소스 음성 이해 도구 체인입니다. 원시 오디오에서 구조화된 텍스트(VAD 분할 ASR 인식, 구두점 복구, 화자 분리, 감정 감지, 오디오 이벤트 인식)까지 '엔드 투 엔드 파이프라인'을 'AutoModel' API 호출의 단일 라인을 통해 제공합니다. 개발자는 오디오 데이터를 타사 API 서비스로 전송하지 않고도 로컬, 인트라넷 또는 클라우드에서 독립적으로 배포할 수 있습니다.
주요 정량적 지표: Fun-ASR-Nano + vLLM 추론은 340x 실시간 속도(RTF)에 도달할 수 있고, SenseVoiceSmall은 CPU에서 17x 실시간 속도에 도달할 수 있으며, CER은 7.81%-8.20%로 낮습니다. 이는 둘 다 Whisper-large-v3의 20% CER 및 13x 실시간 속도보다 우수합니다.
FunASR의 사용자 및 시장 인지도
- GitHub 19.3k Stars, 178명의 기여자, 25개의 공식 릴리스는 GitHub에서 가장 활동적인 오픈 소스 ASR 툴킷 중 하나입니다.
- PyPI 월별 다운로드는 계속 증가하고 있으며 'funasr' 패키지는 Python ASR 생태계의 핵심 종속성 중 하나가 되었습니다.
- 기업 채택: RAGFlow, Dify, LangChain 및 AutoGen과 같은 주류 AI 프레임워크에 의해 음성 입력 모듈로 통합되었습니다. 커뮤니티는 30개 이상의 통합 프로젝트를 축적했습니다.
- 업계 벤치마킹: 중국 ASR 시나리오에서 FunASR의 CER 및 실시간 비율은 Whisper 시리즈보다 종합적으로 앞서 있으며(중국어 단어 오류율은 약 60% 낮고 CPU 추론 속도는 10~20배 높음) Whisper에는 없는 화자 분리, 감정 감지 및 기타 기능을 지원합니다.
FunASR의 비용 이점
| 비용 차원 | 설명 |
|---|---|
| 오픈 소스 및 무료 | 핵심 툴킷 MIT 라이센스, 라이센스 비용 없음, API 호출 비용 없음 |
| 개인 배포 | 데이터 유출 위험이 없고 종량제 청구에 대한 부담 없이 인트라넷/단일 시스템에서 완전히 오프라인으로 실행 가능 |
| 하드웨어 임계값 | SenseVoiceSmall은 GPU 없이 CPU에서 17배의 실시간 속도를 달성할 수 있습니다. Fun-ASR-Nano는 8GB 이상의 GPU를 권장합니다 |
| 속삭임 API 비교 | 클라우드 ASR 서비스는 분당 약 $0.006입니다. FunASR 자체 구축 비용은 하드웨어 감가상각비와 전기료뿐입니다. 이는 고주파 시나리오에서 90% 이상을 절약할 수 있습니다 |
비교 분석: 하루 1,000시간의 오디오를 처리하는 중~고주파 시나리오의 경우 클라우드 ASR 사용에 대한 월별 요금은 약 $10,800+인 반면, FunASR의 자체 구축 배포에는 일회성 하드웨어 투자만 필요하며(GPU가 있는 서버 비용은 약 $3,000-$8,000) 후속 한계 비용은 0에 가깝습니다. 개인 정보 보호에 민감한 시나리오(의료, 금융, 법률)의 경우 민영화된 배포의 가치를 가격으로 측정할 수 없습니다.
FunASR의 주요 기능
- 다중 모델 ASR 인식: Fun-ASR-Nano(중국어/영어/일본어 + 사투리), SenseVoiceSmall(5개국어 + 감정 + 이벤트), Paraformer(스트리밍/오프라인), Qwen3-ASR(52개국어), Whisper 등을 통합하고 동일한 API로 모델을 전환합니다.
- 음성 활동 감지(VAD): 밀리초 수준 fsmn-vad, 적응형 무음 임계값, 긴 오디오의 자동 분할.
- 구두점 복구 및 역 텍스트 정규화:
ct-punc모델은 구두점을 자동으로 추가하고 직접 읽을 수 있는 표준 텍스트를 출력합니다. - 화자 분할: CAM++ 모델은 "누가 언제 무엇을 말했는지"에 자동으로 주석을 달고 다자간 회의를 지원합니다.
- 감정 감지 및 오디오 이벤트 인식: SenseVoice에는 감정 인식(기쁨/슬픔/화남/중립) 및 이벤트 감지(박수/웃음/음악/울음)가 내장되어 있습니다.
- OpenAI 호환 API 서비스: 'funasr-server' 한 줄 명령으로 RESTful 서비스를 시작합니다. SDK는 OpenAI Audio API와 호환되며 LangChain/Dify/AutoGen에 직접 연결됩니다.
- AI 에이전트용 MCP 서버: Claude/Cursor와 같은 에이전트는 로컬 ASR 기능을 직접 호출할 수 있습니다.
- 에지 배포(llama.cpp/GGUF): Python 컨텍스트가 필요하지 않으며 단일 바이너리가 CPU/에지 장치에서 실행되고 Windows CUDA를 지원합니다.
FunASR 모델 및 버전 진화
FunASR 프로젝트는 2022년에 시작되었으며 원래 Alibaba Damo Academy에서 엔드투엔드 음성 인식 툴킷으로 출시되었습니다(INTERSPEECH 2023 논문). 2025~2026년은 빠른 반복 기간에 진입합니다.
| 버전 | 날짜 | 핵심 변경 사항 |
|---|---|---|
| v1.3.19 | 2026-07-19 | WebSocket 장기 세션 문제 해결 문서; CLI SRT 분할 자막 개선 |
| v1.3.16 | 2026-07-18 | 클라이언트 기반 실시간 엔드포인트; llama.cpp Windows CUDA 패키지 |
| v1.3.12 | 2026-06-21 | Qwen3-ASR / GLM-ASR 수정 |
| v1.3.3 | 2026-05-24 | funasr-서버 CLI, OpenAI API, MCP 서버, 동적 VAD |
| v1.3.0 | 2026-05-20 | Qwen3-ASR(52개 언어), GLM-ASR-Nano(17개 언어) 지원 |
| v1.2.x | 2025-2026 | Fun-ASR-Nano, vLLM 추론 엔진 llama.cpp 에지 런타임 |
| v1.0 | 2024년 | 첫 번째 안정 버전, Paraformer/SenseVoice 통합 |
| v0.x | 2022-2023 | 초기 버전, 기본 ASR 및 교육 프레임워크 |
FunASR의 기술적 장점
단일 모델 대신 툴킷: Whisper와 같은 단일 모델 솔루션과 달리 FunASR은 "모델 슈퍼마켓"입니다. 각 하위 작업(VAD, ASR, 구두점, 화자 분리, 감정)에 대한 전용 모델이 있으며 자유롭게 결합할 수 있습니다. 예를 들어 프로덕션 파이프라인 SenseVoice + fsmn-vad + ct-punc + cam++는 한 번의 호출로 모든 처리를 완료합니다.
추론 효율성 억제:
- Fun-ASR-Nano + vLLM: 실시간 속도 340배(Whisper-large-v3보다 26배 빠름), CER 8.20%
- SenseVoiceSmall: CPU에서 실시간 17배(GPU의 Whisper보다 빠름), CER 7.81%
- 비자동 회귀 아키텍처(Paraformer): 스트리밍 시나리오에서 첫 번째 단어 지연이 매우 낮고 WebSocket 실시간 인식을 지원합니다.
배포 유연성: "pip 설치"부터 Docker/Kubernetes 컨테이너화, llama.cpp 단일 바이너리 CPU/에지 배포까지 전체 스펙트럼을 포괄합니다. funasr-server는 OpenAI 호환 API를 제공합니다. 기존 SDK가 있는 애플리케이션은 base_url만 변경하면 됩니다.
에이전트 기본 지원: 내장 MCP 서버 및 OpenAI API, Claude Desktop, Cursor, LangChain, Dify, AutoGen 등과 같은 AI 에이전트 프레임워크는 음성 기능을 직접 통합하여 음성 기반 자동화된 워크플로를 실현할 수 있습니다.
FunASR 사용법
| 입구 | 설명 |
|---|---|
| 파이썬 SDK | pip install funasr, AutoModel 한 줄 호출 |
| CLI | funasr audio.wav 직접 전사, JSON/SRT/TSV 출력 지원 |
| API 서버 | funasr-server --device cuda는 OpenAI 호환 엔드포인트를 시작합니다 |
| 도커 | 오프라인/스트리밍 Docker 이미지, 한 줄 시작 |
| 라마.cpp | 단일 바이너리 CPU/에지 배포, Python 런타임 필요 없음 |
Python 빠른 시작: ``파이썬 funasr import AutoModel에서
모델 = AutoModel(model="sensevoice", vad_model="fsmn-vad", punc_model="ct-punc", spk_model="cam++", device="cuda") 결과 = model.generate(input="meeting.wav", 배치_크기_s=300) 결과[0]["sentence_info"]의 세그먼트에 대해: print(f"[{seg['start']/1000:.1f}s] 스피커 {seg['spk']}: {seg['text']}")
**API 서비스 시작**:
``배쉬
pip 설치 funasr vllm fastapi uvicorn python-multipart
funasr-서버 --device cuda --port 8899
# 전화
컬 -X POST http://localhost:8899/v1/audio/transcriptions \
-F "파일[email protected]" -F "모델=fun-asr-nano" -F "response_format=verbose_json"
MCP 마운트(Claude 데스크탑): ``json { "mcp서버": { "funasr": { "명령": "funasr-서버", "args": ["--mcp", "--port", "8899"] } } }
## FunASR 제품 가격
FunASR 핵심 툴킷은 **MIT 오픈 소스 라이센스**를 채택하고 완전 무료이며, 숨겨진 요금도 없고, 통화 수 제한도 없으며, 기능적 약화도 없습니다. 기업은 라이센스 비용을 지불하지 않고도 소스 코드를 기반으로 2차 개발 및 상용 통합을 수행할 수 있습니다.
모델 가중치는 독립적인 라이센스 계약을 채택합니다. 대부분의 모델(SenseVoice, Paraformer, fsmn-vad, ct-punc, cam++, emotion2vec)은 무료로 상업적으로 사용할 수 있습니다. 세부 사항은 각 모델 카드의 라이센스에 따릅니다.
**숨겨진 비용 평가**:
- GPU 서버 하드웨어 비용(Fun-ASR-Nano에는 8GB+ VRAM 권장, CPU에는 SenseVoiceSmall 사용 가능)
- 운영 및 유지관리 비용(Docker/K8s 배포 및 유지관리)
- vLLM 가속을 사용하는 경우 추가 vLLM 종속성을 설치해야 합니다.
상용 클라우드 ASR(예: Alibaba Cloud 음성 인식 Azure Speech, Whisper API)과 비교하여 하루 평균 100시간의 오디오를 처리하는 시나리오에서 FunASR의 자체 구축 배포는 3~6개월 내에 하드웨어 비용을 회수할 수 있습니다.
## FunASR의 응용 시나리오
- **회의 기록 및 지능형 회의록**: 기업 회의 오디오를 스피커 태그가 포함된 구조화된 텍스트로 자동 변환하고 RAG 지식 기반을 통합하여 "음성 질문 및 답변"을 구현합니다. 수동 전사에 비해 효율성이 10~20배 증가합니다.
- **영상 자막 및 콘텐츠 제작**: 실시간 처리 속도 170~340배의 SRT/TSV 자막 내보내기를 지원합니다. 새로운 미디어 운영이 비디오 코퍼스를 일괄 처리하는 경우 1시간짜리 비디오에 대해 약 10~20초 안에 전사가 완료될 수 있습니다.
- **고객 서비스 품질 점검 및 감정 분석**: SenseVoice는 사용자의 감정 상태와 주요 오디오 이벤트(예: 싸움, 불만 에스컬레이션 등)를 자동으로 감지하고 품질 점검팀이 무작위 점검 적용률을 5%에서 100%로 높일 수 있도록 지원합니다.
- **AI 음성 에이전트/어시스턴트**: MCP 서버 또는 OpenAI API를 통해 Claude/Cursor/Dify와 같은 에이전트 프레임워크에 연결하여 AI 어시스턴트에게 로컬 음성 입력 기능을 제공하고 음성 데이터의 외부 전송을 방지합니다.
- **의료/금융/법률 음성 녹음**: 100% 민영화 배포, 오디오 데이터가 인트라넷 외부로 유출되지 않으며 HIPAA/MLI 규정 준수 요구 사항을 충족합니다.
**경계에 맞지 않음**:
- 실시간 통신 시나리오(예: 전화 회의의 실시간 전사)의 경우 Paraformer 스트리밍 엔드포인트를 사용하고 첫 단어 지연을 최적화하는 것이 좋습니다.
- 매우 작은 언어(예: 아프리카/아메리카 원주민 언어)는 스스로 훈련하거나 Qwen3-ASR을 사용해야 하며 적용 범위가 불완전할 수 있습니다.
- 매우 높은 인식 대기 시간(<50ms)이 필요한 대화형 장면에는 스트리밍 VAD 및 Paraformer의 맞춤 최적화가 필요합니다.
## FunASR 적용 그룹
- **AI 애플리케이션 개발자**: 음성 기능을 제품에 통합해야 합니다. FunASR은 매우 낮은 통합 비용으로 Python SDK 및 OpenAI 호환 API를 제공합니다. 클라우드 ASR 서비스를 대체하고 장기 API 비용을 절감합니다.
- **엔터프라이즈 AI 팀**: 데이터 개인 정보 보호 및 규정 준수에 대한 엄격한 요구 사항이 있는 산업(의료, 금융, 법률)에서는 FunASR의 민영화 배포 기능이 시급히 필요합니다. 모델 선택 및 하드웨어 계획에 대한 평가를 우선적으로 수행하는 것이 좋습니다.
- **음성 제품 통합자**: ASR 파이프라인을 사용자 정의해야 하는 ISV/SI입니다. FunASR의 모듈식 아키텍처는 모든 구성 요소의 교체를 허용하고 미세 조정을 지원합니다.
- **개인 개발자 및 연구원**: MIT 라이선스는 학문적 연구에 대한 제한 없이 무료 사용 및 2차 개발을 허용합니다. Colab Quick Start를 사용하면 첫 번째 식별 작업을 5분 만에 완료할 수 있습니다.
- **시나리오에 적합하지 않음**: 코드가 없거나 기술적 지식이 없는 사용자가 직접 사용하며 현재 주로 Python/CLI/API를 통해 상호 작용하며 그래픽 인터페이스가 없습니다. 엔드투엔드 SaaS 기본 사용이 필요한 시나리오에서는 타사 UI 패키징을 사용하는 것이 좋습니다.
## FunASR 개요 및 전망
FunASR은 현재 오픈 소스 커뮤니티에서 가장 완벽하고 진보된 산업용 음성 인식 툴킷입니다. 핵심 경쟁력은 "다중 모델 조합 + 궁극적인 추론 효율성 + 전체 스펙트럼 배포 솔루션"의 삼위일체에 있습니다. 개발자는 시나리오에 따라 ASR/VAD/구두점/화자 분리 모델을 자유롭게 결합하고 vLLM을 통해 340x 실시간 속도를 달성하며 Python SDK/OpenAI API/MCP/llama.cpp 등 어떤 방식으로든 배포할 수 있습니다.
**현재 제한사항**:
- 문서와 튜토리얼은 여전히 영어와 중국어가 중심이며, 일본어/한국어 문서는 준비 중입니다.
- 일부 모델(Fun-ASR-Nano)은 GPU에서 실행하는 것이 권장되며, CPU는 사용 가능하지만 SenseVoiceSmall을 선택해야 합니다.
- 실시간 WebSocket 서비스는 여전히 높은 동시성 시나리오에서 특정 하드웨어에 대한 매개변수를 조정해야 합니다.
**획득/채택 위험 평가**: FunASR은 오픈 소스이며 무료이며 MIT 라이센스가 있으며 채택 위험이 매우 낮습니다. 기업 배포 전에 대표 오디오 데이터에 대해 CER 및 RTF 벤치마크 테스트를 수행하고 가장 적합한 모델 조합을 선택하는 것이 좋습니다(검증을 위해 SenseVoiceSmall로 시작하는 것이 좋습니다). 장기적인 의존의 위험은 주로 커뮤니티 유지 관리의 연속성에서 비롯되지만 Alibaba Tongyi Lab 및 ModelScope의 지속적인 투자(2025~2026년 월 평균 2~3회 버전 업데이트)는 좋은 보호를 제공합니다. 상업적 지원이 필요한 기업의 경우 Alibaba Cloud 음성 인식 제품을 대안으로 고려할 수 있습니다. **요약: 기본 ASR 엔진인 FunASR은 기술적 지표 및 규정 준수 자유 측면에서 폐쇄 소스 클라우드 API 및 Whisper의 자체 구축 솔루션보다 우수하며 "음성-텍스트" 인프라 계층에서 선호되는 오픈 소스 툴킷입니다. **
관련 도구: <a href="https://www.aistarmap.com/ko-KR/aitool/elevenlabs" target="_self" class="tool-link"><img src="https://res.aistarmap.com/uploads/images/tools/zh-CN/elevenlabs/logo_1785767412.svg" alt="일레븐랩스" class="tool-logo" style="width: 20px; height: 20px; margin-right: 5px; vertical-align: middle;">일레븐랩스</a>, udio
버전 정보
- v1.3.19 :실시간 WebSocket 장기 세션 문제 해결 문서가 추가되었습니다. CLI SRT/TSV 자막 출력 개선; 클라이언트 기반 실시간 엔드포인트는 Fun-ASR-Nano를 지원합니다.
- v1.3.18 :CLI SRT/TSV 자막 출력은 문장 타임스탬프를 사용하여 분할된 자막 프롬프트를 작성합니다.
- v1.3.16 :서버 측 VAD 없이 스트리밍 인식을 위해 클라이언트 기반 실시간 WebSocket 엔드포인트를 추가했습니다.
- v1.3.12 :Qwen3-ASR 언어 코드 수정 GLM-ASR vLLM 반복_페널티 수정.
- v1.3.3 :funasr-server CLI, OpenAI 호환 API, AI 에이전트용 MCP 서버 및 Dynamic VAD가 추가되었습니다.
사용자 후기