Fun-ASR1.5
무료
Fun-ASR1.5는 Alibaba Tongyi 팀이 출시한 대규모 엔드투엔드 음성 인식 모델입니다. MoE 아키텍처를 기반으로 하는 단일 모델은 30개 언어, 7개 주요 방언 시스템 및 20개 이상의 현지 악센트를 지원하며 지능형 구두점 예측 및 텍스트 정규화 기능이 내장되어 있습니다.
Fun-ASR1.5: Alibaba Tongyi 엔드투엔드 음성 인식 모델
Fun-ASR1.5의 핵심 매개변수 및 통계
| 프로젝트 | 세부정보 |
|---|---|
| 제품명 | Fun-ASR1.5(Alibaba Tongyi 음성 인식 모델) |
| 제품 유형 | 엔드투엔드 음성인식 대형모델 |
| 배송 양식 | Python 라이브러리/API/CLI/MCP 서버 |
| 지원되는 언어 | 30개 언어(중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 스페인어, 포르투갈어, 러시아어, 아랍어 등) |
| 방언 적용 범위 | 상하이어, 광동어, 쓰촨어 등 수요가 높은 15개 방언 최적화에 중점을 둔 7대 방언 시스템 |
| 건축 | MoE(혼합 전문가 아키텍처) |
| 최신 버전 | FunASR 1.3.19(2026-07-19) |
| 오픈소스 계약 | MIT(툴킷) / 모델 중량은 별도 계약 |
| GitHub 스타 | 19.3k |
| 대상 사용자 | 개발자, 기업, 연구 기관 |
매개변수 해석: 30개 언어를 포괄하는 단일 모델은 배포 중에 각 언어에 대해 별도의 모델 인스턴스를 유지할 필요가 없음을 의미합니다. MoE 아키텍처는 특정 언어가 인식될 때만 해당 전문가 모듈이 활성화되도록 보장하며, 동일한 규모의 밀집 모델보다 추론 효율성이 더 높습니다. 방언 오류율(CER)은 이전 버전에 비해 56.2% 감소하여 실제 시나리오에서 수동 교정 비용을 크게 줄일 수 있습니다.
Fun-ASR1.5의 사용자 및 시장 인지도
Fun-ASR1.5 뒤에는 Alibaba Damo Academy의 오픈 소스 FunASR 프로젝트(GitHub 19.3k Stars)가 있습니다. 현재 중국 음성 인식 커뮤니티에서 가장 활동적인 엔드투엔드 툴킷 중 하나입니다. PyPI의 누적 다운로드에는 178명 이상의 커뮤니티 기여자와 함께 수많은 개인 개발자와 기업 사용자가 포함되었습니다.
벤치마크 테스트에서 Fun-ASR-Nano(Fun-ASR1.5 시리즈의 주력 모델)는 중국 긴 오디오 테스트 세트에서 단어 오류율(CER) 8.20%를 달성했는데, 이는 Whisper-large-v3-turbo의 21.71%보다 훨씬 낮습니다. 추론 속도는 실시간(vLLM 적용) 340배에 달해 위스퍼(Whisper)보다 26배 이상 향상됐다. SenseVoiceSmall 모델은 CPU에서 17배 실시간 추론을 달성할 수 있으며 GPU 없이도 프로덕션 수준 처리량을 충족할 수 있습니다.
이 프로젝트는 회의록, 지능형 고객 서비스, 음성 검색, 자막 생성, 온라인 교육 등의 시나리오에서 널리 사용되었습니다. 기업 수준의 사용자는 Alibaba Cloud Bailian 플랫폼을 통해 API를 직접 호출할 수 있습니다.
Fun-ASR1.5의 비용 이점
Fun-ASR1.5는 완전한 오픈 소스 프로젝트이며 핵심 장점은 라이선스 비용이 전혀 들지 않는다는 점입니다.
| 비용 차원 | 설명 |
|---|---|
| 툴킷 사용법 | MIT 라이센스, 완전 무료이며 상업적 용도로 사용 가능 |
| 모델 체중 | 모델 카드 계약에 따라 대부분 상업적 용도로 무료로 제공됩니다 |
| API 호출(Alibaba Cloud Bailian) | 선불결제는 Alibaba Cloud 실시간 견적을 참고하세요 |
| 개인 배포 | 자체 서버 구축 및 인프라 비용만 부담 |
| 경쟁제품 비교(Whisper API) | 자체 배포 시 추론 속도가 26배 더 빠르고, 동일한 처리량에서 하드웨어 비용이 크게 절감됩니다 |
C 측 비용: Moda Community를 통한 온라인 경험은 완전히 무료이며 로컬 배포에는 GPU가 있는 머신만 필요합니다(CPU는 SenseVoiceSmall 모델도 실행할 수 있음). 비즈니스 최종 비용: 기업은 Alibaba Cloud Bailian API에 대해 종량제 방식으로 지불하거나 비공개로 배포하여 데이터가 도메인 외부로 유출되는 것을 방지할 수 있습니다. 자체 배포 모드에서 Fun-ASR1.5의 추론 효율성은 동일한 하드웨어에서 Whisper보다 훨씬 더 높은 동시성을 전달할 수 있습니다.
Fun-ASR1.5의 주요 기능
-
다국어 인식: 단일 모델로 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 스페인어, 포르투갈어, 러시아어, 아랍어 등 30개 언어를 지원합니다. 각 언어에 대해 독립적인 모델을 배포할 필요가 없습니다. 다국적 회의 및 다국어 콘텐츠 제작 시나리오에 적합합니다.
-
자동 언어 전환(코드 전환): 언어 태그를 미리 설정할 필요가 없으며 동일한 대화에서 다국어 혼합 음성을 자동으로 인식하고 처리합니다. 이는 중국어와 영어가 혼합되어 있는 비즈니스 회의 및 기술 팟캐스트와 같은 시나리오에 매우 실용적이므로 지루한 수동 분할 주석이 필요하지 않습니다.
-
방언 및 악센트 인식: 7개 주요 방언 체계와 20개 이상의 현지 악센트를 다루며, 상하이어, 광동어, 쓰촨어, 호키엔어 등 수요가 높은 15개 방언을 최적화하는 데 중점을 둡니다. 사투리 문자 오류율이 전 버전 대비 56.2% 감소하여 사투리 본래의 문자 복원을 지원합니다.
-
고대 시 낭송 인식: "시경", "초자", 이백과 두보의 시, 소시와 신기지의 시 등 고전 텍스트를 포함하는 실제 낭송 코퍼스를 문자 수준 정확도 97%로 구축했습니다. 이는 중국학 교육과 문화유산의 디지털 시나리오에 독특한 가치를 지닌다.
-
지능형 후처리: 문맥적 의미에 따라 쉼표, 마침표, 물음표 등의 구두점을 자동으로 삽입하고, 음성 숫자, 날짜, 금액, 전화 통화 등을 표준화된 서면 형식으로 자동 변환합니다. 이 기능을 사용하면 회의록, 법적 기록 등의 시나리오에 대한 제작 후 수동 편집 시간을 크게 줄일 수 있습니다.
Fun-ASR1.5 모델 및 버전 진화
Fun-ASR1.5는 계속해서 반복되는 오픈 소스 프로젝트입니다. 최신 메인 버전은 FunASR 1.3.19(2026-07-19 출시)입니다. 핵심 진화 과정은 다음과 같습니다.
| 버전 | 날짜 | 주요 변경 사항 |
|---|---|---|
| FunASR 1.3.19 | 2026-07-19 | PyPI 문서에 패키지된 실시간 WebSocket 장기 세션 진단 로그 |
| FunASR 1.3.18 | 2026-07-19 | CLI 자막 분할 회귀 수정, SRT 출력이 문장별로 분할됨 |
| FunASR 1.3.17 | 2026-07-19 | SenseVoice llama.cpp 런타임 개선, Windows CUDA 지원 |
| FunASR 1.3.16 | 2026-07-18 | PyPI에서 직접 설치된 Fun-ASR-Nano 실시간 WebSocket 서비스 |
| FunASR 1.3.15 | 2026-07-17 | 스트리밍 안정성 향상, Fun-ASR-Nano 호환성 수정 |
| FunASR 1.3.3 | 2026-05-24 | funasr-server CLI, OpenAI 호환 API, MCP 서버 |
| Fun-ASR-나노-2512 | 2025-12-15 | 최초의 Fun-ASR-Nano 플래그십 모델 출시 |
모델 가계도 측면에서 FunASR 툴킷은 Fun-ASR-Nano(중국어/영어/일본어 + 방언), Fun-ASR-MLT-Nano(31개 언어), SenseVoiceSmall(5개 언어 + 감정 인식), Paraformer(낮은 대기 시간 스트리밍 ASR), Qwen3-ASR(52개 언어) 등 다양한 모델 선택을 제공합니다. 사용자는 장면 정확도, 언어 적용 범위 및 하드웨어 조건에 따라 유연하게 선택할 수 있습니다.
Fun-ASR1.5의 기술적 장점
Fun-ASR1.5의 핵심 기술 이점은 아키텍처, 추론 효율성 및 배포 유연성의 세 가지 수준으로 나눌 수 있습니다.
-
MoE 하이브리드 전문가 아키텍처: 모델에는 여러 언어 관련 전문가 하위 네트워크가 포함되어 있습니다. 특정 언어가 들리면 해당 전문가 모듈만 활성화됩니다. 이 디자인은 30개 언어를 포괄하는 단일 모델의 매개변수 효율성을 동일한 규모의 밀집된 모델보다 훨씬 높게 만듭니다. 추론하는 동안 계산량이 크게 줄어듭니다. 동시에 각 전문가 모듈은 서로 간섭하지 않고 독립적으로 최적화될 수 있습니다.
-
단계별 및 단계적 훈련 전략: 단계별 훈련을 위해 정확한 데이터를 사용합니다. 먼저 일반적인 다국어 사전 훈련을 수행한 다음 방언/악센트 미세 조정을 수행하고 마지막으로 특수 장면(예: 고대 시) 정렬을 수행합니다. 이 훈련 프로세스는 단일 단계에서 훈련된 모델보다 실제 세계의 복잡한 음성 시나리오에서 모델을 훨씬 더 강력하게 만듭니다.
-
전체 링크 배포 매트릭스: Python 라이브러리(
pip install funasr)에서 OpenAI 호환 API 서비스(funasr-server)까지, llama.cpp/GGUF 엣지 측 바이너리에서 Docker 컨테이너형 배포까지, MCP 서버에서 vLLM 배치 추론 엔진까지, 개인 개발 시스템부터 대규모 프로덕션 클러스터까지 전체 배포 요구 사항을 포괄합니다. 특히 llama.cpp 런타임은 Python 런타임이 필요 없이 순수 CPU 및 에지 장치에 FunASR을 제공하여 IoT 및 임베디드 시나리오에서 고유한 이점을 제공합니다. -
추론 성능의 선두: Fun-ASR-Nano + vLLM은 실시간(RTFx) 340배에 도달하고 SenseVoiceSmall은 CPU에서 실시간 17배에 도달합니다. Whisper-large-v3의 13배 실시간(GPU)과 비교하여 FunASR의 CPU 추론 속도는 GPU에서의 Whisper 성능을 훨씬 능가하므로 CPU 카드 없는 배포가 실현 가능한 솔루션입니다.
Fun-ASR1.5 사용방법
Fun-ASR1.5는 다양한 사용 방법을 제공하며 개발자는 시나리오에 따라 유연하게 선택할 수 있습니다.
| 입구 | 설명 |
|---|---|
| Python 라이브러리(pip) | AutoModel API를 통해 호출되는 pip install funasr |
| CLI 명령줄 | funasr audio.wav는 음역이며 SRT/JSON 출력을 지원합니다 |
| OpenAI 호환 API | funasr-server --device cuda는 POST /v1/audio/transcriptions 서비스를 시작합니다 |
| MCP 서버 | Claude/Cursor와 같은 AI 에이전트가 음성 인식 기능을 호출하려면 |
| 매직스코프 커뮤니티 온라인 체험 | 설치가 필요 없이 직접 브라우저를 사용하세요: https://modelscope.cn/studios/iic/FunAudio-ASR |
| llama.cpp 바이너리 | 순수 CPU/에지 실행, Python 컨텍스트 필요 없음 |
Python을 빠르게 시작해보세요: ``파이썬 funasr import AutoModel에서
모델 = AutoModel(모델="FunAudioLLM/Fun-ASR-Nano-2512", device="cuda") 결과 = model.generate(input="audio.wav") print(결과[0]["텍스트"])
**CLI 한 줄 전사**:
``배쉬
funasr audio.wav --output-format json --spk --timestamps
API 서비스 시작: ``배쉬 funasr-server --device cuda
서비스 시작 후 localhost:8000에 OpenAI 호환 인터페이스를 제공합니다.
**일반적인 사용 프로세스**: FunASR 설치 → 모델 로드(가중치 자동 다운로드) → 오디오 파일/스트림 입력 → 구조화된 인식 결과 얻기 → 후처리(구두점/정규화). 전체 프로세스에서 언어 태그를 수동으로 설정할 필요가 없으며 모델이 자동으로 인식합니다.
## Fun-ASR1.5 제품 가격
Fun-ASR1.5의 오픈 소스 전략은 상당한 비용 이점을 제공합니다.
- **커뮤니티 에디션(무료)**: PyPI를 통해 GitHub 저장소 다운로드를 설치하고 Magic Community를 온라인으로 모두 무료로 경험해 보세요. MIT 오픈소스 라이선스는 상업적 사용과 2차 개발을 허용합니다.
- **Alibaba Cloud Bailian API(종량제)**: 자체 인프라 구축을 원하지 않는 사용자의 경우 Alibaba Cloud Bailian 플랫폼을 통해 API를 호출하고 호출량에 따라 요금을 청구할 수 있습니다. 구체적인 가격은 Alibaba Cloud 실시간 가격 페이지에 따릅니다.
- **기업 민영화 배포(자체 구축)**: 기업은 자체 서버에 배포할 수 있으며 컴퓨팅 리소스 비용만 부담하면 됩니다. FunASR의 높은 추론 효율성을 활용하면 단일 GPU로 많은 수의 동시 요청을 처리할 수 있습니다.
상업용 음성 인식 서비스(예: Azure Speech, Google Cloud Speech-to-Text, Whisper API)와 비교할 때 Fun-ASR1.5 자체 배포 솔루션의 TCO(총 소유 비용)는 중대형 사용 시나리오에서 상당한 이점을 가지며 데이터가 도메인 밖으로 나가지 않아 규정 준수 요구 사항을 충족합니다.
## Fun-ASR1.5의 적용 시나리오
- **다국어 회의 및 다국어 전사**: 다국적 회의 중에 다국어 혼합 대화 내용을 실시간으로 정확하게 전사합니다. 사전에 언어를 미리 설정할 필요가 없습니다. 단일 모델은 30개 언어를 지원할 수 있습니다. 자동 구두점 및 텍스트 정규화를 통해 후처리 비용이 크게 절감됩니다.
- **지능형 고객 서비스 음성 분석**: 고객 서비스 통화 녹음을 구조화된 텍스트로 일괄 복사하고 방언 인식 및 화자 분리를 지원하며 서비스 품질 모니터링, 핫 이슈 마이닝 및 감정 분석에 사용됩니다.
- **중국학의 온라인 교육 및 디지털화**: 고대시 낭송 인식의 문자 정확도 97%는 학생들의 낭송을 실시간으로 텍스트로 번역하고 비교 및 채점을 수행할 수 있는 독특한 온라인 중국학 교육 도구입니다.
- **콘텐츠 제작 및 자막 생성**: 비디오 제작자는 CLI 한 줄 명령을 통해 오디오를 SRT 자막 파일로 복사할 수 있습니다. 화자 태그와 타임스탬프를 지원하며, 팟캐스트, 강의 영상, 뉴스 인터뷰 등의 콘텐츠 제작에 적합합니다.
- **IoT와 에지 장치 간의 음성 상호 작용**: llama.cpp/GGUF를 통해 실행될 때 Fun-ASR1.5는 순수 CPU 장치에서 실행될 수 있으며 스마트 스피커, 자동차 음성 및 산업 제어와 같은 에지 시나리오에 적합합니다.
## Fun-ASR1.5 적용그룹
- **AI 애플리케이션 개발자**: 음성 인식을 자체 애플리케이션에 통합해야 하는 개발자는 Python SDK, REST API 또는 MCP 서버를 통해 신속하게 액세스할 수 있습니다. `pip install funasr`을 시작할 수 있습니다.
- **엔터프라이즈 IT 및 데이터 팀**: 음성 인식 서비스 배포를 민영화해야 하는 기업을 위해 FunASR은 도메인을 벗어나지 않는 데이터를 지원하기 위해 완전한 배포 매트릭스(Docker, Kubernetes, OpenAI 호환 API)를 제공합니다.
- **연구 기관 및 학술 사용자**: 오픈 소스 모델 가중치와 완벽한 교육 및 미세 조정 도구 체인으로 음성 인식, 방언학, 다국어 ASR 및 기타 방향의 연구 작업에 적합합니다.
- **콘텐츠 제작자 및 미디어 담당자**: 오디오/비디오를 텍스트로 신속하게 전사하고 자막을 생성해야 하는 제작자. CLI는 한 줄의 명령으로 트랜스코딩을 완료할 수 있으며 SRT/JSON/VTT와 같은 형식의 출력을 지원합니다.
- **군중에게 적합하지 않음**: 초저 지연 시간(<100ms 종단 간)에 대한 엄격한 요구 사항이 있는 실시간 통신 시나리오의 경우 테스트 후 평가하는 것이 좋습니다. 순수한 클라우드 프리 운영 및 유지 관리 호스팅 서비스가 필요한 사용자는 자체 배포 대신 Alibaba Cloud Bailian API를 우선적으로 사용하는 것이 좋습니다. 명령줄이나 Python 프로그래밍에 익숙하지 않은 순수 비즈니스 사용자는 Alibaba Cloud Bailian 시각적 인터페이스 또는 타사 통합을 사용해야 합니다.
## Fun-ASR1.5 개요 및 전망
Fun-ASR1.5는 음성 인식 분야에서 Alibaba Tongyi 팀의 중요한 오픈 소스 성과입니다. 핵심 경쟁력은 다음과 같습니다. 단일 모델 다중 언어 지원(30개 언어 + 7개 주요 방언)은 다중 모델 배포의 운영 및 유지 관리 복잡성을 줄입니다. MoE 아키텍처가 제공하는 추론 효율성을 통해 동일한 하드웨어에서 경쟁 제품보다 훨씬 뛰어난 처리량을 달성할 수 있습니다. 풀 링크 오픈 소스 전략(MIT 프로토콜 + 전체 배포 도구 체인)은 기업과 개발자에게 저렴하고 제어 가능성이 높은 음성 인식 인프라를 제공합니다.
**제한 사항**: 모델 무게는 무료로 사용할 수 있지만 모델마다 라이센스 계약이 다르며 상업적으로 사용하기 전에 특정 모델 카드의 승인 조건을 확인해야 합니다. 대기 시간이 매우 짧은 스트리밍 시나리오(예: 실시간 인터콤 번역)에는 여전히 타겟 조정이 필요합니다. 리소스가 매우 낮은 에지 장치(MCU 수준)의 경우 llama.cpp 런타임은 계속해서 최적화되고 있습니다.
**조달/채택 위험 평가**: Alibaba Damo Academy에서 유지 관리하는 오픈 소스 프로젝트인 FunASR은 생태학적 활동을 입증하는 19.3k GitHub Stars와 178명의 기여자를 통해 장기적이고 안정적인 커뮤니티 및 기업 지원을 제공합니다. 기업은 채택 시 주의를 기울여야 합니다. 오픈 소스 버전은 SLA를 보장하지 않으며 주요 생산 기업은 Alibaba Cloud Bailian API를 통해 기업 수준의 지원을 받는 것이 좋습니다. 상업적으로 사용하기 전에 모델 중량에 대한 독립적인 라이센스 계약을 하나씩 확인해야 합니다. 프로젝트 반복 리듬이 빠르고(매달 여러 개의 작은 버전이 출시됨) 생산 기업은 버전을 잠그고 회귀 테스트를 수행해야 합니다. 전반적으로 Fun-ASR1.5는 현재 자체 구축 기능과 데이터 규정 준수 요구 사항을 갖춘 팀을 위한 중국어 음성 인식 분야에서 가장 비용 효율적인 오픈 소스 옵션 중 하나입니다.
관련 도구: <exlink type="tool" slug="elevenlabs">, udio
버전 정보
- FunASR 1.3.19 :실시간 WebSocket 장기 세션 진단 기능을 추가하고, CLI 자막 생성 및 구두점 로딩을 개선하고, 커뮤니티 문서를 업데이트했습니다.
- FunASR 1.3.18 :SRT 자막 분할 회귀 문제를 수정하고 문장 수준 타임스탬프 요청을 지원하며 구두점 모델 로딩을 개선했습니다.
- FunASR 1.3.17 :실시간 WebSocket 세션 진단 로그, SenseVoice llama.cpp 런타임 개선, Windows CUDA 지원이 추가되었습니다.
- FunASR 1.3.16 :Fun-ASR-Nano 실시간 WebSocket 서비스는 PyPI에서 직접 설치할 수 있으며 클라이언트 중심 엔드포인트 모드를 지원합니다.
- FunASR v1.3.15 :스트리밍 안정성을 개선하고 Fun-ASR-Nano 호환성 문제를 해결하며 CLI 및 텍스트 처리를 개선합니다.
사용자 후기