FunASR Kostenlos

-

FunASR ist ein Open-Source-Spracherkennungs-Toolkit in Industriequalität von Alibaba Tongyi Lab. Es integriert ASR, VAD, Interpunktionswiederherstellung, Sprechertrennung, Emotionserkennung und Audioereigniserkennung. Es bietet eine einheitliche Python-Schnittstelle und eine OpenAI-kompatible API, unterstützt 340-fache Echtzeit-Rateninferenz in über 50 Sprachen und kann für die Bereitstellung vollständig privatisiert werden.

FunASR Produktoberfläche

FunASR: Das Open-Source-Spracherkennungs-Toolkit in Industriequalität von Alibaba Tongyi Lab

Kernparameter und Statistiken von FunASR

Projekt Einzelheiten
Produktname FunASR (Fun Audio Speech Recognition)
Produkttyp Open-Source-Spracherkennungs-Toolkit
Lieferform Python SDK / CLI / OpenAI-kompatibler API-Server / Docker / llama.cpp Edge-Bereitstellung
Unterstützte Sprachen Über 50 Sprachen (Fun-ASR-Nano unterstützt Chinesisch/Englisch/Japanisch und chinesische Dialekte; MLT-Nano unterstützt 31 Sprachen; Qwen3-ASR unterstützt 52 Sprachen)
Modellgröße 0,4 Mio. (fsmn-vad) ~ 1,7 Mrd. (Qwen3-ASR)
GitHub-Sterne 19,3k
Open-Source-Vereinbarung MIT (Toolkit); Modellgewichte werden gemäß den jeweiligen Vereinbarungen lizenziert
Zielbenutzer Entwickler, KI-Teams in Unternehmen, Sprachproduktintegratoren

FunASR ist kein einzelnes SaaS-Produkt, sondern eine vollständige Open-Source-Toolkette zum Sprachverstehen. Es bietet eine „End-to-End-Pipeline“ vom Rohaudio bis zum strukturierten Text – VAD-Segmentierung, ASR-Erkennung, Interpunktionswiederherstellung, Sprechertrennung, Emotionserkennung, Audioereigniserkennung – alles über eine einzige Zeile von „AutoModel“-API-Aufrufen. Entwickler können unabhängig lokal, im Intranet oder in der Cloud bereitstellen, ohne Audiodaten an API-Dienste von Drittanbietern zu senden.

Quantitative Schlüsselindikatoren: Fun-ASR-Nano + vLLM-Inferenz kann eine 340-fache Echtzeitrate (RTF) erreichen, SenseVoiceSmall kann eine 17-fache Echtzeitrate auf der CPU erreichen und CER liegt bei nur 7,81 %–8,20 %, was beides besser ist als die 20 % CER und die 13-fache Echtzeitrate von Whisper-large-v3.

Benutzer und Marktbekanntheit von FunASR

  • GitHub 19.3k Stars, 178 Mitwirkende, 25 offizielle Veröffentlichungen, ist eines der aktivsten Open-Source-ASR-Toolkits auf GitHub.
  • Monatliche PyPI-Downloads nehmen weiter zu und das Paket „funasr“ ist zu einer der Kernabhängigkeiten des Python ASR-Ökosystems geworden.
  • Einführung in Unternehmen: Integriert als Spracheingabemodul durch gängige KI-Frameworks wie RAGFlow, Dify, LangChain und AutoGen; Die Community hat mehr als 30 Integrationsprojekte angesammelt.
  • Branchen-Benchmarking: Im chinesischen ASR-Szenario liegen FunASRs CER und Echtzeitrate deutlich vor der Whisper-Serie (die chinesische Wortfehlerrate ist etwa 60 % niedriger und die CPU-Inferenzgeschwindigkeit ist 10–20 Mal höher), und es unterstützt Sprechertrennung, Emotionserkennung und andere Funktionen, die Whisper nicht bietet.

Kostenvorteile von FunASR

Kostendimension Beschreibung
Open Source und kostenlos Core Toolkit MIT-Lizenz, keine Lizenzgebühren, keine API-Aufrufgebühren
Privater Einsatz Kann vollständig offline im Intranet/auf einem einzelnen Computer ausgeführt werden, ohne dass das Risiko eines Datenlecks besteht und kein Druck auf die Abrechnung nach dem nutzungsbasierten Verfahren entsteht
Hardwareschwelle SenseVoiceSmall kann auf der CPU ohne GPU eine 17-fache Echtzeitrate erreichen; Fun-ASR-Nano empfiehlt 8 GB+ GPU
Vergleichen Sie die Whisper-API Der Cloud-ASR-Dienst kostet etwa 0,006 $/Minute; Die Kosten für den Eigenbau von FunASR bestehen nur aus Hardware-Abschreibung und Strom, wodurch in Hochfrequenzszenarien über 90 % eingespart werden können

Vergleichende Analyse: Für ein Szenario mit mittlerer bis hoher Frequenz, das 1.000 Stunden Audio pro Tag verarbeitet, beträgt die monatliche Gebühr für die Nutzung von Cloud ASR etwa 10.800 US-Dollar und mehr, während die selbst erstellte Bereitstellung von FunASR nur eine einmalige Hardware-Investition erfordert (ein Server mit einer GPU kostet etwa 3.000 bis 8.000 US-Dollar) und die daraus resultierenden Grenzkosten nahe Null liegen. Bei datenschutzrelevanten Szenarien (medizinisch, finanziell, rechtlich) kann der Wert der privatisierten Bereitstellung nicht am Preis gemessen werden.

Hauptfunktionen von FunASR

  • Multi-Modell-ASR-Erkennung: Integrieren Sie Fun-ASR-Nano (Chinesisch/Englisch/Japanisch + Dialekt), SenseVoiceSmall (5 Sprachen + Emotionen + Ereignisse), Paraformer (Streaming/Offline), Qwen3-ASR (52 Sprachen), Whisper usw. und wechseln Sie Modelle mit derselben API.
  • Sprachaktivitätserkennung (VAD): fsmn-vad auf Millisekundenebene, adaptive Stilleschwelle, automatische Segmentierung langer Audiodaten.
  • Wiederherstellung der Zeichensetzung und inverse Textregulierung: Das Modell „ct-punc“ fügt automatisch Satzzeichen hinzu und gibt kanonischen Text aus, der direkt gelesen werden kann.
  • Sprecherdialogisierung: Das CAM++-Modell vermerkt automatisch „Wer hat was zu welcher Zeit gesagt“ und unterstützt Besprechungen mit mehreren Personen.
  • Emotionserkennung und Erkennung von Audioereignissen: SenseVoice verfügt über eine integrierte Emotionserkennung (glücklich/traurig/wütend/neutral) und Ereigniserkennung (Applaus/Lachen/Musik/Weinen).
  • OpenAI-kompatibler API-Dienst: Der einzeilige Befehl „funasr-server“ startet den RESTful-Dienst. Das SDK ist mit der OpenAI Audio API kompatibel und stellt eine direkte Verbindung zu LangChain/Dify/AutoGen her.
  • MCP-Server für KI-Agenten: Agenten wie Claude/Cursor können lokale ASR-Funktionen direkt aufrufen.
  • Edge-Bereitstellung (llama.cpp/GGUF): Kein Python-Kontext erforderlich, einzelne Binärdatei wird auf CPU/Edge-Gerät ausgeführt, unterstützt Windows CUDA.

FunASR-Modell und Versionsentwicklung

Das FunASR-Projekt startete im Jahr 2022 und wurde ursprünglich von der Alibaba Damo Academy als End-to-End-Spracherkennungs-Toolkit veröffentlicht (INTERSPEECH 2023-Papier). 2025–2026 wird in eine schnelle Iterationsphase eintreten:

Version Datum Kernänderungen
v1.3.19 19.07.2026 Dokumentation zur Fehlerbehebung bei langen WebSocket-Sitzungen; Verbesserungen der segmentierten CLI SRT-Untertitel
v1.3.16 18.07.2026 Clientgesteuerter Echtzeit-Endpunkt; llama.cpp Windows CUDA-Paket
v1.3.12 21.06.2026 Qwen3-ASR / GLM-ASR-Fix
v1.3.3 24.05.2026 funasr-server CLI, OpenAI API, MCP Server, Dynamic VAD
v1.3.0 20.05.2026 Qwen3-ASR (52 Sprachen), GLM-ASR-Nano (17 Sprachen) unterstützt
v1.2.x 2025-2026 Fun-ASR-Nano, vLLM-Inferenz-Engine llama.cpp Edge Runtime
v1.0 2024 Erste stabile Version, Paraformer/SenseVoice-Integration
v0.x 2022-2023 Erste Version, grundlegendes ASR und Trainingsrahmen

Technische Vorteile von FunASR

Toolkit statt Einzelmodell: Im Gegensatz zu Einzelmodelllösungen wie Whisper ist FunASR ein „Modellsupermarkt“ – für jede Teilaufgabe (VAD, ASR, Interpunktion, Sprechertrennung, Emotion) gibt es ein eigenes Modell, das frei kombinierbar ist. Beispielsweise schließt die Produktionspipeline „SenseVoice + fsmn-vad + ct-punc + cam++“ die gesamte Verarbeitung in einem Aufruf ab.

Unterdrückung der Inferenzeffizienz:

  • Fun-ASR-Nano + vLLM: 340-fache Echtzeitrate (26-mal schneller als Whisper-large-v3), CER 8,20 %
  • SenseVoiceSmall: 17-fache Echtzeit auf der CPU (schneller als Whisper auf der GPU), CER 7,81 %
  • Nicht-autoregressive Architektur (Paraformer): extrem niedrige Verzögerung des ersten Wortes in Streaming-Szenarien, unterstützt WebSocket-Echtzeiterkennung

Bereitstellungsflexibilität: Deckt das gesamte Spektrum von der „Pip-Installation“ über die Docker/Kubernetes-Containerisierung bis hin zur llama.cpp-Einzelbinär-CPU/Edge-Bereitstellung ab. „funasr-server“ bietet eine OpenAI-kompatible API. Anwendungen mit vorhandenem SDK müssen zum Wechseln nur „base_url“ ändern.

Agent-native Unterstützung: Integrierter MCP-Server und OpenAI-API, AI-Agent-Frameworks wie Claude Desktop, Cursor, LangChain, Dify, AutoGen usw. können Sprachfunktionen direkt integrieren, um sprachgesteuerte automatisierte Arbeitsabläufe zu realisieren.

So verwenden Sie FunASR

Eingang Beschreibung
Python-SDK „pip install funasr“, „AutoModel“ einzeiliger Aufruf
CLI Direkte Transkription von „funasr audio.wav“, unterstützt JSON/SRT/TSV-Ausgabe
API-Server „funasr-server --device cuda“ startet den OpenAI-kompatiblen Endpunkt
Docker Offline-/Streaming-Docker-Image, einzeiliger Start
llama.cpp Einzelne binäre CPU/Edge-Bereitstellung, keine Python-Laufzeit erforderlich

Python-Schnellstart: „Python from funasr import AutoModel

model = AutoModel(model="sensevoice", vad_model="fsmn-vad", punc_model="ct-punc", spk_model="cam++", device="cuda") result = model.generate(input="meeting.wav", batch_size_s=300) für Seg in result[0]["sentence_info"]: print(f"[{seg['start']/1000:.1f}s] Sprecher {seg['spk']}: {seg['text']}") „

API-Dienst starten: „Bash pip install funasr vllm fastapi uvicorn python-multipart funasr-server --device cuda --port 8899

Anruf

curl -X POST http://localhost:8899/v1/audio/transcriptions \ -F „[email protected]“ -F „model=fun-asr-nano“ -F „response_format=verbose_json“ „

MCP-Mount (Claude Desktop): „json { „mcpServers“: { „funasr“: { „command“: „funasr-server“, „args“: [“--mcp“, „--port“, „8899“] } } } „

Produktpreise für FunASR

Das FunASR-Kerntoolkit basiert auf der MIT-Open-Source-Lizenz und ist völlig kostenlos, ohne versteckte Kosten, ohne Begrenzung der Anzahl der Aufrufe und ohne funktionale Einschränkungen. Unternehmen können Sekundärentwicklung und kommerzielle Integration auf Basis des Quellcodes durchführen, ohne Lizenzgebühren zu zahlen.

Die Modellgewichte unterliegen einer unabhängigen Lizenzvereinbarung. Die meisten Modelle (SenseVoice, Paraformer, fsmn-vad, ct-punc, cam++, emotions2vec) können kommerziell kostenlos genutzt werden. Die Einzelheiten unterliegen der Lizenz der jeweiligen Modellkarte.

Bewertung versteckter Kosten:

  • GPU-Server-Hardwarekosten (8 GB+ VRAM empfohlen für Fun-ASR-Nano; SenseVoiceSmall für CPU verfügbar)
  • Betriebs- und Wartungskosten (Docker/K8s-Bereitstellung und Wartung) – Wenn Sie die vLLM-Beschleunigung verwenden, müssen Sie zusätzliche vLLM-Abhängigkeiten installieren

Im Vergleich zu kommerziellem Cloud-ASR (z. B. Alibaba Cloud-Spracherkennung Azure Speech, Whisper API) kann die selbst erstellte Bereitstellung von FunASR bei der Verarbeitung von durchschnittlich 100 Stunden Audio pro Tag die Hardwarekosten innerhalb von 3 bis 6 Monaten decken.

Anwendungsszenarien von FunASR

  • Besprechungsaufzeichnungen und intelligente Protokolle: Konvertieren Sie Audiodaten von Unternehmensbesprechungen automatisch in strukturierten Text mit Sprecher-Tags und integrieren Sie die RAG-Wissensdatenbank, um „Sprachfragen und -antworten“ zu implementieren. Im Vergleich zur manuellen Transkription wird die Effizienz um das 10- bis 20-fache gesteigert.
  • Videountertitel und Inhaltsproduktion: Unterstützt den Export von SRT/TSV-Untertiteln, Verarbeitungsgeschwindigkeit 170–340x Echtzeitrate. Bei der Batchverarbeitung des Videokorpus durch neue Medienoperationen kann die Transkription für ein einstündiges Video in etwa 10 bis 20 Sekunden abgeschlossen werden.
  • Qualitätsprüfung des Kundendienstes und emotionale Analyse: SenseVoice erkennt automatisch die emotionalen Zustände der Benutzer und wichtige Audioereignisse (z. B. Streitigkeiten, Eskalationen von Beschwerden) und unterstützt das Qualitätsprüfungsteam dabei, die Abdeckungsrate der zufälligen Inspektionen von 5 % auf 100 % zu erhöhen.
  • AI Voice Agent/Assistant: Stellen Sie über MCP Server oder OpenAI API eine Verbindung zu Agent-Frameworks wie Claude/Cursor/Dify her, um lokale Spracheingabefunktionen für KI-Assistenten bereitzustellen und die externe Übertragung von Sprachdaten zu vermeiden.
  • Sprachtranskription aus den Bereichen Medizin/Finanzwesen/Recht: 100 % privatisierte Bereitstellung, Audiodaten verlassen das Intranet nicht und erfüllen die HIPAA/MLI-Konformitätsanforderungen.

Nicht passende Grenzen:

  • Für Echtzeit-Kommunikationsszenarien (z. B. Echtzeit-Transkription in Telefonkonferenzen) wird empfohlen, den Paraformer-Streaming-Endpunkt zu verwenden und die Verzögerung des ersten Wortes zu optimieren
  • Sehr kleine Sprachen (z. B. afrikanische/indianische Sprachen) müssen selbst trainiert werden oder Qwen3-ASR verwenden, und die Abdeckung ist möglicherweise unvollständig – Interaktive Szenen, die eine extrem hohe Erkennungslatenz (<50 ms) erfordern, erfordern eine individuelle Optimierung von Streaming VAD und Paraformer.

Anwendbare Gruppen von FunASR

  • KI-Anwendungsentwickler: Sprachfunktionen müssen in Produkte integriert werden. FunASR bietet Python SDK und OpenAI-kompatible APIs mit extrem niedrigen Integrationskosten. Ersetzt Cloud-ASR-Dienste und spart langfristige API-Gebühren.
  • Enterprise AI Team: In Branchen mit strengen Anforderungen an Datenschutz und Compliance (Medizin, Finanzen, Recht) werden die privatisierten Bereitstellungsfunktionen von FunASR dringend benötigt. Es wird empfohlen, der Bewertung der Modellauswahl und der Hardwareplanung Priorität einzuräumen.
  • Voice Product Integrator: ISV/SI, der die ASR-Pipeline anpassen muss. Die modulare Architektur von FunASR ermöglicht den Austausch beliebiger Komponenten und unterstützt die Feinabstimmung.
  • Einzelne Entwickler und Forscher: Die MIT-Lizenz ermöglicht die kostenlose Nutzung und Sekundärentwicklung, ohne Einschränkungen für die akademische Forschung. Mit Colab Quick Start können Sie Ihre erste Identifizierungsaufgabe in 5 Minuten meistern.
  • Nicht für Szenarien geeignet: Direkte Verwendung durch Zero-Code/nicht-technische Benutzer, derzeit hauptsächlich Interaktion über Python/CLI/API, keine grafische Schnittstelle; In Szenarien, die eine durchgängige, sofort einsatzbereite SaaS-Nutzung erfordern, wird die Verwendung von UI-Paketen von Drittanbietern empfohlen.

Zusammenfassung und Ausblick von FunASR

FunASR ist derzeit das umfassendste und fortschrittlichste Spracherkennungs-Toolkit in Industriequalität in der Open-Source-Community. Seine zentrale Wettbewerbsfähigkeit liegt in der Dreifaltigkeit „Multi-Modell-Kombination + ultimative Argumentationseffizienz + Bereitstellungslösung für das gesamte Spektrum“: Entwickler können ASR-/VAD-/Interpunktions-/Sprechertrennungsmodelle je nach Szenario frei kombinieren, durch vLLM eine 340-fache Echtzeitrate erreichen und es auf beliebige Weise bereitstellen, z. B. Python SDK / OpenAI API / MCP / llama.cpp.

Aktuelle Einschränkungen:

  • Dokumente und Tutorials sind immer noch hauptsächlich auf Englisch und Chinesisch, und japanische/koreanische Dokumente sind im Aufbau
  • Für einige Modelle (Fun-ASR-Nano) wird die Ausführung auf der GPU empfohlen. CPU ist verfügbar, aber SenseVoiceSmall muss ausgewählt werden – Echtzeit-WebSocket-Dienste müssen in Szenarien mit hoher Parallelität immer noch Parameter für bestimmte Hardware optimieren

Bewertung des Übernahme-/Einführungsrisikos: FunASR ist Open Source, kostenlos und MIT-lizenziert, mit extrem geringem Einführungsrisiko. Vor der Unternehmensbereitstellung wird empfohlen, CER- und RTF-Benchmark-Tests an repräsentativen Audiodaten durchzuführen und die am besten geeignete Modellkombination auszuwählen (es wird empfohlen, zur Überprüfung mit SenseVoiceSmall zu beginnen). Das Risiko einer langfristigen Abhängigkeit ergibt sich hauptsächlich aus der Kontinuität der Community-Wartung, aber die kontinuierlichen Investitionen von Alibaba Tongyi Lab und ModelScope (durchschnittlich 2-3 Versionsaktualisierungen pro Monat im Zeitraum 2025-2026) bieten einen guten Schutz. Für Unternehmen, die kommerzielle Unterstützung benötigen, können die Spracherkennungsprodukte von Alibaba Cloud als Alternative in Betracht gezogen werden. Zusammenfassung: Als zugrunde liegende ASR-Engine ist FunASR den Closed-Source-Cloud-APIs und den selbst entwickelten Lösungen von Whisper hinsichtlich technischer Indikatoren und Compliance-Freiheit überlegen und das bevorzugte Open-Source-Toolkit für die „Speech-to-Text“-Infrastrukturebene.

Verwandte Tools: , udio

Versionsinfo

  • v1.3.19 :Dokumentation zur Fehlerbehebung bei langen WebSocket-Sitzungen in Echtzeit hinzugefügt; Verbesserungen der CLI-SRT/TSV-Untertitelausgabe; Der clientgesteuerte Echtzeit-Endpunkt unterstützt Fun-ASR-Nano.
  • v1.3.18 :Die CLI-SRT/TSV-Untertitelausgabe verwendet Satzzeitstempel, um segmentierte Untertitelansagen zu schreiben.
  • v1.3.16 :Clientgesteuerter Echtzeit-WebSocket-Endpunkt für Streaming-Erkennung ohne serverseitiges VAD hinzugefügt.
  • v1.3.12 :Qwen3-ASR-Sprachcode-Korrektur, GLM-ASR-Korrektur, vLLM-Repetition_Penalty-Korrektur.
  • v1.3.3 :Funasr-Server-CLI, OpenAI-kompatible API, MCP-Server für AI-Agenten und dynamisches VAD hinzugefügt.

Benutzerbewertungen

  • Bewertungen werden geladen...