Alibaba, Qwen-Audio-3.0-ASR-Flash 출시: 긴 오디오 일관성, 핫 워드 사용자 정의 및 구조화된 출력

Alibaba는 긴 오디오 컨텍스트 일관성, 전문 산업 단어 인식 및 핫 워드 사용자 정의를 향상시키고 음성 다듬기 및 구조화된 텍스트 출력 기능을 추가하는 Qwen-Audio-3.0-ASR-Flash 음성 인식 모델을 출시했습니다.

Alibaba의 오픈 소스 음성 인식(ASR) 캠프에 높은 처리량, 낮은 대기 시간의 음성 전사 시나리오를 위해 설계된 Qwen-Audio-3.0-ASR-Flash라는 새 멤버가 추가되었습니다. 기존의 "텍스트로 변환" 반복과 비교할 때 이번 업그레이드는 확실히 실제 구현에 더 가깝습니다. 긴 오디오 일관성, 전문 업계 단어 인식, 핫 단어 사용자 정의, 음성 다듬기 및 구조화된 출력이 함께 수행됩니다.

중국어 음성 전사의 세 가지 문제점을 바로 알아보세요

긴 오디오 컨텍스트 일관성은 긴 음성 및 긴 대화 시나리오에서 "불일치 및 콘텐츠 드리프트"라는 일반적인 문제를 해결합니다. 핫 워드 사용자 정의를 통해 사용자는 특정 이름, 브랜드 및 업계 용어를 인식 프로세스에 삽입하여 정확성을 높일 수 있습니다. 이 두 가지 중첩된 전문 업계 단어 인식은 회의록, 고객 서비스 품질 검사 등 자주 사용되는 중국어 시나리오에 거의 맞춤 제작되었으며, 이는 중국어 음성 인식에서 가장 어렵고 가치 있는 부분이기도 합니다.

"텍스트 변환"에서 "에이전트가 준비할 수 있음"으로

더 주목할만한 것은 음성 다듬기구조화된 텍스트 출력입니다. 전자는 전사된 텍스트의 가독성을 최적화하는 반면, 후자는 다운스트림 시스템(회의록, 고객 서비스 품질 검사, 자막 생성)을 2차 정리 없이 사용할 수 있도록 구조화된 데이터를 직접 출력합니다. 이는 ASR이 "도구 기반 기능"에서 "에이전트가 직접 조정할 수 있는 구성 요소"로 변화하고 있음을 의미하며, 그 생태학적 가치는 전혀 같은 수준이 아닙니다.

플래시 파일인 이 모델은 짧은 대기 시간과 높은 처리량에 중점을 둡니다. 라이브 자막, 음성 고객 서비스 등 실시간 시나리오의 대규모 배포에 적합하며, 플래그십 파일과 함께 그라데이션 커버리지를 형성합니다. 이는 또한 Qwen 오픈 소스 + 다중 모드의 전체 라인을 계속합니다. 음성 인식은 Qwen 전체 모드 퍼즐의 한 조각일 뿐입니다. 음성 및 이미지 기능과의 향후 협업은 기대할만한 가치가 있습니다.

앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.

  1. 긴 오디오 및 핫워드 실제 측정: 실제 시나리오의 정확성 평가는 기자회견 데이터보다 더 설득력이 있습니다.
  2. 플래시 기어 지연 성능: 실시간 시나리오의 종단 간 지연이 배포 경계를 결정합니다.
  3. Qwen과의 전체 모드 협업: 음성 및 시각 통합 모델의 통합 진행.
저작권: 콘텐츠 출처 사용자 피드 . 이 플랫폼은 정보 제공 및 학습 교류를 목적으로 콘텐츠를 편집 및 정리했습니다. 저작권 문제가 있으시면 연락해 주세요.

후기

  • 후기를 불러오는 중...