企业会议实时音频转文字记录,要求:
低延迟(0.3~2 秒)
准确率高
多人说话
自动分段
区分发言人 - 说话人识别(Speaker Diarization)
关键词检索
会议纪要自动生成
支持中英混合
支持私有化部署
Qwen-ASR / FunASR 代表了目前中文语音识别(ASR)开源生态中非常重要的两条路线,但两者定位不同:
FunASR:成熟的语音识别工程框架 + 模型生态,适合企业实时转写。
Qwen-ASR(Qwen3-ASR 等):新一代大模型语音理解方向,更偏多模态语音智能。
1. FunASR 体系(目前企业实时 ASR 首选)
FunASR Streaming(SenseVoice)
2. Qwen-ASR(新一代方向)
不是传统 ASR,是语音 + 大模型理解。Qwen-ASR 内部包含了LM组件。
Qwen-ASR 内部的 LLM 组件,是为“听懂语音并转写”服务的,不是 Qwen3/Gemma 的通用大语言模型。
