sherpa-onnx icefall k2 体系 funasr PyTorch 框架 之间的关系
Table of Contents
大框架
深度学习底层框架
│
├── PyTorch
│
├── k2 (图计算 / FSA工具)
│ │
│ └── icefall (ASR训练框架)
│ │
│ └── sherpa / sherpa-onnx (推理部署框架)
│
└── FunASR (另一条 ASR 体系)
PyTorch:定位通用深度学习框架,所有模型最终都是基于它训练出来的。是所有体系共同底层。
如:在语音领域
icefall 使用 PyTorch
FunASR 使用 PyTorch
Whisper 使用 PyTorc
k2 体系:k定位语音识别专用数学计算库
https://k2-fsa.github.io/sherpa/onnx/python/install.html#method-1-from-pre-compiled-wheels-cpu-only
icefall: 定位基于 k2 的 ASR训练框架。ASR训练平台
如:小米团队的Zipformer asr模型基于它。
sherpa :定位ASR 部署推理框架。负责把训练好的模型 实际运行
sherpa-onnx:定位 sherpa 的轻量跨平台推理版本
ai 模型分类
现在模型太多了,很容易混乱。模型越来越多,每家公司都在发模型
ai模型分商用模型和开源模型
所有模型 = 3大类 + 1个平台
① Multi-Modal通用大模型(多模态) -GPT‑5.4,Claude 4.5
② 专用模型(专项)- GPT‑5.3‑Codex(写代码)
③ 开源模型(自己可控)- LLaMA 3
④ 平台(把上面三种用好,内部调度多个模型)-Cursor,GitHub Copilot,ChatGPTLLM,Multi-Modal,Audio
还有视觉,asr,编程,写文档,多模态等等,各家公司的
所有公司都在做这6件事,只是强项不同
AI能力 = 6大模块
① 文本/推理(大脑)
② 编程(工程能力)
③ 视觉(看图/视频)
④ 语音(ASR + TTS)
⑤ 多模态(统一理解)- 模型正在融合上面的所有能力
⑥ Agent(自动干活)
OpenAI公司开发的模型
GPT 系列
├─ GPT-5.5
├─ GPT-5.2
├─ GPT-5.1
└─ GPT-5
推理系列
├─ o3
├─ o3-pro
├─ o4-mini
└─ o4-mini-high
编程系列
├─ GPT-5 Codex
├─ GPT-5.1 Codex
└─ GPT-5.2 Codex
图像系列
└─ DALL·E 3
语音系列
├─ Whisper
├─ TTS
└─ Realtime
向量系列
├─ Embedding-3-small
└─ Embedding-3-large
谷歌的模型分成两条线:闭源商用(Gemini 系列)和开源免费(Gemma 系列)
Gemini系列(谷歌的闭源商用版)
Gemini Ultra
Gemini Pro
Gemini Flash
Gemini Nano:运行在手机芯片(NPU)上,完全不联网
Gemma 系列(谷歌的开源免费版)
ai智能体 skill mcp ai cli ai agent 区别
每个概念的具体职责
| 角色 | 职责 | 实例 |
|---|---|---|
| CLI | 接收你的自然语言输入 | "审查 PR #123" |
| Agent | 理解意图,加载 Skill,编排流程 | 识别需要 pr-reviewer Skill |
| Skill | 提供最佳实践指南 | 告诉 Agent 如何审查(顺序、检查点) |
| MCP | 协调 Tool 的调用 | 按最优顺序并行调用 4 个 Tools |
| Tool | 执行原子操作 | getfile、lexical-code-search 等 |
1. Tool (工具) — The Atomic Action
A Tool is a single, executable function exposed to an LLM
2. Skill (技能) — The Specific Capability of an Agent
A Skill is a modular package of domain-specific logic, prompts, and Tools bundled together.
Example: A "Git DevOps Skill" (which bundles git_clone, git_commit, and git_push tools along with prompt templates on how to write good commit messages).
3. AI Agent (AI 智能体) — The Autonomous System
An AI Agent is an autonomous system driven by an LLM
decide which Skills or Tools to use
4.AI CLI (命令行界面) — The Terminal Interface
Example: Running ai "check docker container logs for errors" in your terminal.
Skill、Tool、MCP、CLI、Agent 属于不同层级
┌─────────────────────────────┐
│ AI Agent │ ← 大脑
├─────────────────────────────┤
│ Skills │ ← 工作流程/SOP
├─────────────────────────────┤
│ Tools / MCP Tools │ ← 能力接口
├─────────────────────────────┤
│ CLI / API / Browser │ ← 实际执行层
└─────────────────────────────┘用 GitHub Copilot 作为实际例子,展示这些概念如何协作:
┌─────────────────────────────────────────────────────────────────┐
│ CLI (你的命令) │
│ "审查 PR #123 的性能问题" │
└────────────────────┬────────────────────────────────────────────┘
│
▼ Agent 接收
┌────────────────────────────┐
│ Agent Layer │
│ 决策: 这需要 pr-reviewer │
└────────────┬───────────────┘
│
▼ 加载 Skill
┌────────────────────────────────────────┐
│ Skill: pr-reviewer │
│ ┌──────────────────────────────────┐ │
│ │ 审查流程: │ │
│ │ 1. 获取 PR 信息 │ │
│ │ 2. 分析代码变更 │ │
│ │ 3. 检查性能指标 │ │
│ │ 4. 识别风险 │ │
│ │ 5. 生成建议 │ │
│ └──────────────────────────────────┘ │
└────────────┬───────────────────────────┘
│
▼ MCP 协调调用
┌──────────────────────────────────┐
│ MCP (调度层) │
│ 编排 Tool 的执行顺序 │
│ 并行/串行执行优化 │
└───┬──────┬──────┬──────┬─────────┘
│ │ │ │
┌───▼─┐ ┌──▼──┐ ┌─▼───┐ ┌▼──────┐
│Tool1│ │Tool2│ │Tool3│ │Tool4 │
└─┬───┘ └──┬──┘ └─┬───┘ └┬──────┘
│ │ │ │
▼ ▼ ▼ ▼
┌──────────────────────────────────┐
│ External Systems (GitHub API) │
└──────────────────────────────────┘
│ │ │ │
└────────┼───────┼──────┘
▼
┌────────────────────────┐
│ Agent 汇总分析结果 │
│ - 性能瓶颈 │
│ - 代码质量问题 │
│ - 建议修复方案 │
└────────────┬───────────┘
│
▼ CLI 返回
┌────────────────────────┐
│ 完整的审查报告 │
│ 展示给用户 │
└────────────────────────┘
FunASR
FunASR:阿里语音识别完整体系,是一整套独立语音体系。
FunASR包含:
训练框架
推理框架
模型集合
FunASR = 训练 + 推理 + 模型一体化
Qwen Team vs FunAudioLLM Team vs funasr vs SenseVoice
Qwen Team 和 FunAudioLLM Team不是竞争关系,并且有技术合作,都属于阿里巴巴达摩院(DAMO Academy)AI 体系,但目标完全不同。
FunAudioLLM 专注Speech AI(语音 AI)。github.com/FunAudioLLM
Qwen Team 专注大语言模型、多模态、Agent github.com/QwenLM
Alibaba AI
│
├── Qwen Team
│ │
│ ├── Qwen3
│ ├── Qwen3-VL
│ ├── Qwen3-Omni
│ ├── ASR(Qwen3-ASR)
│ └── Qwen-Agent
│
└── FunAudioLLM
│
├── FunASR
├── SenseVoice
├── Paraformer
├── CosyVoice
├── FSMN-VAD
├── CampPlus
└── Fun-ASR-Nano
FunASR 是框架(Framework),SenseVoice 是模型(Model)
FunAudioLLM
│
├── ASR
│ │
│ ├── Paraformer
│ ├── SenseVoice
│ ├── Fun-ASR-Nano LLM ASR模型,2026 最新旗舰模型
│ ├──
│ ├──
│ └── ...
│
├── CosyVoice(TTS)
│
├── FSMN-VAD
│
└── CampPlus
Qwen Team
│
├── ASR
│ │
│ ├── Fun-ASR-Realtime
│ ├── Fun-ASR-Flash
│ ├── Fun-ASR-Nano
│ ├── Qwen3-ASR LLM ASR模型
│ ├──
│ └── ...
│
├──
│
├──
│
└── Qwen3-ASR
属于 LLM-ASR(大语言模型语音识别) 分类。传统的 ASR 模型往往“只管听音,不管语境”;而 Qwen3-ASR 将音频编码器与通义千问 LLM 深度融合(提供 0.6B / 1.7B 等版本)。
asr流式(Streaming) 架构。
音频数据像水流一样,分块(Chunk)送入,边听边识别,通常配合 WebSocket 协议。如:fun-asr-realtime(实时流式)
非流式(Non-Streaming / 一气呵成) 架构,比如经典的 Paraformer 非自回归模型。
你必须丢给它一个完整的音频文件(如 1 小时的会议录音)。它在 GPU 上可以使用 vLLM 等引擎进行极高并发的 Batch 批处理,实现几十甚至上百倍的实时率(RTFx)加速(即 1 分钟就能刷完几十分钟的音频)。
fun-asr-flash(离线转写)
自回归
工作原理:它们在输出文本时,必须一个字一个字地往外蹦。生成当前这个字时,必须把前面已经生成的所有字当作输入传进去。Whisper
致命缺点:慢。因为有前后依赖关系,它无法并行计算。如果一段话有 100 个字,模型就必须老老实实地串行循环 100 次(GPU 的并行算力在这里施展不开)
使用场景:如果你追求极高的语境理解和复杂的翻译能力,则需要容忍更慢的自回归模型(如 Qwen3-ASR / Whisper)
非自回归模型
为了解决“慢”的问题,非自回归模型诞生了
当模型拿到整段音频或特征后,同时、并行地把所有位置的文字一次性全部吐出来。
巨大优势:极快。由于消除了串行循环,它可以完全榨干 GPU 的多核并行能力。生成 1 个字和生成 100 个字,在时间开销上几乎没有区别。
典型代表:Paraformer
fun-asr-flash基于 Paraformer 架构,它就是典型的非自回归模型。
使用场景:
需要给海量录音文件做批量转写(比如客服质检、会议记录提取),非自回归模型(如 Paraformer / fun-asr-flash) 是绝对的效率王
模型下载页面
sherpa-onnx
https://k2-fsa.github.io/sherpa/onnx/sense-voice/index.html
