Popular blog tags

各种AI框架之间的关系

Published

 

sherpa-onnx icefall k2 体系 funasr PyTorch 框架 之间的关系

大框架

深度学习底层框架
│
├── PyTorch
│
├── k2  (图计算 / FSA工具)
│     │
│     └── icefall (ASR训练框架)
│            │
│            └── sherpa / sherpa-onnx (推理部署框架)
│
└── FunASR (另一条 ASR 体系)

 

PyTorch:定位通用深度学习框架,所有模型最终都是基于它训练出来的。是所有体系共同底层。

如:在语音领域

icefall 使用 PyTorch
FunASR 使用 PyTorch
Whisper 使用 PyTorc

 

k2 体系:k定位语音识别专用数学计算库

https://k2-fsa.github.io/sherpa/onnx/python/install.html#method-1-from-pre-compiled-wheels-cpu-only

 

icefall:  定位基于 k2 的 ASR训练框架。ASR训练平台

如:小米团队的Zipformer asr模型基于它。

 

sherpa :定位ASR 部署推理框架。负责把训练好的模型 实际运行

 

sherpa-onnx:定位 sherpa 的轻量跨平台推理版本

 

 

 

ai 模型分类

 

现在模型太多了,很容易混乱。模型越来越多,每家公司都在发模型

ai模型分商用模型和开源模型

所有模型 = 3大类 + 1个平台

① Multi-Modal通用大模型(多模态) -GPT‑5.4,Claude 4.5
② 专用模型(专项)- GPT‑5.3‑Codex(写代码)
③ 开源模型(自己可控)- LLaMA 3
④ 平台(把上面三种用好,内部调度多个模型)-Cursor,GitHub Copilot,ChatGPT

LLM,Multi-Modal,Audio

还有视觉,asr,编程,写文档,多模态等等,各家公司的

所有公司都在做这6件事,只是强项不同

AI能力 = 6大模块

① 文本/推理(大脑)
② 编程(工程能力)
③ 视觉(看图/视频)
④ 语音(ASR + TTS)
⑤ 多模态(统一理解)-  模型正在融合上面的所有能力
⑥ Agent(自动干活)

 

OpenAI公司开发的模型

GPT 系列
├─ GPT-5.5
├─ GPT-5.2
├─ GPT-5.1
└─ GPT-5

推理系列
├─ o3
├─ o3-pro
├─ o4-mini
└─ o4-mini-high

编程系列
├─ GPT-5 Codex
├─ GPT-5.1 Codex
└─ GPT-5.2 Codex

图像系列
└─ DALL·E 3

语音系列
├─ Whisper
├─ TTS
└─ Realtime

向量系列
├─ Embedding-3-small
└─ Embedding-3-large

 

google

谷歌的模型分成两条线:闭源商用(Gemini 系列)和开源免费(Gemma 系列)

Gemini系列(谷歌的闭源商用版)
Gemini Ultra

Gemini Pro

Gemini Flash

Gemini Nano:运行在手机芯片(NPU)上,完全不联网

Gemma 系列(谷歌的开源免费版)

 

 

ai智能体 skill mcp ai cli ai agent 区别

 

每个概念的具体职责

角色职责实例
CLI接收你的自然语言输入"审查 PR #123"
Agent理解意图,加载 Skill,编排流程识别需要 pr-reviewer Skill
Skill提供最佳实践指南告诉 Agent 如何审查(顺序、检查点)
MCP协调 Tool 的调用按最优顺序并行调用 4 个 Tools
Tool执行原子操作getfilelexical-code-search

1. Tool (工具) — The Atomic Action

A Tool is a single, executable function exposed to an LLM

 

 

2. Skill (技能) — The Specific Capability of an Agent

A Skill is a modular package of domain-specific logic, prompts, and Tools bundled together. 

Example: A "Git DevOps Skill" (which bundles git_clone, git_commit, and git_push tools along with prompt templates on how to write good commit messages).

 

3. AI Agent (AI 智能体) — The Autonomous System

An AI Agent is an autonomous system driven by an LLM

decide which Skills or Tools to use

 

4.AI CLI (命令行界面) — The Terminal Interface

Example: Running ai "check docker container logs for errors" in your terminal.

 

Skill、Tool、MCP、CLI、Agent 属于不同层级

┌─────────────────────────────┐
│         AI Agent            │  ← 大脑
├─────────────────────────────┤
│          Skills             │  ← 工作流程/SOP
├─────────────────────────────┤
│     Tools / MCP Tools       │  ← 能力接口
├─────────────────────────────┤
│     CLI / API / Browser     │  ← 实际执行层
└─────────────────────────────┘

用 GitHub Copilot 作为实际例子,展示这些概念如何协作:

┌─────────────────────────────────────────────────────────────────┐
│                         CLI (你的命令)                            │
│              "审查 PR #123 的性能问题"                           │
└────────────────────┬────────────────────────────────────────────┘
                     │
                     ▼ Agent 接收
        ┌────────────────────────────┐
        │  Agent Layer               │
        │  决策: 这需要 pr-reviewer  │
        └────────────┬───────────────┘
                     │
                     ▼ 加载 Skill
        ┌────────────────────────────────────────┐
        │  Skill: pr-reviewer                    │
        │  ┌──────────────────────────────────┐  │
        │  │ 审查流程:                         │  │
        │  │ 1. 获取 PR 信息                   │  │
        │  │ 2. 分析代码变更                   │  │
        │  │ 3. 检查性能指标                   │  │
        │  │ 4. 识别风险                       │  │
        │  │ 5. 生成建议                       │  │
        │  └──────────────────────────────────┘  │
        └────────────┬───────────────────────────┘
                     │
                     ▼ MCP 协调调用
        ┌──────────────────────────────────┐
        │        MCP (调度层)               │
        │  编排 Tool 的执行顺序            │
        │  并行/串行执行优化               │
        └───┬──────┬──────┬──────┬─────────┘
            │      │      │      │
        ┌───▼─┐ ┌──▼──┐ ┌─▼───┐ ┌▼──────┐
        │Tool1│ │Tool2│ │Tool3│ │Tool4  │
        └─┬───┘ └──┬──┘ └─┬───┘ └┬──────┘
          │        │       │      │
          ▼        ▼       ▼      ▼
    ┌──────────────────────────────────┐
    │   External Systems (GitHub API)   │
    └──────────────────────────────────┘
          │        │       │      │
          └────────┼───────┼──────┘
                   ▼
        ┌────────────────────────┐
        │  Agent 汇总分析结果     │
        │  - 性能瓶颈             │
        │  - 代码质量问题         │
        │  - 建议修复方案         │
        └────────────┬───────────┘
                     │
                     ▼ CLI 返回
        ┌────────────────────────┐
        │  完整的审查报告          │
        │  展示给用户             │
        └────────────────────────┘

 

FunASR


FunASR:阿里语音识别完整体系,是一整套独立语音体系。

 

FunASR包含:
训练框架
推理框架
模型集合

FunASR = 训练 + 推理 + 模型一体化

Qwen Team vs  FunAudioLLM Team vs funasr vs SenseVoice

Qwen Team 和 FunAudioLLM Team不是竞争关系,并且有技术合作,都属于阿里巴巴达摩院(DAMO Academy)AI 体系,但目标完全不同。

FunAudioLLM 专注Speech AI(语音 AI)。github.com/FunAudioLLM

Qwen Team 专注大语言模型、多模态、Agent github.com/QwenLM

 

Alibaba AI
│
├── Qwen Team
│     │
│     ├── Qwen3
│     ├── Qwen3-VL
│     ├── Qwen3-Omni
│     ├── ASR(Qwen3-ASR)
│     └── Qwen-Agent
│
└── FunAudioLLM
      │
      ├── FunASR
      ├── SenseVoice
      ├── Paraformer
      ├── CosyVoice
      ├── FSMN-VAD
      ├── CampPlus
      └── Fun-ASR-Nano

 

FunASR 是框架(Framework),SenseVoice 是模型(Model)

FunAudioLLM
│
├── ASR
│      │
│      ├── Paraformer
│      ├── SenseVoice
│      ├── Fun-ASR-Nano    LLM ASR模型,2026 最新旗舰模型
│      ├── 
│      ├── 
│      └── ...
│
├── CosyVoice(TTS)
│
├── FSMN-VAD
│
└── CampPlus

 

 

Qwen Team
│
├── ASR
│      │
│      ├── Fun-ASR-Realtime
│      ├── Fun-ASR-Flash
│      ├── Fun-ASR-Nano    
│      ├── Qwen3-ASR         LLM ASR模型
│      ├── 
│      └── ...
│
├── 
│
├── 
│
└── 

Qwen3-ASR

属于 LLM-ASR(大语言模型语音识别) 分类。传统的 ASR 模型往往“只管听音,不管语境”;而 Qwen3-ASR 将音频编码器与通义千问 LLM 深度融合(提供 0.6B / 1.7B 等版本)。

 

asr流式(Streaming) 架构。

音频数据像水流一样,分块(Chunk)送入,边听边识别,通常配合 WebSocket 协议。如:fun-asr-realtime(实时流式)

非流式(Non-Streaming / 一气呵成) 架构,比如经典的 Paraformer 非自回归模型。
你必须丢给它一个完整的音频文件(如 1 小时的会议录音)。它在 GPU 上可以使用 vLLM 等引擎进行极高并发的 Batch 批处理,实现几十甚至上百倍的实时率(RTFx)加速(即 1 分钟就能刷完几十分钟的音频)。

fun-asr-flash(离线转写)

 

自回归

工作原理:它们在输出文本时,必须一个字一个字地往外蹦。生成当前这个字时,必须把前面已经生成的所有字当作输入传进去。Whisper

致命缺点:慢。因为有前后依赖关系,它无法并行计算。如果一段话有 100 个字,模型就必须老老实实地串行循环 100 次(GPU 的并行算力在这里施展不开)

使用场景:如果你追求极高的语境理解和复杂的翻译能力,则需要容忍更慢的自回归模型(如 Qwen3-ASR / Whisper)

非自回归模型

为了解决“慢”的问题,非自回归模型诞生了

当模型拿到整段音频或特征后,同时、并行地把所有位置的文字一次性全部吐出来。
巨大优势:极快。由于消除了串行循环,它可以完全榨干 GPU 的多核并行能力。生成 1 个字和生成 100 个字,在时间开销上几乎没有区别。

典型代表:Paraformer

fun-asr-flash基于 Paraformer 架构,它就是典型的非自回归模型。

 

使用场景:

需要给海量录音文件做批量转写(比如客服质检、会议记录提取),非自回归模型(如 Paraformer / fun-asr-flash) 是绝对的效率王

 

模型下载页面

sherpa-onnx

https://k2-fsa.github.io/sherpa/onnx/sense-voice/index.html