Skip to content
Discussion options

You must be logged in to vote

补充一个更准确的说明:当前 FunASR 的 standalone llama.cpp / GGUF runtime 暂不支持 CAM++ 说话人分离,但原因不是它“只做 LLM 文本推理”。这套 runtime 已经在 C++/ggml 中实现了音频前端、Fun-ASR-Nano / SenseVoiceSmall / Paraformer ASR,以及可选的 FSMN-VAD;目前缺少的是 CAM++ speaker embedding 和后续 speaker clustering。--vad 只负责长音频分段,不会输出说话人标签。

需要说话人分离时,请使用 Python pipeline:

from funasr import AutoModel

model = AutoModel(
    model="paraformer-zh",
    vad_model="fsmn-vad",
    punc_model="ct-punc",
    spk_model="cam++",
)

Fun-ASR-Nano 的 vLLM 服务也可通过请求参数 spk=true 调用独立说话人模型。已提交 #3491,把这条支持边界和替代路径补进 llama.cpp runtime 文档。

Replies: 2 comments

Comment options

You must be logged in to vote
0 replies
Comment options

You must be logged in to vote
0 replies
Answer selected by LauraGPT
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment
Category
Q&A
Labels
None yet
3 participants