carlself
V2EX  ›  问与答

音频转文本模型推荐

  •  
  •   carlself · 1 day ago · 890 views

    目前使用 whisper-large-v3-turbo ,英文音频效果不错,但是中文识别准确率很差,几乎每个句子都有错。请问有什么更好的模型推荐?

    6 replies  •  2026-10-09 11:10:46 +08:00
    jackOff
        1
    jackOff  
       1 day ago
    同求,如果中文每个字的时间轴识别能精准不偏移就完美了
    Muniesa
        2
    Muniesa  
       1 day ago
    Qwen3-ASR-1.7B 很多方言口音也能识别
    snow0
        3
    snow0  
       1 day ago
    项目中用的 qwen-audio-3.0-asr-flash-filetrans ,可以试试
    Liu6
        4
    Liu6  
       1 day ago
    我在前公司部署的是中文采用 funasr , 英文 whisperx
    zlowly
        5
    zlowly  
       1 day ago
    Fun-ASR-Nano 挺不错,以前的 funasr 是非自回归模型,中文同音字之类的很容易出错,后来换了用 LLM 解码器,中文质量肉眼可见的提升,
    simbaCheng
        6
    simbaCheng  
       19h 15m ago
    Qwen 吧,前些时间用通义听悟,给盗墓笔记和百家讲坛 mp3 制作 lrc 歌词,识别的效果还不错,有错误的但能接受。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   958 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 35ms · UTC 22:25 · PVG 06:25 · LAX 15:25 · JFK 18:25
    ♥ Do have faith in what you're doing.