Skip to content

音视频与实时转录模型配置

WiseMindAI 提供两类语音识别能力:

  1. 音视频转录:处理已经存在的音频或视频文件,用于生成字幕、概要和看点。
  2. 实时转录:接收麦克风的连续声音,用于会议、课堂和访谈的实时逐字稿。

两类能力在「设置 → 模型设置」中分别显示。在线服务商可能需要单独开通文件转写和实时语音识别;FunASR 本地模型则可以在两个入口复用。

使用在线服务 Key 产生的费用,完全由对应模型提供商收取,与 WiseMind AI 无关。

音视频转录模型

服务提供商申请地址其他说明
本地 Whisper无需申请下载本地 Whisper 模型后使用,适合离线处理
FunASR无需申请支持本地音频转写,并与实时转录共用模型
智谱 AI获取 API Key支持在线音视频转写
阿里云百炼获取 API Key支持通过百炼音视频模型转写文件
小米 MiMo获取 API Key支持 MiMo 音频识别模型
阶跃星辰获取 API Key支持在线音频转写
火山引擎打开控制台需要按控制台要求开通语音识别服务

生成视频字幕、导入录音转写时,请在「音频模型」中选择这类服务。完整视频使用方式可以查看:视频学习

实时转录模型

服务提供商申请地址主要配置
FunASR无需申请下载或导入本地模型,不需要 API Key
阿里云百炼获取 API KeyAPI Key、Workspace ID、地域和模型名称
火山引擎打开控制台API Key、资源 ID 和接口地址
科大讯飞开通实时语音转写App ID、AccessKey ID 和 AccessKey Secret
百度智能云打开语音识别控制台App ID、API Key、Secret Key 和识别模型
腾讯云获取云 API 密钥App ID、Secret ID、Secret Key 和引擎模型

不同版本开放的平台可能不同,请以客户端「实时转录」模型列表为准。

配置完成后,可以直接点击模型卡片中的「测试」。测试会播放一段内置短音频,并显示识别文字、首段返回时间和总耗时,不会创建正式转录记录。

WiseMindAI 实时转录模型

FunASR 本地转录

FunASR 适合希望录音不上传、断网也能继续转录,或不想产生云端转录费用的场景。当前提供中英轻量版、中英高精度版和粤语专用版。

模型可以直接在 WiseMindAI 中下载,也可以导入准备好的离线包或已经解压的模型文件夹。导入前会检查文件是否完整、模型类型是否正确以及电脑空间是否足够。

WiseMindAI 实时转录模型

完整使用流程可以查看:实时转录

配置建议

  1. 先在服务商控制台开通对应产品,并确认账号有可用额度。
  2. 按 WiseMindAI 表单填写认证信息,不要把普通语音识别产品的参数填到实时转录中。
  3. 保存后先使用「测试」确认配置,再开始长时间录音或处理大文件。
  4. 实时转录还要单独检测麦克风,模型测试正常不代表系统已经授予录音权限。
  5. 不同平台支持的语种、文件大小、单次时长和计费规则不同,正式使用前请查看服务商说明。

常见问题

为什么音频文件可以转写,但实时录音不能使用?

如果使用在线平台,文件转写和实时转录可能属于服务商的不同产品,请进入「实时转录」分类重新配置并测试。如果使用 FunASR,请确认已经准备好本地模型,并在两个入口都选择 FunASR。

为什么实时转录测试提示没有权限?

通常是当前账号只创建了密钥,但没有开通对应实时语音识别产品,或者所填模型、地域和资源 ID 与已开通服务不一致。

本地 Whisper 可以用于实时转录吗?

当前本地 Whisper 主要用于处理已经存在的音视频文件。如果希望在本地进行实时录音,请使用 FunASR。

在线转录会产生费用吗?

多数在线平台会按音频时长或请求量收费,具体费用和免费额度由服务商决定。WiseMindAI 不会额外收取模型调用费用。FunASR 在当前电脑上运行,不产生云端转录费用。