阿里云那条链路里翻译是模型自带的,延迟最低;火山这条是先识别、再让豆包翻,可控性更高。
密钥只存在这台设备的浏览器里(localStorage),开始收音时通过 WSS 发给你自己部署的中转服务,不会存到别处。
中转服务是必须的 —— 两家的流式接口都用自定义 HTTP Header 鉴权,而浏览器的 WebSocket 不允许设 Header,前端直连在协议层就走不通。
百炼控制台 → API-KEY 创建。地域、Key、模型列表三者绑定,不能跨地域混用 —— 新加坡的 Key 打北京域名一定 401。
用业务空间专属域名的话,把控制台「API Host」那一串直接粘进来即可,会自动补成
wss:// 和 /api-ws/v1/inference。
例:ws-xxxxxx.ap-southeast-1.maas.aliyuncs.com
Gummy 只在北京地域提供,它识别+翻译一步到位,0.00015 元/秒(约 0.54 元/小时)。
新加坡等地域没有 Gummy,用 qwen-audio 系列做识别,翻译方式改成下面那一项。
用同一个 API Key,走百炼的 OpenAI 兼容接口。选 flash 类小模型延迟最低。
专属域名是另一个主机名(llm-xxxx 开头),不是上面那个 ws-xxxx,在控制台同一页能找到。
有专业术语、人名、产品名时建议配,识别准确率提升很明显。
按你在控制台开通的计费方式选,选错会直接报鉴权失败。
默认 en-US。若返回参数错误,换成 en 再试。
填模型 ID 或你自己创建的推理接入点 ep-xxxx。翻译走的是方舟 OpenAI 兼容接口,建议选 flash 类小模型,延迟最低。
正常情况留空最省事:网页和中转是同一个 Node 服务,自动用同源地址。
只有在两种情况下要手填 —— 直接双击打开 html 文件时(填本机那个),或者网页和中转分开部署时(例如 wss://si.example.com/asr)。
说话人停顿超过这个时长就把当前句定稿。调小出字更碎更快,调大更完整但延迟高。