语音服务提供高精度的语音转文字(STT)与文字转语音(TTS),支持多语言、实时流式转写、说话人分离与自然语音合成,应用于客服、字幕、语音助手与无障碍场景。
语音服务包括语音转文字(STT)和文字转语音(TTS)两个方向。STT 用于字幕生成、客服转写、语音助手;TTS 用于有声阅读、导航播报、无障碍辅助。三大云都提供高精度预训练模型和定制化能力。
| 对比维度 | Transcribe / Polly | Google STT / TTS | Azure AI Speech |
|---|---|---|---|
| 识别精度 | 优秀 | 业界领先 | 优秀 |
| 实时流式转写 | 支持 | 支持(Streaming API) | 支持 |
| 说话人分离 | 支持 | 支持 | 支持 |
| TTS 自然度 | Neural TTS(多音色) | WaveNet/Journey(最自然) | Neural TTS(自定义音色) |
| 自定义音色 | 不支持 | 不支持 | 支持(Custom Neural Voice) |
| 中文识别 | 良好 | 优秀 | 优秀 |
| STT 定价(每分钟) | $0.024(标准)/$0.048(医疗) | $0.016-$0.024 | $0.016-$0.024 |
在清晰音频环境下,三大云的 WER(词错误率)通常在 5-10%。Google 在多语言和嘈杂环境下表现最好。中文识别 Azure 和 Google 领先。自定义词汇表可以显著提升专业领域精度。
神经 TTS 已经非常接近真人。Google Journey 和 Azure Neural TTS 在韵律和情感上表现最好。Azure 的 Custom Neural Voice 可以克隆特定人的声音(需要提供约 10-30 分钟训练数据),但需通过伦理审核。