产品介绍
Cartesia Sonic 是什么?
Cartesia Sonic 是面向语音智能体和交互应用的实时文本转语音模型与流式 API。当前 Sonic-3.5 产品页面介绍了低于 90 毫秒的延迟,以及覆盖 40 多种语言的原生多语言语音,适合对响应速度、稳定节奏、自然表达和情绪表现有要求的对话体验。
Sonic 会理解文本中的情绪语境并自动调整表达,也支持笑声等非语言声音。开发者可通过 API、SDK 和 Cartesia 开发工具使用模型;官网还为企业环境介绍了云端和本地部署选项。
核心功能
- 流式文本转语音: 以低于 90 毫秒的延迟为实时应用生成音频。
- 情绪表达: 根据文本情绪自动调整语气和节奏。
- 非语言声音: 支持在文本中控制笑声等表达。
- 声音克隆: 使用 10 秒参考音频创建克隆声音。
- 音频本地化: 在 42 种语言中保留说话者身份、语气和情绪。
- 发音词典: 为姓名和专业术语指定准确发音。
使用场景
- 客户支持智能体: 为账户和服务问题提供低延迟语音回复。
- 销售与招聘电话: 支持资格判断和结果记录的语音流程。
- 培训模拟: 创建可进行练习对话的语音角色。
- 多语言应用: 在保留说话者特征的同时实现语音本地化。
- 交互叙事: 实时生成自然、富有表现力的旁白。
常见问题
Sonic 支持多少种语言?
产品页面称原生多语言语音覆盖 40 多种语言,并支持本地化到 42 种语言。
Sonic 可以克隆声音吗?
可以。Cartesia 表示可使用 10 秒音频克隆声音。
Sonic 提供 API 吗?
提供。Cartesia 提供流式 TTS API、SDK 和开发工具。


