首页/Cartesia Sonic
Cartesia Sonic 文本转语音图标

Cartesia Sonic

Cartesia Sonic 是低延迟流式文本转语音 API,为 40 多种语言的语音智能体和交互应用生成富有表现力的语音。

访问网站
Cartesia Sonic 实时多语言语音模型

产品介绍

Cartesia Sonic 是什么?

Cartesia Sonic 是面向语音智能体和交互应用的实时文本转语音模型与流式 API。当前 Sonic-3.5 产品页面介绍了低于 90 毫秒的延迟,以及覆盖 40 多种语言的原生多语言语音,适合对响应速度、稳定节奏、自然表达和情绪表现有要求的对话体验。

Sonic 会理解文本中的情绪语境并自动调整表达,也支持笑声等非语言声音。开发者可通过 API、SDK 和 Cartesia 开发工具使用模型;官网还为企业环境介绍了云端和本地部署选项。

核心功能

  • 流式文本转语音: 以低于 90 毫秒的延迟为实时应用生成音频。
  • 情绪表达: 根据文本情绪自动调整语气和节奏。
  • 非语言声音: 支持在文本中控制笑声等表达。
  • 声音克隆: 使用 10 秒参考音频创建克隆声音。
  • 音频本地化: 在 42 种语言中保留说话者身份、语气和情绪。
  • 发音词典: 为姓名和专业术语指定准确发音。

使用场景

  • 客户支持智能体: 为账户和服务问题提供低延迟语音回复。
  • 销售与招聘电话: 支持资格判断和结果记录的语音流程。
  • 培训模拟: 创建可进行练习对话的语音角色。
  • 多语言应用: 在保留说话者特征的同时实现语音本地化。
  • 交互叙事: 实时生成自然、富有表现力的旁白。

常见问题

Sonic 支持多少种语言?

产品页面称原生多语言语音覆盖 40 多种语言,并支持本地化到 42 种语言。

Sonic 可以克隆声音吗?

可以。Cartesia 表示可使用 10 秒音频克隆声音。

Sonic 提供 API 吗?

提供。Cartesia 提供流式 TTS API、SDK 和开发工具。

返回产品导航

相关产品

Anijam 将文本、脚本、图片或音频转成动画视频,由 AI 管理场景、角色一致性、口型、配音和时间线编辑。

AnyModel 将同一提示词发送给多个文本或图像模型,并通过一个托管账户并排展示结果。

Artisk 使用 AI 帮助创建专业品牌套件和标志。

邮件订阅

持续发现实用 AI 产品

定期接收精选产品、真实使用场景和开发者动态。