ElevenLabs 于周一发布了两款新的语音模型,名为 ElevenLabs v4 和 v4 Turbo,提供更丰富的情感表达控制、更低的语音智能体延迟,并支持超过 90 种语言。
该公司于去年发布了 v3 模型,并在今年早些时候于华沙举行的一场活动上预展了新一代模型。对于 v4 一代模型,ElevenLabs 采用了全新架构,可实现更好的控制能力和更快的克隆速度。公司表示,使用 v4,用户仅需 10 秒音频即可克隆一个声音。
在创作方面,该模型在处理较长的文本块时能更好地保持声音身份的一致性,还能在朗读时结合文本上下文来调整情感表达。ElevenLabs 在 v3 中引入了用于定义情感的内联标签,并在 v4 中进一步扩展了这些标签,允许用户叠加多个标签,让模型按照顺序执行。
上一版本支持 70 种语言,ElevenLabs 已在新版本中将这一数字提升至 90 种。这家初创公司表示,日语、巴西葡萄牙语、普通话和粤语的质量提升最为明显。
过去一年,ElevenLabs 的企业通话业务快速扩张,超过 55% 的业务来自大型企业。公司表示,新模型适合语音智能体使用,因为新版本延迟更低,可实现更流畅的对话。此外,v4 可以在后端 LLM 开始生成答案的同时立即开始生成音频。更重要的是,该模型还能以不同方式处理对抗、升级和等待等场景,从而更好地解决问题。
随着 Cartesia、Deepgram、Fish Audio、Boson 和 WellSaid Labs 等初创公司纷纷推出富有表现力的语音模型,语音模型领域的竞争日趋激烈。Google 和 OpenAI 等大公司也在不断改进它们的语音模型。
ElevenLabs 今年早些时候完成了由红杉资本(Sequoia)领投的 5 亿美元融资,估值达 110 亿美元。目前已有传闻称公司将进行新一轮融资,估值将达 220 亿美元。ElevenLabs 的年化营收运行率已从年初的约 3.3 亿美元攀升至超过 6 亿美元。该公司在印度、欧洲和巴西等不同市场积极招聘,员工总数已超过 800 人。
在最近接受 TechCrunch 采访时,公司联合创始人兼 CEO Mati Staniszewski 表示,公司正瞄准“未来几年内”进行 IPO,但未给出具体时间表。
- Sean O’Kane