ElevenLabs发布v4语音模型:支持90种语言,10秒音频即可克隆声音
报价宝综合消息ElevenLabs发布v4语音模型:支持90种语言,10秒音频即可克隆声音
语音AI公司 ElevenLabs 周一发布了两款新语音模型:v4 和 v4 Turbo,带来更细颗粒度的情感表达控制、更低的语音智能体延迟,以及对90多种语言的支持(上一代为70种)。
新模型采用全新架构,声音克隆也更快:用户只需10秒音频即可克隆一个声音。在长文本场景下,v4对「声音身份」的稳定性明显提升,朗读时还能结合上下文自动调整语气。ElevenLabs在v3中引入的内联情绪标签体系在v4中继续扩展,支持多个标签叠加并按顺序执行。

值得一提是,公司表示质量提升最明显的语言包括日语、巴西葡语、普通话和粤语——中文用户有望直接受益。
商业层面,ElevenLabs的企业通话业务过去一年快速扩张,超55%收入来自大型企业客户。v4的低延迟特性专为语音智能体设计:底层大模型一开始生成答案,v4就能同步开始产出语音,甚至能对争吵、投诉升级、通话保持等场景做差异化处理。
语音赛道竞争白热化:Cartesia、Deepgram、Fish Audio、Boson、WellSaid Labs等创业公司都在做高表现力语音模型,谷歌和OpenAI也在持续升级自家语音模型。ElevenLabs今年早些时候刚完成红杉领投的5亿美元融资(估值110亿美元),目前市面上已有传闻称其将以220亿美元估值开启新一轮融资。其年化收入已从年初约3.3亿美元攀升至6亿美元以上,员工总数超800人。CEO Mati Staniszewski此前表示,公司目标是「未来几年内」IPO,但未给出时间表。
编译自 TechCrunch,原标题:"ElevenLabs' new v4 speech model supports more expression control and 90 languages"