Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒
Inworld 于 9 月 2 日宣布文本转语音模型 Realtime TTS-2 正式商用(GA),并同步推出更快的 TTS-2 Flash。公司称前者首字节延迟约 100 毫秒、同一音色可跨 200 多种语言使用,订阅价为每百万字符 12.5 美元;后者延迟低至 25 毫秒,价格为其一半。模型已在 inworld.ai 上线,也可通过 LiveKit、Cloudflare 等平台调用。
Inworld 于 9 月 2 日发布公告,宣布实时文本转语音(TTS,即把文字转成语音的技术)模型 Realtime TTS-2 正式商用(GA)。按公司说法,新模型首字节延迟约 100 毫秒,同一音色身份可覆盖 200 多种语言,并在第三方评测站 Artificial Analysis 上位列同类第一。Inworld 称这是其历史上最大的一次跃升:研究预览版用量远超预期,那些使用经验回流到研究之中,形成了今天的正式版。
用自然语言指挥语音表演
TTS-2 支持用自然语言做语音指导(voice direction)和音色设计:把表演提示写进方括号,同一句“我为你高兴,真的”,在“咬着牙强忍”与“温暖真诚”两种提示下情绪截然不同。模型还提供自助式专业声音克隆与多轮上下文。LiveKit 首席技术官 David Zhao 称其为情感表现力语音合成的一次真正进步。Inworld 表示,语言学习、辅导、陪伴与角色扮演、健康健身、新闻、游戏和客户体验等领域,每天有数亿人在与基于该模型的应用互动。
速度、价格与接入
Realtime TTS-2 的订阅价为每百万字符 12.5 美元,约合每分钟 1.5 美分。同日发布的 TTS-2 Flash 被 Inworld 称为“世界上最快的文本转语音模型”,首字节延迟 25 毫秒,价格为其一半,面向每一毫秒都重要的场景。模型已在 inworld.ai 上线,也可通过 Cloudflare、DeepInfra、LiveKit、Tencent RTC 等平台调用。需要说明的是,“第一”“最快”“最大跃升”等表述均出自 Inworld 自身,本站未做独立核实。