Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒

Inworld 于 9 月 2 日宣布文本转语音模型 Realtime TTS-2 正式商用(GA),并同步推出更快的 TTS-2 Flash。公司称前者首字节延迟约 100 毫秒、同一音色可跨 200 多种语言使用,订阅价为每百万字符 12.5 美元;后者延迟低至 25 毫秒,价格为其一半。模型已在 inworld.ai 上线,也可通过 LiveKit、Cloudflare 等平台调用。

Paylaş
Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒

Inworld 于 9 月 2 日发布公告,宣布实时文本转语音(TTS,即把文字转成语音的技术)模型 Realtime TTS-2 正式商用(GA)。按公司说法,新模型首字节延迟约 100 毫秒,同一音色身份可覆盖 200 多种语言,并在第三方评测站 Artificial Analysis 上位列同类第一。Inworld 称这是其历史上最大的一次跃升:研究预览版用量远超预期,那些使用经验回流到研究之中,形成了今天的正式版。

用自然语言指挥语音表演

TTS-2 支持用自然语言做语音指导(voice direction)和音色设计:把表演提示写进方括号,同一句“我为你高兴,真的”,在“咬着牙强忍”与“温暖真诚”两种提示下情绪截然不同。模型还提供自助式专业声音克隆与多轮上下文。LiveKit 首席技术官 David Zhao 称其为情感表现力语音合成的一次真正进步。Inworld 表示,语言学习、辅导、陪伴与角色扮演、健康健身、新闻、游戏和客户体验等领域,每天有数亿人在与基于该模型的应用互动。

速度、价格与接入

Realtime TTS-2 的订阅价为每百万字符 12.5 美元,约合每分钟 1.5 美分。同日发布的 TTS-2 Flash 被 Inworld 称为“世界上最快的文本转语音模型”,首字节延迟 25 毫秒,价格为其一半,面向每一毫秒都重要的场景。模型已在 inworld.ai 上线,也可通过 Cloudflare、DeepInfra、LiveKit、Tencent RTC 等平台调用。需要说明的是,“第一”“最快”“最大跃升”等表述均出自 Inworld 自身,本站未做独立核实。

Devamını oku

Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة

Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة

أعلنت Inworld الإتاحة العامة لنموذج Realtime TTS-2 لتحويل النص إلى كلام، بزمن استجابة نحو 100 مللي ثانية ودعم هوية صوتية واحدة عبر أكثر من 200 لغة، إلى جانب إصدار TTS-2 Flash بزمن 25 مللي ثانية ونصف السعر.

GlobalFeed Editor tarafından
World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问

World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问

李飞飞创办的World Labs于9月1日发布多模态世界模型Atlas,官方称其为全球首个此类模型:可从一张或多张图片以像素级相机控制生成最长1分钟的1440p视频,从少量照片重建真实空间的3D结构,并为机器人生成RGB与深度模拟数据。公司自测在相机条件生成与3D重建基准上超过专用模型。目前仅向选定合作伙伴开放早期访问,未来几周扩大范围,未公布价格。

GlobalFeed Editor tarafından