> ## Content Index
> Fetch the complete content index at: https://globalfeed.ai/llms.txt
> Use this file to discover other available public pages before exploring further.

# Inworld 称 Realtime TTS-2 正式商用：首字节延迟约 100 毫秒，同一音色支持 200 多种语言，同日发布的 Flash 版本降至 25 毫秒
- URL: https://globalfeed.ai/zh/inworld-cheng-realtime-tts-2-zheng-shi-shang-yong-shou-zi-jie-yan-chi-yue-100-hao-miao-tong-yi-yin-se-zhi-chi-200-duo-chong-yu-yan-tong-ri-fa-bu-de-flash-ban-ben-jiang-zhi-25-hao-miao/
- Published: 2026-09-02T22:09:47.000Z
- Updated: 2026-09-02T23:59:26.000Z
- Description: Inworld 于 9 月 2 日宣布文本转语音模型 Realtime TTS-2 正式商用（GA），并同步推出更快的 TTS-2 Flash。公司称前者首字节延迟约 100 毫秒、同一音色可跨 200 多种语言使用，订阅价为每百万字符 12.5 美元；后者延迟低至 25 毫秒，价格为其一半。模型已在 inworld.ai 上线，也可通过 LiveKit、Cloudflare 等平台调用。
- Author: GlobalFeed Editor
- Tags: inworld, TTS, 语音技术, 语音合成, x-inworld_ai, dil-zh, elle, video

Inworld 于 9 月 2 日[发布公告](https://x.com/inworld%5Fai/status/2095186020677353488?ref=globalfeed.ai)，宣布实时文本转语音（TTS，即把文字转成语音的技术）模型 Realtime TTS-2 正式商用（GA）。按公司说法，新模型首字节延迟约 100 毫秒，同一音色身份可覆盖 200 多种语言，并在第三方评测站 Artificial Analysis 上位列同类第一。Inworld 称这是其历史上最大的一次跃升：研究预览版用量远超预期，那些使用经验回流到研究之中，形成了今天的正式版。

## 用自然语言指挥语音表演

TTS-2 支持用自然语言做语音指导（voice direction）和音色设计：把表演提示写进方括号，同一句“我为你高兴，真的”，在“咬着牙强忍”与“温暖真诚”两种提示下情绪截然不同。模型还提供自助式专业声音克隆与多轮上下文。LiveKit 首席技术官 David Zhao 称其为**情感表现力语音合成的一次真正进步**。Inworld 表示，语言学习、辅导、陪伴与角色扮演、健康健身、新闻、游戏和客户体验等领域，每天有数亿人在与基于该模型的应用互动。

## 速度、价格与接入

Realtime TTS-2 的订阅价为每百万字符 12.5 美元，约合每分钟 1.5 美分。同日发布的 TTS-2 Flash 被 Inworld 称为“世界上最快的文本转语音模型”，首字节延迟 25 毫秒，价格为其一半，面向每一毫秒都重要的场景。模型已在 inworld.ai 上线，也可通过 Cloudflare、DeepInfra、LiveKit、Tencent RTC 等平台调用。需要说明的是，**“第一”“最快”“最大跃升”等表述均出自 Inworld 自身，本站未做独立核实。**