ElevenLabs 官方公布的 Eleven v3 规格、积分与许可。
ElevenLabs 是一家语音与音频平台,Eleven v3(模型 id 为 `eleven_v3`)是其旗舰语音模型,官方文档称它为「我们情感最丰富、表现力最强的语音合成模型」。ElevenLabs 会分别公布五款语音模型各自的限额,Eleven v3 只是其中之一——Multilingual v2、Flash v2.5、Flash v2 与 v3 Conversational 各有自己的语言数和单次请求字符上限,因此没有任何一个数字能代表整个家族。
本页的数字全部来自 ElevenLabs 自家页面:模型名、模型 id、限额与带日期的条目取自它的模型文档与更新日志;套餐、积分与每字符费率取自定价页与 API 定价页;克隆规则与商用条款取自声音克隆指南与帮助中心的许可页。以上每一个数字都由 ElevenLabs 设定,且它可能不经通知随时变更。
ElevenLabs 如何描述 Eleven v3 与它周边的模型
ElevenLabs 公布的是一份带逐模型限额的语音模型清单,而不是「一个模型一份规格」;Eleven v3 是厂商自己的措辞里被单独点名的那一款。它的商业模型同样具体:所有产品都从同一个共享的月度积分池里扣减,而不同模型家族的积分消耗速率并不相同。
Eleven v3 是厂商主推的那一款
当前语音线包括 `eleven_v3`、`eleven_v3_conversational`、`eleven_ttv_v3`、`eleven_multilingual_v2`、`eleven_flash_v2_5`、`eleven_flash_v2`、`eleven_multilingual_sts_v2`、`eleven_multilingual_ttv_v2` 与 `eleven_english_sts_v2`。ElevenLabs 把 `eleven_turbo_v2_5`、`eleven_turbo_v2` 与 `scribe_v1` 标为已弃用,并用「已被 `music_v2` 与 `music_v2_5` 超越」来描述 `music_v1`。
语言数属于模型,不属于家族
Eleven v3 与 v3 Conversational 覆盖 70+ 种语言。Multilingual v2 覆盖 29 种。Flash v2.5 覆盖 32 种——即那 29 种加上匈牙利语、挪威语和越南语——而 Flash v2 仅支持 `en`。把其中任何一个数字当成 ElevenLabs 的整体数字,都会把其余几个讲错。
字符上限同样按模型区分
Eleven v3 单次请求接受 5,000 字符,Multilingual v2 接受 10,000 字符。Flash v2.5 接受 40,000 字符,Flash v2 接受 30,000 字符。ElevenLabs 完全没有公布 `eleven_v3_conversational` 的单次请求字符数,也没有给出 `eleven_v3` 或 `eleven_multilingual_v2` 的延迟数据。
一个积分池,几套每字符费率
套餐从 Free 的 $0/10,000 积分一直排到 Business 的 $990/6,000,000 积分,且「所有产品都从同一个共享的月度积分池中扣减」。在 Eleven v3 上一个字符消耗 1 积分;「对 V2 Multilingual 模型,1 个文本字符等于 1 积分」;V2 Flash/Turbo 英语与 V2.5 Flash/Turbo 多语言模型则「每个字符消耗 0.5 到 1 积分」。
许可取决于你是否付费
ElevenLabs 写明:「免费套餐不包含商用许可,且不得用于任何商业用途」,而「所有付费套餐都包含商用许可,前提是你没有在使用 Beta 服务」。它补充说,在付费订阅之外创作的内容——无论在其之前还是之后——「不得用于商业用途,且以非商业方式分享时始终需要署名」。
ElevenLabs 官方写明了什么
这一节只收 ElevenLabs 自家文档写明的内容,也包括它什么都没写的地方。凡是缺数字的——v3 Conversational 的字符上限、Eleven v3 的延迟——本页直接标出这个缺口,而不是替它补上。
语音合成以一组模型的形式出售
文字转语音是以一条产品线而非单一模型发布的:`eleven_v3`、`eleven_v3_conversational`、`eleven_ttv_v3`、`eleven_multilingual_v2`、`eleven_flash_v2_5` 与 `eleven_flash_v2`,另有用于语音转语音的 `eleven_multilingual_sts_v2` 与 `eleven_english_sts_v2`。正因为限额各不相同,选型的依据是模型对照表,而不是某一条头条规格。
逐模型的语言数与请求上限
Eleven v3:70+ 种语言,单次请求 5,000 字符。Multilingual v2:29 种语言,10,000 字符。Flash v2.5:32 种语言,40,000 字符。Flash v2:仅 `en`,30,000 字符。Eleven v3 Conversational:70+ 种语言,未公布字符上限,延迟约 280ms,不含应用与网络延迟。延迟是文档里填得最不齐的一列:v3 Conversational、Flash v2.5 与 Flash v2 公布了数字(分别约 280ms、75ms、75ms),Eleven v3 与 Multilingual v2 则未公布。文档给出的数字均不含应用与网络延迟。
厂商称为独有的模型特性
ElevenLabs 把多说话人对话与音频标签列为 Eleven v3 的特性。对 Multilingual v2,它宣称「长篇生成最稳定」,并称其数字规范化最好。对 Flash v2.5,它举出「API 生成每字符价格降低 50%」,同时说明其规范化默认关闭。
声音克隆要过同意验证这一关
Instant Voice Cloning 要求你「确认你拥有克隆该声音的权利与同意」。Professional Voice Cloning 需要 Creator 及以上套餐,并使用 ElevenLabs 所称的「voice-captcha 技术」;至于微调,厂商写明「我们只允许你克隆自己的声音」,且你「在提交微调请求前会被要求通过验证流程」。这条限制的措辞是绝对的:「即使获得对方同意,你也不能克隆他人的声音。」
Speech to Text、音乐与音效
`scribe_v2` 的文档指标是 90+ 种语言、1,000 个 keyterm 与 32 位说话人的说话人分离,与它并列的还有 `scribe_v2_medical` 和 `scribe_v2_realtime`;`scribe_v1` 已弃用。音乐一系为 `music_v2_5`、`music_v2` 与 `music_v1`,音效为 `eleven_text_to_sound_v2`。对这些产品,ElevenLabs 公布的是时长与格式限制,而不是字符限制。
以厂商命名呈现的更广产品面
ElevenLabs 列出的名字包括 Dubbing(v1、v2)、Sound Effects、Eleven Music、Speech to Text (Scribe)、Text to Dialogue、Speech Engine、ElevenAgents、Voice Changer、Voice Isolator、Voice Design、Voice Remixing、Forced Alignment、Image & Video、Ads Engine、Productions、ElevenReader 与 Reception.ai。这些是厂商自己的产品名,它们的限额不在上面那张语音表之内。
有据可查的规格
以下每一行都写在 ElevenLabs 自家的文档或定价页上,且每条限额都挂在它所属的模型 id 上,而不是挂在平台整体上。
- 开发者
- ElevenLabs
- 旗舰语音模型
- Eleven v3(`eleven_v3`)
- `eleven_v3`
- 70+ 种语言 · 单次请求 5,000 字符 · 未公布延迟
- `eleven_multilingual_v2`
- 29 种语言 · 单次请求 10,000 字符 · 未公布延迟
- `eleven_flash_v2_5`
- 32 种语言 · 单次请求 40,000 字符 · 约 75ms,不含应用与网络延迟
- `eleven_flash_v2`
- 仅 `en` · 单次请求 30,000 字符 · 约 75ms,不含应用与网络延迟
- `eleven_v3_conversational`
- 70+ 种语言 · 未公布单次请求字符数 · 约 280ms,不含应用与网络延迟
- `eleven_v3` 每字符积分
- 每字符 1 积分
- V2 家族每字符积分
- V2 Multilingual:1 个文本字符等于 1 积分 · V2 Flash/Turbo 英语与 V2.5 Flash/Turbo 多语言:每字符 0.5 到 1 积分
- 每 1K 字符的 API 价格
- Eleven v3 与 v2 Multilingual 为 $0.10 · v3 Conversational 与 Flash/Turbo 为 $0.05
- 月度套餐
- Free $0(10,000 积分)· Starter $6(30,000 积分)· Creator $22(121,000 积分,首月 $11)· Pro $99(600,000 积分)· Scale $299(1,800,000 积分,3 个席位)· Business $990(6,000,000 积分,10 个席位)· Enterprise 为定制 · 所有产品都从同一个共享的月度积分池中扣减
- Instant Voice Cloning 音频
- 「至少录制 1 分钟音频」;建议使用约 1-2 分钟的清晰音频
- Professional Voice Cloning 音频
- 「我们建议的最低量是 30 分钟音频,但要达到最优效果……接近 2-3 小时音频」,微调需 3-6 小时 · 需要 Creator 及以上套餐
- 商用许可
- 免费档:「不包含商用许可,且不得用于任何商业用途」 · 付费套餐:「包含商用许可,前提是你没有在使用 Beta 服务」
官方公布的接入渠道
Eleven v3 通过 ElevenLabs 自家的平台与 API 使用。下面这些页面都是厂商自己的页面,本页引用的每一个数字都出自它们。
ElevenLabs 与 Eleven v3 常见问题
哪款模型领跑这条线,它的限额是什么?
Eleven v3,模型 id 为 `eleven_v3`,ElevenLabs 的模型文档称它为「我们情感最丰富、表现力最强的语音合成模型」。文档给出的数字是 70+ 种语言、单次请求 5,000 字符,而 ElevenLabs 没有为它公布延迟。它于 2025 年 8 月 20 日通过 API 开放,并在 2026 年 2 月 2 日结束 alpha;最初的发布时间在文档里任何地方都没有公布。
ElevenLabs 多少钱?
套餐为 Free $0/10,000 积分,Starter $6/30,000 积分,Creator $22/121,000 积分且首月 $11,Pro $99/600,000 积分,Scale $299/1,800,000 积分与 3 个席位,Business $990/6,000,000 积分与 10 个席位;Enterprise 为定制。API 生成在 Eleven v3 与 v2 Multilingual 上为每 1K 字符 $0.10,在 v3 Conversational 与 Flash/Turbo 上为每 1K 字符 $0.05。所有产品都从同一个共享的月度积分池中扣减,而在 Eleven v3 上一个字符消耗 1 积分。
ElevenLabs 的输出可以商用吗?
取决于内容是在哪个套餐下生成的,而 ElevenLabs 的措辞很直白:「免费套餐不包含商用许可,且不得用于任何商业用途」,同时「所有付费套餐都包含商用许可,前提是你没有在使用 Beta 服务」。厂商还写明,在付费订阅之外创作的内容——无论在其之前还是之后——「不得用于商业用途,且以非商业方式分享时始终需要署名」,而在付费订阅期间生成的内容「可以商业使用,且不受期限限制,但须遵守我们的服务专属条款」。
克隆一个声音需要什么?
同意与验证。Instant Voice Cloning 要求你「确认你拥有克隆该声音的权利与同意」;Professional Voice Cloning 需要 Creator 及以上套餐,使用 ElevenLabs 所称的「voice-captcha 技术」,至于微调,厂商说「我们只允许你克隆自己的声音」,且你「在提交微调请求前会被要求通过验证流程」。它明确表示拿到第三方的许可并不够:「即使获得对方同意,你也不能克隆他人的声音。」
两种克隆方式各需要多少音频?
Instant Voice Cloning 的下限是「至少 1 分钟音频」,并建议使用约 1-2 分钟的清晰音频。Professional Voice Cloning 则是另一个量级:「我们建议的最低量是 30 分钟音频,但要达到最优效果……接近 2-3 小时音频」,微调需要 3-6 小时。ElevenLabs 在自家不同页面上对 Instant Voice Cloning 的下限说法并不一致,因此这里照录文档给出的 1 分钟这一下限。
本页为什么没有截图或示例输出?
因为 ElevenLabs 没有可转载的静态产品图。它的品牌页只有 logo——「11」符号的黑白 PNG 与 SVG 版本——新闻页则多了两张人物照片,分别标注为「Co-founders」与「Team」。它文档里其余的图像全是界面截图,而界面截图并不是产品输出。一个没有图库的页面,好过一个用我们无权转载的图片凑出来的页面。