MiniMax Speech 2.6 HD: AI Audio & Music

Speech-2.6-hd 是 MiniMax 的高清文本转语音模型,可将书面文本转换为自然、接近真人的音频。它能生成录音室级语音,发音清晰、节奏流畅、情感逼真且无背景噪声。

📝

Overview

About this model

Speech-2.6-hd 是由 MiniMax 开发的先进高清文本转语音模型,旨在将书面文本转换为自然、接近真人的音频。借助先进的神经网络架构和复杂的数字信号处理技术,该模型能够生成录音室级语音,具有清晰的发音、流畅的节奏和逼真的情感表达。它还能够生成无背景噪声的音频,带来沉浸式且专业的聆听体验。

Speech-2.6-hd 适用于有声书、播客、视频旁白和辅助技术等多种场景,兼具灵活性与技术精准度。模型支持音高、音量、语速和情绪等多项可自定义参数,让用户能够根据具体的风格和技术要求调整Output,是创意和专业应用的理想选择。

1制作引人入胜的播客和广播节目
2为视频内容制作专业旁白
3为游戏或虚拟助手生成互动叙事
4将书面文章转换为无障碍音频格式
5以多样的情绪语气制作动态有声书
💰

Pricing & Value

Cost analysis

muapiapp$0.65 per generation

Muapiapp offers a highly competitive rate, being 20-50% more affordable than other providers while delivering comparable or superior quality.

Fal.ai$0.85 per generation

Fal.ai charges $0.85 per generation. Muapiapp is 20-50% cheaper, making it a more cost-effective solution without loss of performance.

Replicate$0.85 per generation

Replicate's rate of $0.85 per generation contrasts with muapiapp, which is significantly more affordable by 20-50%, offering an excellent balance between cost and quality.

** Competitor pricing is estimated based on similar model architectures and usage tiers.

⚙️

Technical Details

Configuration schema

Promptstring

要转换为语音的文本。每个字符计为 1 个 Token。最多 10000 个字符。可在单词之间使用 <#x#> 控制停顿Durata(0.01-99.99 秒)。

Default ValueEvery journey begins with a single moment of courage. Today, that moment is yours.
声音 IDEnum (472 options)

目标声音 ID。请使用已训练的声音 ID(https://muapi.ai/playground/minimax-voice-clone),或使用以下系统声音 ID 之一。

Default ValueFriendly_Person
音量int

音量。范围:0.1-10.0,其中 1.0 为正常音量。

Default Value1
音高int

音高。范围:-12 至 12,其中 0 为正常音高。

Default Value0
情绪Enum (7 options)

生成语音的情绪。

Default Valuehappy
英语规范化boolean

此参数Supportato英语文本规范化,可提升数字朗读场景的表现。

Default Valuefalse
采样率Enum (6 options)

生成声音的采样率。

Default Value8000
比特率Enum (4 options)

生成声音的比特率。

Default Value32000
频道Enum (2 options)

he number of channels of the generated audio. 1: mono, 2: stereo.

Default Value1
FormatoEnum (4 options)

生成声音的格式。

Default Valuemp3
Lingua增强Enum (41 options)

增强对指定语言和方言的识别能力。

Default Valueauto
📖

Implementation Guide

Developer documentation

Come Usare Speech-2.6-hd

  1. 准备文本

    • 编写需要转换为语音的文本,确保内容清晰且结构良好。如果需要精确控制停顿时长,可在词语之间使用 <#x#> 语法。
  2. 选择声音

    • 从可用列表中选择最适合内容的 voice_id(例如 Friendly_Person)。它决定生成音频的语气和个性。
  3. 自定义参数

    • 调整 speedvolumepitchemotion 等参数,以匹配目标音频效果。如果处理数字朗读或特殊文本,请启用 english_normalization
  4. 设置技术规格

    • 选择所需的 sample_ratebitratechannel 配置和 format,确保音频符合质量与兼容性要求。
  5. 生成并检查

    • 将Input提交到端点并检查生成的音频,确认Output符合预期的风格和技术要求。
  6. 按需迭代

    • 如果需要调整参数,请进行修改并重新生成音频,直到达到理想效果。

Common Questions

Frequently asked

使用 Speech-2.6-hd 可以转换哪些类型的文本?

你可以将最多 10,000 个字符的任意文本内容转换为高质量音频。模型支持使用 `<#x#>` 语法控制停顿,以便在语音生成过程中进行精确的时间调整。

模型如何处理语音中的情感表达?

模型提供 `emotion` 参数,可指定生成语音的情绪语气(例如 happy、sad、angry),帮助为音频增加细腻度和表现力。

每次生成的价格是多少?

使用 Speech-2.6-hd 生成音频的费用为每次 $0.65,在保持质量的同时具有较高性价比。

可以调整采样率和比特率等技术参数吗?

可以。你可以完全控制 `sample_rate`、`bitrate`、`channel`(单声道或立体声)以及Output格式(mp3、wav、pcm、flac),以便根据需求定制音频。