AI API
官网
官网
官网
  1. 小米
  • 关于
    • 平台介绍
  • 对话
    • 原生Claude格式
      POST
    • Gemini 对话
      POST
    • /v1/chat/completions
      POST
  • GrsAI
    • Sora2
      • 上传角色接口
      • 生成视频
    • Banana
      • 创建任务
      • 查询结果
    • GPT
      • 创建图片任务
  • Wuyin
    • 生图
      • Banana
      • Banana 2
  • 视频生成
    • 统一接口
      • 创建任务
    • Grok
      • 视频生成
      • 查询任务
      • 创建任务 (Json)
    • Veo
      • Veo 官方格式
    • Sora
      • 创建视频
      • 获取视频任务状态
      • 获取视频内容
    • Seedance
    • Omni
      • 创建任务
    • Seedance 2
      • 创建任务
    • /volc/v1/contents/generations/tasks
      POST
    • Sora Lingya
      POST
    • 创建任务
      POST
    • /v1/video/create
      POST
    • Sora 逆向
      POST
    • 结果查询
      GET
    • /v1/videos
      POST
    • /v1/cool/generate
      POST
    • Sora(form data)
      POST
  • 生图
    • Photo
      • 生成图片
      • GPT生成图片
      • Gemini 2.5 Flash 生成图片
    • OpenAI
      • 生图
      • 图片编辑
    • 通义千问OpenAI格式
      • 生图
    • GPT Image
      • GPT Image 2 生图
      • GPT Image 2 异步生图
      • GPT Image 2 异步生图 Copy
  • 视频任务
    • Sora
      • 查询结果
      • 创建任务
    • Grok
  • 🔊 音频
    • 小米
      • MiMo-V2-TTS
      • MiMo-V2.5-TTS 系列
      • 语音合成(MiMo-V2-TTS)
        POST
    • 原生Gemini格式
      • 语音合成
    • OpenAI
      • 文本转语音
      • 语音转文本
      • 音频翻译
  • 🎵 音乐
    • Suno
      • 生成歌曲
  • 嵌入(Embeddings)
    • 原生OpenAI格式
    • 原生Gemini格式
  • 获取模型列表
    GET
  • /v1/videos
    POST
  1. 小米

MiMo-V2-TTS

采用流式调用时,输出音频的格式请指定为 pcm16,以便拼接成完整音频。

MiMo-V2-TTS

可选预置音色

使用时,可在 {"audio": {"voice": "mimo_default"}} 中设置预置音色。

音色名voice 参数
MiMo-默认mimo_default
MiMo-中文女声default_zh
MiMo-英文女声default_en

最终生成结果 在 $.choices[0].message.audio.data

风格控制

语音整体风格控制

将 style 置于转换目标文本开头,其中 style 为需要生成的音频风格。如需设置多种风格,请将多个风格名称置于同一个 标签内,分隔符不限。

格式示例:<style>风格1 风格2</style>待合成内容。

以下是一些推荐使用的风格,支持使用不在列表中的风格。

风格类型风格示例
情绪变化开心/悲伤/生气
角色扮演孙悟空/林黛玉
风格变化悄悄话/夹子音/台湾腔
方言东北话/四川话/河南话/粤语
语速控制变快/变慢

样例:

开心明天就是周五了,真开心! 东北话哎呀妈呀,这天儿也忒冷了吧!你说这风,嗖嗖的,跟刀子似的,割脸啊! 粤语呢个真係好正啊!食过一次就唔会忘记! 唱歌原谅我这一生不羁放纵爱自由,也会怕有一天会跌倒,Oh no。背弃了理想,谁人都可以,哪会怕有一天只你共我。

音频标签细粒度控制

通过 [音频标签] ,你可以对声音进行细粒度控制,精准调节语气、情绪和表达风格——无论是低声耳语、放声大笑,还是带点小情绪的小吐槽,也可以灵活插入呼吸声,停顿,咳嗽等,都能轻松实现。语速同样可以灵活调整,让每句话都有它该有的节奏。

样例:

(紧张,深呼吸)呼……冷静,冷静。不就是一个面试吗……(语速加快,碎碎念)自我介绍已经背了五十遍了,应该没问题的。加油,你可以的……(小声)哎呀,领带歪没歪?
(极其疲惫,有气无力)师傅……到地方了叫我一声……(长叹一口气)我先眯一会儿,这班加得我魂儿都要散了。
如果我当时……(沉默片刻)哪怕再坚持一秒钟,结果是不是就不一样了?(苦笑)呵,没如果了。
(寒冷导致的急促呼吸)呼——呼——这、这大兴安岭的雪……(咳嗽)简直能把人骨头冻透了……别、别停下,走,快走。
(提高音量喊话)大姐!这鱼新鲜着呢!早上刚捞上来的!哎!那个谁,别乱翻,压坏了你赔啊?!

修改于 2026-05-12 10:17:19
上一页
Grok
下一页
MiMo-V2.5-TTS 系列
Built with