RabiSpeech Qwen3-TTS

SkillMedia

Lets your agent generate spoken audio files in different languages, personas, or cloned voices using a local text-to-speech model.

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the RabiSpeech Qwen3-TTS skill

About this skill

Generates persona-based, multilingual, or voice-cloned speech via RabiSpeech using local Qwen3-TTS 0.6B or 1.7B. Use when the user specifies Qwen3-TTS, Japanese/multilingual, local reference audio, a persona name, or model size comparison. Do not start the in-skill worker, OumuQ, or any Qwen/DashSco

What this skill tells your AI

The instructions your AI receives, as published by vb2250158/rabiroute in skills/qwen-tts-audio/SKILL.md and read by ahel’s review.

可用模型:

  • local-tts/qwen3-tts-0.6b-base:显存和冷启动较低,适合常规多语言对话。
  • local-tts/qwen3-tts-1.7b-base:更大的本地模型,质量优先时选择。

流程

先读 TTS 路由。speechBaseUrl 必须从当前服务配置取得;下例中的 $speechBaseUrl 由该发现步骤赋值。

  1. 查询 GET <speechBaseUrl>/v1/models,确认模型已安装。
  2. 把 Rabi 人格目录名作为 voice;每次请求显式发送,不能继承上一会话角色。
  3. 使用 language 指定目标语音语言,使用 instructions 提供简短风格/情绪说明。
  4. 对话用 play=true 和 session_id;测试用 play=false 保存 WAV。
$body = @{
  model = 'local-tts/qwen3-tts-0.6b-base'
  input = 'こんばんは。これはローカル音声テストです。'
  voice = '<RoleId>'
  response_format = 'wav'
  language = 'ja'
  instructions = '自然で落ち着いた会話調。'
  play = $false
} | ConvertTo-Json -Compress
Invoke-WebRequest -Method Post -Uri ($speechBaseUrl.TrimEnd('/') + '/v1/audio/speech') -ContentType 'application/json' -Body $body -OutFile '.\qwen3-tts.wav'

模型加载、参考音频选择、缓存和 worker 生命周期全部由 RabiSpeech 管理。

Signals

GitHub stars
502
Last commit
Sep 2026
Advanced
Item type
skill
Key
qwen-tts-audio
Source
github.com/vb2250158/rabiroute