‹ 首页

qwen3-tts-apple-silicon

@qianleigood · 收录于 昨天 · 上游提交 1 个月前

Local Qwen3-TTS on Apple Silicon using MLX. Use when generating Chinese speech, testing Qwen3-TTS voices, selecting built-in speakers, applying style instructions, cloning a voice from reference audio, or designing a new voice from text descriptions on this Mac. Best for local/offline TTS, Apple Silicon/MLX validation, prompt-to-speech generation, and reusable dubbing workflows.

适合你,如果需要在 Mac 上离线生成中文语音或克隆声音

/ 通过 npx 安装 校验哈希
npx oh-my-skill add qianleigood/crawclaw/qwen3-tts-apple-silicon
/ 通过 bash 安装
curl -fsSL https://oh-my-skill.com/install.sh | bash -s -- qianleigood/crawclaw/qwen3-tts-apple-silicon
/ 已经装过?验证本机副本,不用重装
npx oh-my-skill verify qianleigood/crawclaw/qwen3-tts-apple-silicon
安装目标可用 --agent / --scope 或 --to 明确指定;省略时只会在唯一已存在的 agent 目录上自动选择,零命中或多命中会停止并提示。content_hash 缺失或不一致均拒装。
30GitHub stars
~768最小装载
~3.9K含声明引用
~3.9K文本包总量
索引托管

怎么用

商店整理自技能原文 · 版本 f27e175 · 表述以原文为准
它做什么

Claude 能通过本地脚本生成中文语音,支持选择预置发言人、克隆参考音频的声音,或根据文字描述设计新音色。

什么时候触发

当你说出需要生成中文语音、克隆声音或设计新声音时触发。

装好后可以这样说
会调用默认发言人 serena 生成 wav 文件。
需要提供参考音频和对应文字。
会使用 1.7B 模型生成新音色。
技能原文 SKILL.md作者撰写 · MIT · f27e175

Qwen3-TTS Apple Silicon

在这台 Apple Silicon Mac 上,优先通过 scripts/qwen3_tts.py 使用本地 Qwen3-TTS。

选择哪条链路
  • synth:已知 speaker + instruction 的普通合成
  • clone:给参考音频 + 准确转写,做语音克隆
  • voice-design:只给文字描述,直接设计新音色
  • list-speakers:查看当前预置 speaker
快速开始
cd /Users/qianleilei/.crawclaw/workspace/skills/qwen3-tts-apple-silicon
bash scripts/setup_env.sh
python scripts/qwen3_tts.py list-speakers

普通合成:

python scripts/qwen3_tts.py synth \
  --text "今天我们先验证一条更稳妥的本地配音方案。" \
  --speaker serena \
  --instruction "用自然、清晰、平稳的中文女声朗读。" \
  --file-prefix demo

语音克隆:

python scripts/qwen3_tts.py clone \
  --text "这是一条用于验证参考音频克隆效果的中文句子。" \
  --ref-audio /absolute/path/to/ref.wav \
  --ref-text "这是一条用于验证参考音频克隆效果的中文句子。" \
  --file-prefix clone_demo

音色设计:

python scripts/qwen3_tts.py voice-design \
  --text "今天测试一下音色设计能力。" \
  --instruction "一个自然、温和、清晰的中文女声,成熟一些,语速平稳,适合讲解和说明。" \
  --file-prefix designed
默认策略
  • synth 默认模型:mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit
  • clone 默认模型:mlx-community/Qwen3-TTS-12Hz-0.6B-Base-8bit
  • voice-design 默认模型:mlx-community/Qwen3-TTS-12Hz-1.7B-VoiceDesign-4bit
  • 默认语言:zh
  • 默认 speaker:serena
  • 默认输出目录:~/.cache/crawclaw/qwen3-tts-apple-silicon/outputs/
  • 先用 0.6B 验证链路;只有需要 VoiceDesign 时再拉起 1.7B
注意事项
  • 不要依赖 mlx_audio 的通用默认参数;对普通合成显式传 speakerlang=zh
  • clone 已绕过 generate_audio() 包装层,避免误导性的 Voice: af_heart 日志
  • 参考音频优先 5-10 秒、单人、安静、无混响,且 ref_text 尽量准确
  • 首次运行可能下载模型;未配置 Hugging Face token 时会更慢
  • 命令末尾会输出 JSON,包含 output_diraudio_files
  • 三条主命令都支持 --file-prefix
资源
  • scripts/setup_env.sh:创建 .venv 并安装依赖
  • scripts/qwen3_tts.py:统一 CLI,支持 list-speakers / synth / clone / voice-design
  • references/notes.md:实测数据、模型说明、af_heart 排查结论、warning 记录
按 MIT 许可原样转载,未经改动 · 在 GitHub 查看 →

评论

登录即可评论;带「已验证安装」的,是发布者名下有本店的安装或持有记录。