qwen3-tts-apple-silicon
Local Qwen3-TTS on Apple Silicon using MLX. Use when generating Chinese speech, testing Qwen3-TTS voices, selecting built-in speakers, applying style instructions, cloning a voice from reference audio, or designing a new voice from text descriptions on this Mac. Best for local/offline TTS, Apple Silicon/MLX validation, prompt-to-speech generation, and reusable dubbing workflows.
适合你,如果需要在 Mac 上离线生成中文语音或克隆声音
/ 通过 npx 安装 校验哈希
npx oh-my-skill add qianleigood/crawclaw/qwen3-tts-apple-silicon/ 通过 bash 安装
curl -fsSL https://oh-my-skill.com/install.sh | bash -s -- qianleigood/crawclaw/qwen3-tts-apple-silicon/ 已经装过?验证本机副本,不用重装
npx oh-my-skill verify qianleigood/crawclaw/qwen3-tts-apple-silicon安装目标可用 --agent / --scope 或 --to 明确指定;省略时只会在唯一已存在的 agent 目录上自动选择,零命中或多命中会停止并提示。content_hash 缺失或不一致均拒装。
30GitHub stars
~768最小装载
~3.9K含声明引用
~3.9K文本包总量
索引托管
怎么用
商店整理自技能原文 · 版本 f27e175 · 表述以原文为准它做什么
Claude 能通过本地脚本生成中文语音,支持选择预置发言人、克隆参考音频的声音,或根据文字描述设计新音色。
什么时候触发
当你说出需要生成中文语音、克隆声音或设计新声音时触发。
装好后可以这样说
会调用默认发言人 serena 生成 wav 文件。
需要提供参考音频和对应文字。
会使用 1.7B 模型生成新音色。
技能原文 SKILL.md
Qwen3-TTS Apple Silicon
在这台 Apple Silicon Mac 上,优先通过 scripts/qwen3_tts.py 使用本地 Qwen3-TTS。
选择哪条链路
- 用
synth:已知 speaker + instruction 的普通合成 - 用
clone:给参考音频 + 准确转写,做语音克隆 - 用
voice-design:只给文字描述,直接设计新音色 - 用
list-speakers:查看当前预置 speaker
快速开始
cd /Users/qianleilei/.crawclaw/workspace/skills/qwen3-tts-apple-silicon bash scripts/setup_env.sh python scripts/qwen3_tts.py list-speakers
普通合成:
python scripts/qwen3_tts.py synth \ --text "今天我们先验证一条更稳妥的本地配音方案。" \ --speaker serena \ --instruction "用自然、清晰、平稳的中文女声朗读。" \ --file-prefix demo
语音克隆:
python scripts/qwen3_tts.py clone \ --text "这是一条用于验证参考音频克隆效果的中文句子。" \ --ref-audio /absolute/path/to/ref.wav \ --ref-text "这是一条用于验证参考音频克隆效果的中文句子。" \ --file-prefix clone_demo
音色设计:
python scripts/qwen3_tts.py voice-design \ --text "今天测试一下音色设计能力。" \ --instruction "一个自然、温和、清晰的中文女声,成熟一些,语速平稳,适合讲解和说明。" \ --file-prefix designed
默认策略
synth默认模型:mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bitclone默认模型:mlx-community/Qwen3-TTS-12Hz-0.6B-Base-8bitvoice-design默认模型:mlx-community/Qwen3-TTS-12Hz-1.7B-VoiceDesign-4bit- 默认语言:
zh - 默认 speaker:
serena - 默认输出目录:
~/.cache/crawclaw/qwen3-tts-apple-silicon/outputs/ - 先用 0.6B 验证链路;只有需要 VoiceDesign 时再拉起 1.7B
注意事项
- 不要依赖
mlx_audio的通用默认参数;对普通合成显式传speaker与lang=zh clone已绕过generate_audio()包装层,避免误导性的Voice: af_heart日志- 参考音频优先 5-10 秒、单人、安静、无混响,且
ref_text尽量准确 - 首次运行可能下载模型;未配置 Hugging Face token 时会更慢
- 命令末尾会输出 JSON,包含
output_dir与audio_files - 三条主命令都支持
--file-prefix
资源
scripts/setup_env.sh:创建.venv并安装依赖scripts/qwen3_tts.py:统一 CLI,支持list-speakers/synth/clone/voice-designreferences/notes.md:实测数据、模型说明、af_heart排查结论、warning 记录
按 MIT 许可原样转载,未经改动 · 在 GitHub 查看 →
评论
登录即可评论;带「已验证安装」的,是发布者名下有本店的安装或持有记录。
…