AI 小龙哥

AIXLG EXPERIENCE PACK · 2026

为了一个好声音,
我试了 100+ 次。

从腾讯到阿里,从云端付费到本地开源,从“越调越坏”到只留下三档。不是为了追最贵模型,而是让任何人都能拥有一对能长期复现的主播。

三档当前均不按字符持续付费;本地硬件、电力、存储和网络仍有成本。

01 / LISTEN

同一份中英文男女混搭稿,听三档真实差别

宁宁与明明交替 8 轮;统一 48kHz、单声道、192kbps 和约 −18 LUFS。播放一条时,其他音频会自动暂停。

A低配版Edge

快、轻、够用

晓晓 + 云希。适合快讯、草稿和一次性内容,不需要 API Key。

成品
71.06 秒
整链
19.28 秒
本机内存
几乎不占模型内存
B中配版LuxTTS

日常生产甜点位

02 女声 + 02 男声。4 候选 / 段自动筛选,兼顾真人感、速度和资源。

成品
68.97 秒
整链
34.62 秒
MPS
约 1.40 GB
C高配版Qwen3-TTS

正式节目的上限

1.7B Base BF16。人物感与双语上限最高,适合品牌声音和长期收藏。

成品
63.98 秒
整链
43.58 秒
Metal 峰值
约 10.75 GB

机器质检:三档全文 ASR 0.9919 / 1.0000 / 0.9954,声纹、响度、格式与完整解码通过。自然度仍以你的耳朵为准。

02 / THE JOURNEY

执着不是一直换模型,
是把失败变成下一次的规则。

  1. 01
    腾讯云:先让声音能播

    横评 11 个男声音色,解决中文播报,也看见切英文、持续调用费和身份割裂。

  2. 02
    Edge / macOS:把调用费降到零

    云扬、云健、云希、晓晓、晓伊等同稿试听,确认免费路线适合快讯,但不是唯一御用。

  3. 03
    VoxCPM2 / CosyVoice:追“超自然”

    声音撕裂、BGM、nospeech、英文残片都没有被剪掉遮丑,而是成为长段止损线。

  4. 04
    Qwen3-TTS:先选演员,再冻结身份

    VoiceDesign 负责造人;入选后固定参考 WAV、逐字 ref_text、seed、参数和 SHA。

  5. 05
    LuxTTS:找到日常生产甜点位

    轻量 MPS 克隆把资源压到约 1.4GB,最终形成低、中、高三档,而不是再追一个万能模型。

03 / COST TRUTH

为什么没有默认上付费 3.0?

阿里云托管 Qwen3-TTS API 当前按字符计费,免费额度也有期限。它适合免部署和弹性调用,但长期栏目没必要每一期都为同一种能力重复付费。

事实边界:Qwen3-TTS 和 Fun-CosyVoice 3 都有官方开源版本。我们放弃的是长期依赖付费托管 API,不是否认开源 3.0。

04 / STARTER KIT

把“宁宁、明明”换成你自己的名字

名字只是角色标签。真正的身份来自参考音频、精确文本、模型、参数、seed、分段规则和哈希。

1

下载经验包

包含完整复盘、安装说明和主播设计提示词。

下载 ZIP
2

设计原创主播

不模仿真人,用年龄感、距离、节奏和情绪描述一个新演员。

下载提示词
3

安装三档模型

从一条 Edge 命令,到 LuxTTS MPS,再到 Qwen3-TTS Base。

下载安装说明
给 Codex / 其他 AI 的开箱提示词
你现在要为我的播客建立一套可长期复现的双主播 TTS。

不要模仿任何真人。请用同一份包含中文、English、数字和专有名词的稿件,分别生成低配、中配、高配三档。

女主播叫「{女主播名}」,男主播叫「{男主播名}」。所有候选统一 48kHz 单声道、约 -18 LUFS;不得变速或用更响取巧。

中配和高配先各生成多个候选供我人耳选角;选中后冻结参考 WAV、准确 ref_text、seed、模型版本、参数和 SHA-256。长稿按短语义段生成,失败段整段重来,禁止裁词拼字。

最后交付三条 A/B/C、运行时间、内存、ASR、声纹、命令与日志。机器通过不等于我已验收。