tts-voice-synthesis skill
影片与视频编辑、内容创作者在制作视频配音或有声书时,当需要克隆音色、生成情感化配音或流式实时语音合成请用此技能。支持1.7B高质量与0.6B快速双模型,一键实现多语言方言配音,让语音创作更高效更自然。
A100/100content scan
Is the tts-voice-synthesis skill safe?
Clean: nothing in its files matched our rules. We read 6 files in the folder on 2026-09-28.
No findings.
Install the tts-voice-synthesis skill
A skill is a folder. Copy it into your agent's skills folder and the agent loads it when the task matches its description.
git clone --depth 1 https://github.com/anbeime/skill.git /tmp/skill mkdir -p ~/.claude/skills cp -r /tmp/skill/skills/tts-voice-synthesis ~/.claude/skills/tts-voice-synthesis
available in every project
In the Claude apps, zip the folder and upload it from the Skills settings. The folder on GitHub
The instructions your agent would load
SKILL.md as published, without the frontmatter. Read it on GitHub
TTS 语音合成服务
任务目标
- 本 Skill 用于:将文本转换为高质量语音,支持音色克隆、情感适配、流式生成和多语言支持
- 能力包含:
- 角色音色自动采集与克隆(从参考音频提取音色特征)
- 拟人化语义适配配音(根据文本情绪自动调整语音语调、语速、音调)
- 流式实时配音(支持边输入文本边生成语音)
- 多语言与方言支持(中文、英文及多种方言)
- 双模型选择(1.7B 高质量模型、0.6B 快速模型)
- 触发条件:当需要将文本转换为语音、克隆特定音色、生成情感化配音时使用
前置准备
- 模型下载:根据选择的 TTS 模型下载对应的权重,详见 references/model_config.md
- 硬件要求:
- GPU:推荐使用 8GB+ 显存的 GPU(0.6B 模型可在 CPU 上运行)
- 内存:建议 16GB+ 系统内存
- 磁盘空间:至少 10GB 可用空间(模型权重约 3-5GB)
- 依赖配置:确保已安装所需的 Python 依赖包
操作步骤
模式一:基础语音合成
- 文本准备
- 确认待合成的文本内容
- 智能体将分析文本情绪和语义特征
- 选择音色
- 使用预置音色(见 references/model_config.md)
- 或使用已克隆的自定义音色
- 执行合成
- 调用 scripts/tts_generate.py 进行语音生成
- 根据情绪分析结果自动设置语音参数
- 验证输出
- 检查生成的音频质量和情感匹配度
- 如有需要,调整参数重新生成
模式二:音色克隆
- 准备参考音频
- 提供目标音色的参考音频文件(3-30 秒,清晰语音)
- 确保参考音频无背景噪音、音质清晰
- 提取音色特征
- 调用 scripts/voice_clone.py 提取音色特征
- 保存为可复用的音色模型
- 使用克隆音色
- 使用提取的音色模型生成语音
- 可应用于不同文本的配音
模式三:流式实时配音
- 文本分段
- 将长文本分段处理(智能体自动完成)
- 确保分段自然,不会截断语义
- 流式生成
- 调用 scripts/tts_generate.py 启用流式模式
- 逐步生成并输出音频片段
- 实时合并
- 将生成的音频片段实时合并
- 输出完整的配音文件
模式四:情感适配配音
- 文本情绪分析
- 智能体分析文本的情绪倾向(高兴、悲伤、愤怒、平静等)
- 识别关键情感词和语气
- 语音参数调整
- 根据情绪自动调整:
- 语速(悲伤时放慢,兴奋时加快)
- 音调(悲伤时降低,兴奋时提高)
- 音量(根据情感强度调整)
- 生成验证
- 生成情感化语音
- 验证情感表达是否准确
资源索引
- 核心脚本:
- scripts/tts_generate.py(TTS 语音生成)
- scripts/voice_clone.py(音色克隆)
- 参考文档:
- references/model_config.md(模型配置和选择指南)
- references/emotion_guide.md(情感标注和适配指南)
- references/usage_examples.md(使用示例)
注意事项
- 模型选择:
- 1.7B 模型:音质更高,适合高质量配音、有声书等场景
- 0.6B 模型:速度更快,适合实时交互、智能客服等场景
- 音色克隆:
- 参考音频应清晰、无背景噪音
- 时长建议 5-15 秒,最短不少于 3 秒
- 单人语音效果最佳,避免多人混合音频
- 流式生成:
- 适合长文本和实时交互场景
- 会产生多个临时音频片段
- 情感适配:
- 文本情绪分析由智能体完成
使用示例
- 基础语音合成:
python scripts/tts_generate.py \
--text "你好,欢迎使用语音合成服务" \
--output_path ./output/hello.wav \
--model_size 1.7B \
--voice default- 音色克隆:
python scripts/voice_clone.py \
--reference_audio ./reference.wav \
--voice_name my_voice \
--output_dir ./voices- 情感化配音:
python scripts/tts_generate.py \
--text "今天真是太开心了!" \
--output_path ./output/happy.wav \
--emotion happy \
--speed 1.2 \
--pitch 1.1- 流式生成:
python scripts/tts_generate.py \
--text_file ./long_text.txt \
--output_path ./output/stream_output.wav \
--streaming trueMore skills from anbeime/skill
- APDF Processing Pro综合办公文员与软件开发工程师当需要批量处理PDF表单、提取表格或进行OCR识别时,使用内置脚本一键完成自动化提取与数据校验,彻底告别繁琐的手动录入,让复杂文档工作流高效、稳健落地。
- Aagent-team产品经理与项目管理专家在应对复杂项目时,使用此技能可动态组建包含“执行、指挥、评审”的专属AI团队。实时查看多智能体辩论与决策全过程,共享统一上下文记忆,一键完成从会议决策到系统构建的全流程高效协同!
- Aagentkit-multimedia-shopping电商运营与内容创作者在需要制作带货短视频时,用此技能一键生成9:16竖屏数字人成片。自动编排AI绘画、语音合成与视频生成,快速产出“小省导购员”专属形象与专业配音,让多模态视频制作省时省力。
- Aantinet-doc-parse软件开发工程师与数据科学家在构建RAG系统时,当需处理PDF/Word/Excel等多格式复杂文档,用此技能可自动触发三级解析降级,一键输出高置信度结构化Markdown与元数据,免去繁琐清洗,直接夯实企业知识库数据底座!
- Aantinet-four-color-cards财务和投资分析师、律师助理与法律助手在撰写金融研报或分析法律文档时,必用此技能!基于解析文档一键生成事实蓝卡、解释绿卡、风险黄卡与行动红卡。自动完成深度剖析与风险排查,产出100%可溯源的结构化四色报告,让复杂分析高效且严谨。
- Aantinet-provenance软件开发工程师与信息安全分析师在构建多智能体系统时,当需全链路可观测与安全审计,请用此技能。它自动收集操作日志,生成可追溯证据链与向量索引,开箱即用实现系统审计与精准回放,让Agent运行安全透明。
- Aantinet-security-scan信息安全分析师与软件开发工程师在搭建文档处理流水线时,当需要拦截违规文件或外部URL,请挂载此技能作为强制前置安检,自动输出 pass/reject 判定与详细合规扫描报告,一键守住零信任安全底线。
- AarchifyCreate polished, validated architecture, workflow, sequence, data-flow, and lifecycle/state diagrams as explorable standalone HTML with inline SVG, dark/light themes, optional trace motion, and PNG/JPEG/WebP/SVG/WebM export. Accept plain-language requirements or pasted Mermaid flowchart, sequenceDiagram, and stateDiagram input; inspect repository evidence when the diagram must reflect real code. Use when the user asks to visualize system architecture, infrastructure, cloud/security/network topology, technical workflows, API call sequences, request lifecycles, data pipelines, ETL/ELT, data lineage, state machines, or to convert/beautify Mermaid.
- Aarticle-illustrator内容创作者与自媒体创作者在撰写长文缺乏视觉辅助时,当需要给文章配图或生成插图请使用。自动分析文章结构,精准识别位置并生成插画插入段落,将抽象概念具象化。一键完成智能图文排版,省去手动找图时间,大幅提升阅读体验!
- Aarticle-illustrator内容创作者和自媒体创作者在撰写长文时,当需要“给文章配图”或“添加插图”时使用。自动分析文章结构,精准识别需要视觉辅助的位置,生成并插入契合语境的插画,将抽象概念具象化,一键完成高质量图文排版,大幅提升阅读体验。
- Aatutun-xhs-cover阿囤囤风格小红书封面提示词生成。用于AI工具、效率方法、产品测评、教程部署、个人经验、播客推荐、职场认知类内容的爆款竖版封面设计。特点是真人出镜、超大柔和浅黄(#FDFFA7)/白色中文标题、粗黑描边、人物抠图描边、绿色勾选清单、emoji贴纸、箭头标注、高对比高密度构图。关键词:小红书封面、爆款封面、阿囤囤风格、AI教程封面、产品测评封面、封面提示词。
- Abaoyu-format-markdown技术写作员与内容创作者在处理纯文本或 Markdown 稿件时,若需优化文章结构、添加 frontmatter 或自动修正中英文排版间距,使用此技能可一键生成专业美观的 {filename}-formatted.md 文件,让文档排版更完美。