speak-louder
An objective review tool for solo speech recordings, combining audio physical signals and semantic structure analysis to restore actual expression effect and locate expression structure issues.
Suggested prompts
Combined with the physical signal analysis results and transcript of my work report recording, help me conduct an objective review to judge whether I delivered the core content properly.
Combined with the analysis results and transcript of my interview practice recording, help me review my expression rhythm and core content delivery effect
Based on the physical signal data and transcript of my trial teaching recording, help me find structural problems that drag down the expression of core content
About this skill
Speak Louder
不替你把录音说得更好听,先还原它究竟发生了什么。
Speak Louder 是面向单人表达录音的真实复盘 Skill。它结合声音的物理信号、逐字稿和具体场景,分析一段演讲、面试、销售、课程或工作汇报是否把内容说到了应有的位置。
它不是鼓励型陪伴,也不是标准话术训练器。最佳听众关心一个人说完以后处在什么状态;Speak Louder 只关心一件更硬的事:在那段录音里,你实际上说成了什么样。
它做什么
- 读取录音的时长、语流、停顿、声音能量变化和峰值位置。
- 结合逐字稿,检查真正有价值的内容是否被声音和结构拖累。
- 结合场景、听众与目标,判断表达力度是否用在对的地方。
- 只在录音显示结构问题时,提供有限且可验证的重组建议。
适用场景
- 工作汇报与项目陈述
- 面试与答辩练习
- 销售、课程、培训与路演录音
- 一段想认真复盘的独白、演讲或发言
当前版本只支持单人表达。多人会议、谈判、心理诊断、人格评估和医疗判断不在范围内。
证据纪律
任何结论都要回到以下至少一种证据:录音时间点、逐字稿原文、物理信号,或用户已说明的现场信息。
输出时分清三层:
- 事实:录音或逐字稿里能直接听见、看见的内容。
- 判断:事实在当前场景下可能意味着什么。
- 待确认:缺少听众反馈、现场关系或录音环境时无法下定论的部分。
录音里没有的优点,不编出来;已经妨碍表达的问题,不绕开。结构本来有效时,直接说明不需要改,不为挑刺而制造问题。
快速开始
python3 -m pip install -r requirements.txt
python3 scripts/speech_analyze.py /path/to/recording.m4a
脚本支持 wav / m4a / mp3 / flac;音频转换在 macOS 用内置 afconvert,其他系统需安装 ffmpeg。脚本输出声音物理信号 JSON;逐字稿可由任意合规的本地或云端转写服务生成,再连同录音分析结果、表达场景与用户目标交给智能体判断。
隐私
录音和逐字稿通常包含敏感信息。
- 只分析你有权使用的录音;涉及他人时,先取得必要授权。
- 默认在本地处理物理信号;如使用外部转写服务,由使用者自行确认服务条款、费用与数据去向。
- 密钥仅通过环境变量或本地配置提供,不要提交到 Git。
- 不要把真实录音、逐字稿、客户名、面试公司或内部项目材料提交到示例目录。
目录
speak-louder/
├── README.md
├── SKILL.md
├── LICENSE
├── requirements.txt
├── scripts/
│ └── speech_analyze.py
└── examples/
└── fictional-report.md
许可
代码与文档以 MIT License 发布。