dsh-omi-voice
在 DSH 回复旁增加手动朗读按钮,把清洗后的最终回答交给 macOS Omi 本机引擎,再用用户自己的豆包 TTS Key 流式合成、缓存并播放自然语音。
适合:需要连接现有产品、数据或外部业务系统的用户
已审阅固定提交的关键源码
- 配置资料
- 配置资料部分完整
- 配置难度
- 未知,待补配置
- 兼容性
- 声明兼容,尚未实测
语音与音频是 Awesome DSH Plugin 的社区细分类。本页保留上游分类,同时展示 52DSH 主分类、安装证据和权限提示。
可按名称、包名或自然语言需求搜索;结果会按字段权重和证据质量排序。
在 DSH 回复旁增加手动朗读按钮,把清洗后的最终回答交给 macOS Omi 本机引擎,再用用户自己的豆包 TTS Key 流式合成、缓存并播放自然语音。
适合:需要连接现有产品、数据或外部业务系统的用户
已审阅固定提交的关键源码
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
输入框麦克风:点击持续监控、按住对话;浏览器语音识别逐字上屏,回复由 host Edge TTS 边生成边朗读,朗读时暂停识别防回声,点击可停止。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
语音播报 agent 最终回复:Windows SAPI5 自然语音 / macOS 系统语音,自动跳过思考与工具调用,npm 一行安装。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
语音输入插件:对着麦克风说话,识别后的文字作为普通聊天消息发送(本地模型或浏览器语音识别)。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
对话完成提醒:Agent 空闲(idle)时播放提示音并弹 Windows 原生通知,可配 ding.mp3、音量与防抖节流。
适合:需要远程通知、消息、Telegram能力的用户
已进入可追溯的 Awesome 社区清单
通过 CallKit 打电话到你的手机:`call_me` 与 `text_me` 工具,并可在回合结束或等待审批时来电,语音回答转写后送回会话。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
通知出口:agent 主动通过桌面通知 / 中文语音 / 音效(炸裂、胜利、警报)联系你,60 秒确认窗口后语音呼叫,音量增强,设置面板。
适合:需要远程通知、消息、Telegram能力的用户
已进入可追溯的 Awesome 社区清单
输入框麦克风语音输入:浏览器 Web Speech API 实时转写,自动去重/续听、智能标点,支持语言与自动发送设置。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
明日方舟终末地佩丽卡主题分级提示音:计划出方案 / 任务完成 / 需要你回应 / 出错四档独立音效,普通问答保持安静;系统级播放(窗口在后台也响),跨平台(Windows/macOS/Linux),支持自定义 TTS 语音。
适合:需要DSH 界面、主题、侧边栏能力的用户
已进入可追溯的 Awesome 社区清单
基于 uisfx 的语义化 UI 音效:任务开始/成功/失败、不同按钮情景 cue,设置页即时试听,12 种音色包,Host 持久化,并提供 `ctx.uisfx` 服务给其他插件。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
语音双件套:edge-tts 免费微软神经语音合成 + OpenAI 兼容 ASR 转写。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
输入框麦克风语音输入:浏览器 Web Speech API 实时转写(Chrome/Edge),多语言切换与可选自动发送,零依赖零密钥。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。
适合:需要DSH 界面、主题、侧边栏能力的用户
已进入可追溯的 Awesome 社区清单
Web UI 免费语音闭环:浏览器语音识别输入(实时中间结果上屏)+ 助手回复朗读与自动朗读,零配置、免 API key。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
六类事件独立提示音:回合完成、审批、提问、计划评审、目标受阻、任务失败各有独立声音与音量,可在 Web 设置面板配置(内置合成音 / 静音 / 本地音频文件)。
适合:需要代码审查、代码评审、Git能力的用户
已进入可追溯的 Awesome 社区清单
Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。
适合:需要多 Agent、工作流、编排能力的用户
已进入可追溯的 Awesome 社区清单
agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。
适合:需要多 Agent、工作流、编排能力的用户
已进入可追溯的 Awesome 社区清单
浏览器 Web Speech API 语音输入:零服务端、零密钥、零模型下载(Edge=Azure 语音、Chrome=Google 语音)。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
多对话并行的声音提醒 + 对话直达:当前对话当/当当(crisp 清脆档),其他对话叮/叮叮(soft 柔和档)+ 右上角小卡片,点一下直达对应对话。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
朗读助手回复(仅支持 Fish Audio API,需自备 Key):逐条朗读、自动朗读开关,设置页可配模型、音色 reference_id、加密 API Key 与代理。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。
适合:需要DSH 界面、主题、侧边栏能力的用户
已进入可追溯的 Awesome 社区清单
Web UI 语音 AI 女友:FunASR 麦克风语音输入、Qwen3-TTS 语音回复、数字人动画窗、QQ 双向聊天(文本/语音/图片推送,经 NapCat)。
适合:需要OCR、截图识别、图片识别能力的用户
已进入可追溯的 Awesome 社区清单
Web UI 语音输入:输入框一键麦克风按钮,基于 Web Speech API 语音转文字填入草稿,可选识别后自动发送。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
国内可用的输入框语音输入。需要先启动本地 Python bridge(pip install dashscope websockets,运行 bridge/voice-bridge.py)——只装插件不可用。浏览器麦克风采集 16kHz PCM 流式转发给 bridge,由阿里云 DashScope ASR(paraformer-realtime-v2)识别;识别文字在光标处实时填入草稿,静音自动停止,可选识别后自动发送。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
基于火山流式 ASR/TTS 的实时双工语音:回复朗读、打断、唤醒词、实时字幕、30 个中文音色与先响应后思考;在 DSH monorepo 内构建。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
为 DSH Web 添加 Xiaomi MiMo 语音朗读,支持助手消息朗读、PCM 流式播放、预置与自定义音色、浏览器语音兜底、播放控制和可选 UI 音效。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
在 DeepSeek Harness 网页 UI 中朗读智能体回复,采用服务商回退链(OpenAI、ElevenLabs、Google、Azure、Groq、Deepgram、OpenRouter、Edge、Piper、eSpeak),某个服务商失败或被限流时自动切换到下一个,而不是直接静音。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
按工作区定制的任务完成铃声,以及审批、提问、计划评审、目标受阻、任务失败等需要人介入事件的注意提示音,支持内置合成音、语音播报与自定义音频。
适合:需要代码审查、代码评审、Git能力的用户
已进入可追溯的 Awesome 社区清单
面向 DeepSeek Harness Web 的 AI 音频插件 —— 多厂商 TTS、音乐、音效与音色设计,含侧边栏面板、模型对比、资源库与 Agent 工具。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
DSH 对话结束提示音:内置网络热梗原声(你干嘛哎呦、鸡你太美、神鹰哥等),设置面板可试听/切换/随机,支持自定义音频目录。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
基于全双工语音模型的 DSH 网页端中文语音交互:边听边说、随时插话,用语音输入和修改任务、提交请求、管理会话、回答 DSH 的问题,并简短播报任务完成结果。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
DSH Web 本地离线语音输入:麦克风经本地 FunASR(SenseVoiceSmall)识别后填入输入框,支持一键安装,全程离线。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
将本地高性能 TTS 引擎 GSV-TTS-Lite 实时接入 DeepSeek Harness:语音预设、自动朗读、引擎配置助手、朗读按钮与设置面板。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
输入框上的单手、免键盘输入:鼠标在输入框按住、说话、松手,文字直接进草稿;上滑取消,不留半句。不用去瞄麦克风按钮,也不用记快捷键,手始终不用离开输入区——另一只手正忙的时候,这一点才是关键。识别完全在本机完成(SenseVoice + sherpa-onnx),无需 API key,音频不出本机。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
DSH Web 的会话绑定单轮语音预览:提供无需凭证的本地合成演示和可选的 Qwen Audio,保持精确会话隔离,并仅在明确操作后将转写写入草稿,不会自动提交。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
每条回复旁的朗读按钮与输入框自动朗读开关,设置页可选服务商与音色:MiniMax 或任意 OpenAI 兼容的 /audio/speech 端点,可调音色、情绪、语速与模型。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
让 Agent 弹一曲真钢琴:Salamander Grand 真实采样音色,Canvas2D 三角钢琴与沉浸式舞台渲染,88 键可弹。
适合:需要多 Agent、工作流、编排能力的用户
已进入可追溯的 Awesome 社区清单
在每条已定稿的助手回复里、紧挨点赞按钮右侧加一个小喇叭:点击用浏览器语音引擎朗读这条回复,鼠标悬停可调倍速与音色。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
让你的 DSH 用你喜欢的声音开口说话、汇报内容,过长的汇报先压缩再念。角色声线不需要自己训练:一段 3-10 秒参考音就能克隆,也能直接用别人训练好的模型;不必为此装一整套 6.4 GB 的 GPT-SoVITS —— 运行时和声线都由插件自己装好。已有 GPT-SoVITS 的话也能直接接上,两者跑的是同一套声线。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
双 MediaPlayer 守护进程($think 思考循环 + $fx 一次性音效)支持音量闪避、情绪感知音效(连续成功/失败/长时间运行自动触发 smooth/struggle/deep_think)、15 种正弦/方波合成内置音、51 个工具分类映射、自定义 WAV/MP3 直替自动转换,以及完整设置页含深色模式修复。
适合:需要增加一种明确的 Agent 工具能力的用户
已进入可追溯的 Awesome 社区清单
DSH 免费对口型口语视频生成插件,支持 3000+ 声音和 500+ 语言。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
用 DeepSeek 网页端自带的朗读,把 DSH 里的对话念出来,靠一个小浏览器扩展驱动。
适合:需要浏览器、网页自动化、联网能力的用户
已进入可追溯的 Awesome 社区清单
AI 回复流式 TTS 朗读插件,思考等待期有文字与语音同步的趣味短语反馈。内置 Edge TTS,支持任意 OpenAI 兼容云端引擎。
适合:需要插件安装、插件管理、插件更新能力的用户
已进入可追溯的 Awesome 社区清单
为 DSH 提供持续语音对话,支持免提监听、按住说话、语音识别、TTS 语音回复和后台 Agent 任务委派。
适合:需要多 Agent、工作流、编排能力的用户
已进入可追溯的 Awesome 社区清单
如何理解状态:核验状态说明 52DSH 检查到哪一步;配置资料状态说明能否只依靠本站完成配置;兼容状态和运行实测另行判断。三者不能互相替代。包含高权限能力的插件应先阅读详情中的权限说明。
不是。社区收录、源码或清单核验、当前 DSH 版本运行实测是三个独立状态,请以卡片和详情页标记为准。
不建议。先锁定版本,在独立 Web Profile 中使用测试数据验证配置、权限、数据存储和卸载清理。