证据快照复核于 2026-09-10GitHub 数据核对日期: 2026-08-21
证据已验证Plugin Bundle界面与体验Web Profile

DSH Voice Scribe

通过 Alt 键或麦克风控件,把语音听写到 DSH Web 输入框。

快速了解

它能做什么

通过 Alt 键或麦克风控件,把语音听写到 DSH Web 输入框。

本站提供的是中文说明,不代表该项目或 Plugin 自身提供中文界面;语言支持请以上游文档为准。

使用场景
界面与体验media-captureUI集成
适配技术
Webmicrophoneoptional-cloud-asroptional-llm-provider
兼容性

Web Profile
>=0.1.0-rc.6; declared pre-release ranges in package manifest

可信度与状态

证据已验证
核对日期 2026/9/9 UTC 14:22

有代码证据的贡献

它为 DSH 增加什么

DSH 输入框语音输入

为输入框添加麦克风控件和 Alt 键听写,将转写内容追加到草稿中。

机制证据

选择前先看

DSH Voice Scribe 是为 DSH Web 输入框提供语音转文字的插件。点击麦克风或使用 Alt 键录音后,转写内容会追加到现有草稿。自动模式优先使用本地 SenseVoice,无法使用时回退到浏览器 Web Speech;也可选配兼容 OpenAI 的云端 ASR 和 DSH 模型润色。

适合谁

希望免手动输入的 DSH Web 用户,尤其是希望优先使用本地转写、再按需使用浏览器或云端语音服务的用户。

常见任务

  • 口述提示词或聊天草稿,同时保留输入框中已有的文字。
  • 使用本地离线 SenseVoice 转写,并自动检测语言。
  • 用可选热词替换文件修正反复识别错误的人名或项目术语。
  • 按需使用已配置的 DSH 模型润色转写结果。

权限与数据

语音转写需要录音权限;数据处理方式取决于所选择的识别引擎。

权限
  • 需要麦克风权限来录制语音。
  • 配置可选云端 ASR 时需要 API 密钥。
数据处理
  • README 声明,本地 SenseVoice 模式下音频不会离开设备。
  • 浏览器 Web Speech 由浏览器语音服务处理。
  • 云端 ASR 可将音频发送到所配置的外部端点。
  • README 声明,云端 ASR 密钥存储在服务端。
  • 自定义润色提示词声明存储在服务端。
  • 可选热词规则从 `$DSH_HOME/voice/hot.txt` 读取。
外部服务
  • 本地引擎不可用时,可能使用浏览器 Web Speech 服务。
  • 可配置兼容 OpenAI 的云端 ASR 端点。
  • 可选润色会复用已配置的 DSH 模型。
凭据
  • 本地和浏览器识别未声明需要 API 密钥。
  • 仅配置云端 ASR 时需要 API 密钥。

局限

  • 浏览器 Web Speech 依赖外部语音服务,在部分网络或浏览器版本中可能不可用。
  • 草稿中含有 `@` 引用芯片时,插入转写可能会将芯片展开为纯文本。
  • 本地模型首次使用时需要下载约 230 MB。
  • 文档列出的最长录音时长约为:本地识别 4 分钟、云端识别 10 分钟。

DSHub 已核对

  • 已验证固定 Git 源及 DSH bundle 结构。
  • 包清单声明了 Node.js 18+ 和 DSH LLM peer dependency 范围。
  • README 记录了 DSH Web 安装方式、语音操作、识别选项和声明的兼容性。

DSHub 未核对

  • 本次整理未实际执行安装或测试麦克风行为。
  • 未独立测试识别准确率、模型下载、网络可用性或云端 ASR 故障切换。
  • 未审计已发布 npm 包的内容。

固定版本安装

安装 DSH Voice Scribe

这个Plugin Bundle没有 DSH Plugin 安装操作,请根据源码文档使用真实交付方式。

访问源码项目

维护者原文

项目 README

查看 commit 7a6172a 对应的 README
维护者编写的上游内容原文于 2026/9/9README.md 获取,正文和仓库相对媒体固定到 commit 7a6172aedd1f,内容哈希为 6e6a4f5c4914。以下是未经 DSHub 翻译的上游原文,语言可能与当前页面不同;第三方托管的 badge 可能独立更新。

dsh-voice-scribe

MIT license release CI npm version npm downloads dsh.so risk dsh.so install Listed in awesome-dsh-plugin

DSH 专属语音输入插件:点按或按住 Alt 说话、松开/再点按转文字,结果追加到输入框草稿末尾(不覆盖已输入内容)。 Voice input for DeepSeek Harness: tap or hold Alt to talk, get text in the composer.

⚠️ 非官方插件,与 DeepSeek / 深度求索公司无关联。使用前请阅读 SECURITY.md

安装 Install

dsh plugin --profile web add dsh-voice-scribe   # 重启 dsh web 后生效

使用 Usage

  • 麦克风按钮:输入框右侧 🎤 图标,点击开始说话、再点停止并转写(按钮录音中变红)
  • 热键:点输入框 → 按 Alt 开始说话 → 再按 Alt 结束并转写(备选 Alt+空格,设置可切换)
  • 按住说话:设置 → 语音输入 → 触发方式 可选「按住说话」——按住热键录音、松开自动转写(麦克风按钮同样支持)
  • 实时中间结果:说话时识别文本实时出现在草稿里(浏览器引擎逐字、本地引擎每 3 秒刷新),停止后替换为最终结果
  • 录音电平指示:录音中状态条下方显示实时电平条
  • 最长录音时长:本地引擎约 4 分钟、云端 10 分钟,到时长自动停止并转写
  • 切窗取消:录音中切到其他窗口自动取消本次录音(Alt+Tab 误触不会留下录音)

识别引擎 Engine(默认「自动」,零配置)

引擎 说明
自动(默认) 本地离线识别优先;不可用时自动回退浏览器识别
本地离线识别 SenseVoice,零配置零 key、音频不出本机;首次使用自动下载模型(约 230MB,国内镜像,只需一次)
浏览器 Web Speech 零配置;依赖 Google/Microsoft 服务(国内 / Edge Stable 可能不可用)
云端 ASR(可选) 服务链:可配置多个 OpenAI 兼容端点按序尝试、失败自动切换;需在设置中配置 API key

浏览器识别依赖外部语音服务(Chrome 在大陆被墙、Edge Stable 有已知回归),故默认以本地识别为主。

云端 ASR 服务链示例:Groq(免费层)→ 硅基流动 SenseVoice → 阿里云百炼,任一失败自动尝试下一个(设置 → 语音输入 → 云端 ASR)。

识别语言 Languages

支持 中文 / English / 粤语 / 日本語 / 한국어(设置 → 语音输入 可选)。本地离线识别自动检测语言;所选语言作用于浏览器与云端识别。

热词替换表 Hot Words(可选)

把识别错的人名、术语、项目名替换回来:编辑 $DSH_HOME/voice/hot.txt(每行一条,修改后下次转写生效):

# 字面替换(不区分大小写):正确词=错误词1|错误词2
DeepSeek=deep seek|迪普西克
王小明=王小铭

# 正则替换(标准 $1 语义)
/老\s*师/老师/
/\{([^}]+)\}/【$1】/

设置 → 语音输入 页面会显示热词表状态(规则条数 / 文件路径 / 解析错误)。云端与本地离线引擎的转写结果统一应用。

自定义润色提示词(可选)

设置 → 语音输入 → 开启润色后:

  • 润色模型:下拉选择复用的 DSH 模型(选项来自 DSH 已配置的 provider,首次开启自动选中第一个)
  • 润色提示词:可自定义(多行,保存在服务端);留空或「恢复默认」使用内置的最小必要修正提示词

润色时会先做一步本地规则预润色(去「嗯/呃」等口头禅、折叠多余空格),再把更短更干净的文本交给 LLM,省 token;LLM 失败时仍保留原始转写。

隐私 Privacy

本地引擎音频不出本机;Web Speech 由浏览器语音服务处理;云端 ASR 的 key 只存服务端。

与同类插件对比 Compare

同为 DSH 的语音 / 输入增强插件,主要差异(截至 2026-09):

dsh-voice-scribe(本插件) dsh-better-input
定位 专注语音输入 输入增强套件(语音 + 提示词优化 + 文件转 Markdown 等)
本地离线识别 ✅ SenseVoice,零 key,音频不出本机 ❌ 仅浏览器原生识别
浏览器 Web Speech ✅ 回退
云端 ASR 服务链 ✅ 多 provider 故障切换
热词替换表 hot.txt
本地规则预润色(省 token) ✅ 0.4.2 起
AI 润色(复用 DSH 模型)
按住说话 / 录音电平 录音自动停止(无电平)
提示词优化 / 文件转 Markdown

只想要更省心、更私密的语音输入 → dsh-voice-scribe;需要一整套输入增强(提示词优化、文件转 Markdown) → dsh-better-input。两者可并存。

已知限制 Known limitations

  • 输入框里含 @ 引用芯片(如 @文件)时,DSH 只提供「整段替换草稿」的接口,转写结果插入会把芯片展开成纯文本;先发送或清空草稿再听写可避免。
  • 浏览器 Web Speech 依赖外部语音服务,国内网络下通常需要改用本地离线或云端引擎。

兼容性 Compatibility

  • 需要 DSH 0.1.0-rc.6 及以上(含 0.1.1-rc / 0.1.2-alpha / 0.1.3-alpha / 0.1.5-alpha 各预发布线)。
  • 输入框插槽 conversation.input.right 在 DSH 0.1.2 起由 <textarea> 改为 Lexical contenteditable:0.4.8 起两种形态都支持(读取实时草稿走 useInput,写入走 inputActions.setDraft)。
  • 界面没有麦克风按钮(旧壳子没有该插槽)时,Alt 热键仍然可用

开发 Dev

npm test          # 测试
npm run lint      # 语法检查
npm run security  # 密钥/路径泄露扫描

License

MIT

有意识地管理

安装与管理

前置条件与目标 Profile

目标 Web Profile

交付方式 Git Bundle — PensiveFei/dsh-voice-scribe#7a6172aedd1fe7ecfdd4217438b9a3f0e394287b

验证、更新与移除

显示生命周期命令
验证
dsh plugin --profile web list

兼容性与访问范围

DSH web bundle; Node.js 18+ declared >=0.1.0-rc.6; declared pre-release ranges in package manifest

检查兼容性证据

风险事实

microphone

Uses microphone recording for voice transcription.

证据
external-services

Browser speech recognition and optional cloud ASR may use external speech services; optional cloud ASR requires an API key.

证据
local-model-download

The local recognition engine may download a roughly 230 MB model on first use.

证据
证据与编辑审查Manifest、Bundle patch、分发与新鲜度

不可变证据

审查状态与源码活动

AI 已审查

README 声明该插件为非官方插件,与 DeepSeek 无关联。

AI 审查于 2026/9/10 UTC 11:36GitHub 事实核对日期: 2026/9/10 UTC 11:36

自当前证据基线以来,没有记录到重要源码变化。

下一步

按 Plugin 安装流程操作

订阅重要变化: DSH Voice Scribe