DeepSeek Harness Plugin Hub

发布与管理完整 Harness Profiles,发现适合你的插件。

探索

插件目录环境预设文档中心动态

社区

发布插件联系我们报告问题

相关链接

Plugin Hub GitHubDeepSeek Harness 官方项目系统状态隐私说明
© 2026 DeepSeek Harness Plugin HubPowered byPaxTech

独立、非官方社区项目,与 DeepSeek 官方无隶属、授权或背书关系。

Stt Input — DeepSeek Harness 插件(DSH Plugin)
← Plugins
S

dsh-stt-input

Stt Input

DeepSeek Harness (DSH) 网页 GUI 的语音转文字输入:点击输入框中的麦克风按钮,将语音转换为文字。支持浏览器内置的 Web Speech API(无需配置,适用于 Chrome/Edge)以及兼容 OpenAI 的 Whisper 端点(OpenAI / Groq),可在设置 → 语音输入中选择 STT 模型。

插件会安装到这里;不确定时保持 web。

npx -y @deepseek-ai/dsh plugin --profile web add github:baisama-cloud/dsh-stt-input#a10ef172b60e26c3e9c2319620f2d5b2101caf76
README兼容性版本

说明

DeepSeek Harness (DSH) 网页 GUI 的语音转文字输入:点击输入框中的麦克风按钮,将语音转换为文字。支持浏览器内置的 Web Speech API(无需配置,适用于 Chrome/Edge)以及兼容 OpenAI 的 Whisper 端点(OpenAI / Groq),可在设置 → 语音输入中选择 STT 模型。DSH 语音输入插件:点击输入框旁的麦克风按钮,将语音转换为文字并填入输入框;支持浏览器本地识别和兼容 OpenAI 的 Whisper API,可在设置中选择模型。

兼容性与来源证明

Stt Input 以 dsh-stt-input 发布,当前版本为 0.1.0。Plugin Hub 会校验它的 manifest,并保存精确安装来源,便于复现安装结果。

DSH 兼容范围
*
运行环境
web
发布来源
github
Registry 更新时间
2026/8/20

版本

0.1.0
stable
2026/8/20

相关插件

正在加载相关插件…

最新版
0.1.0
DSH
*
HMR
重启进程
Tree shaking
未声明可安全裁剪
解包体积
未提供
文件数
未提供
Surface
web
许可证
MIT
发布源
github
GitHub
★ 4
周下载
0
最近提交
2026/8/31
查看源码 ↗
README Badge

点击下方 Badge 复制 Markdown,粘贴到 README 即可。

这是你的 Plugin?认领权益 · 优先安全扫描

验证 package.json 声明的 GitHub 仓库,即可管理这个公开页面。认领后,Hub 会优先安排当前版本的安全扫描,并在通过后公开展示结果。

认领这个 Plugin →
报告问题
DeepSeek Harness Plugin Hub
ProfilesPlugins分类动态文档登录管理 Profiles
ProfilesPlugins分类动态文档登录

相关插件

继续浏览 vision-media 分类下经过校验的插件。

Tool Describe Image@linxin666/dsh-tool-describe-image面向模型的 describe_image 工具,用于 dsh Web GUI:通过在兼容 OpenAI 的端点调用视觉语言模型,为文本模型提供图像理解能力,以描述一张图像(本地路径、http(s) URL 或附件引用)。可热插拔 —Modlens@liustack/modlens面向仅支持文本的 LLM 的插件视觉能力,由免费的 Antigravity CLI 提供支持Vision Toolkit@anionex/dsh-vision-toolkit面向 Harness 原生集成的 DeepSeek 与 agent-vision-toolkit:图像问答、OCR、定位、UI 还原、像素差异、Artifacts 和 Web UI。Deepseek Ivideodeepseek-ivideoiPolloWork HyperFrames Video Studio,以及 27 个可编辑视频模板,以原生 DeepSeek Harness 对话视图呈现。

README

中文 · English

dsh-stt-input

DeepSeek Harness (DSH) Web GUI 的语音输入插件。

点击输入框旁的 🎤 麦克风按钮开始说话,再点一次停止,识别文字自动填入输入框。 识别引擎与模型可在 设置 → 语音输入 中选择。

功能

  • 两种识别引擎
    • 浏览器本地识别 — 使用浏览器自带的 Web Speech API(SpeechRecognition, Chrome/Edge)。零配置、无需 API Key,边说边把中间结果写进输入框。
    • API 识别 — 用 MediaRecorder 录音,通过任意 OpenAI 兼容 /v1/audio/transcriptions 接口(OpenAI、Groq、自定义)转写。
  • 模型可选 — whisper-1(OpenAI)、whisper-large-v3、 whisper-large-v3-turbo、distil-whisper-large-v3-en(Groq),或自定义模型名。
  • 可配置 — 服务预设(OpenAI / Groq / 自定义)、API Base URL、API Key、 识别语言、写入方式(追加到输入框 / 替换输入框内容)。
  • 实时状态条 — 输入框下方显示录音计时、识别中状态与错误信息。
  • 隐私 — API Key 仅保存在页面内存中,不落盘、不打日志;非密钥配置通过 localStorage 在刷新后保留。

安装

打包 tarball 后安装到你的 DSH web profile(与其他 dsh-* 插件一致):

pnpm pack
# 把 dsh-stt-input-*.tgz 复制到 web profile 并添加依赖,
# 例如在 ~/.dsh/profiles/web 下:pnpm add ../path/to/dsh-stt-input-0.1.0.tgz
# 然后重启 `dsh web`。

插件注册了三个界面位:

  • 输入框工具行的麦克风按钮(conversation.input.left)
  • 输入框下方的状态条(conversation.composer.dock)
  • 设置页(settings.section → 语音输入)

使用

  1. 打开 设置 → 语音输入 选择引擎。
    • 浏览器本地识别:无需其他配置(Chrome/Edge)。
    • API 识别:选择预设(OpenAI 或 Groq)、模型,并粘贴 API Key。 Groq 的 whisper-large-v3 目前免费。
  2. 点击输入框旁的 🎤 开始录音,说话,再点一次停止。识别文字进入输入框,回车发送。

浏览器本地引擎依赖 Chrome/Edge 的 Web Speech API;Firefox 请使用 API 引擎。

工作原理

┌──────────┐  点击🎤        ┌───────────────┐
│  客户端  │ ─────────────▶ │ MediaRecorder │  (api 引擎)
│ (浏览器) │                │ SpeechRecog.  │  (browser 引擎)
└──────────┘                └──────┬────────┘
      ▲                           ▼
      │ setDraft(text)      base64 音频 (JSON)
      │              POST /stt-input/transcribe
      │                           │
┌─────┴──────┐           ┌───────▼────────┐
│  输入框    │ ◀──────────│  Host (Node)   │
└────────────┘  {ok,text} │  fetch → /v1/  │
                          │  audio/transcr.│
                          └────────────────┘

客户端(lib/client.js)录音后把 base64 JSON POST 到宿主路由 /stt-input/transcribe;宿主(lib/index.js)解码音频并以 multipart/form-data 上传到 ${baseUrl}/v1/audio/transcriptions (使用 Node ≥ 18 的全局 fetch / FormData / Blob)。

License

MIT