CATEGORY
该分类下经过 manifest 校验、精确版本的插件。
dsh-tesseract-ocr
dsh 插件:使用 Tesseract OCR 在本地识别附件图像,并仅将识别出的文本发送给模型。文本模型永远不会接收图像字节;视觉直通需选择启用。
dsh-vision-mix
用于视觉路由以及 GPT Image 生成和编辑的 DeepSeek Harness Mix 插件。
dsh-dseyes
原生为 DeepSeek Harness 提供图像识别能力。将图像粘贴或拖放到 Web GUI 撰写框中:它会显示为缩略图附件(如普通 AI 聊天),并且在调用纯文本 DeepSeek 模型之前,主机会自动读取图像,使用
@dttxorg/deepseekeyes
面向 DeepSeek Harness 的可审计视觉与跨平台 Computer Use 运行时,提供保留源内容的证据。
computer-user
面向 DeepSeek Harness (DSH) 的 Codex 风格计算机使用:读取屏幕并操作鼠标和键盘。与 picturereader(image_scan/image_ocr)配合,闭合观察-操作-验证循环。Windows。
dsh-gsv-tts
DSH 插件,支持本地 GSV-TTS-Lite 声音克隆和 Edge 云端简易模式:声音预设、自动朗读、引擎设置助手、朗读按钮、设置面板
dsh-chatvoice
ChatVoice — 面向 DeepSeek Harness (dsh) 的免费语音输入 + AI 回复朗读。无需配置、零成本、无需 API 密钥,基于浏览器原生 Web Speech API 构建。给 DSH 装上「免费、免 API 密钥、开箱即用」的语音输入 + 回复朗读闭环(中文优先)。
dsh-youreyes
为 DeepSeek Harness 中仅支持文本的 DeepSeek 提供视觉能力:通过 Antigravity IDE 配额(default、flash/pro)、OpenAI-compatible VLM 端点、Gemini API 或本地 Ollama 实现图像理解——可由模型调用的视觉工具,为 deepseek/opencode-go 提供包装适配器,evi
dsh-codex-tools
由 Codex 提供支持的网页搜索、图像生成和图像理解工具,适用于 DeepSeek Harness。
dsh-image-plugins
DeepSeek Harness 的多模态插件:通过可配置的 OpenAI-compatible 或 DashScope 端点理解图像并生成图像。
dsh-image-router
DeepSeek Harness 插件:使用视觉模型带外分析图像——粘贴的图像会在纳入前被转换为文本,describe_image 工具则支持图像路径处理,同时始终不会更改会话模型。
dsh-plugin-deepseek-vision
DeepSeek Harness 原生视觉 Bundle:粘贴或拖入图片,通过托管的 deepseek-vision-mcp 调用 OpenAI 兼容视觉模型。
dsh-plugin-deepeye
DeepSeek Harness 原生插件:为纯文本 LLM 提供视觉能力(描述、OCR、VQA、布局分析、剪贴板)
@wisdoverse/dsh-inline-media-viewer
为 DeepSeek Harness Web 对话提供持久的内联图像、视频和音频预览,支持限定在工作区内的本地读取,并可选用 ComfyUI 代理。
dsh-voice-webspeech
DSH Web 语音输入插件:零服务端、零密钥、零模型下载,直接使用浏览器内置 Web Speech API(Edge=微软 Azure 语音,Chrome=Google 语音)。
@allmodels/dsh-speech
使用 AllModels.io 为 DeepSeek Harness 提供语音转文字和语音回答摘要。
dsh-plugin-continuity
为 DeepSeek Harness 提供本地图像 / 语音 / 音乐 / 音效生成,并固定身份:同一角色在多次调用中始终保持一致;拒绝返回退化输出;空闲时不占用 GPU。将图像部分交给
dsh-subagent-vision
dsh bundle: subagent_vision — 从仅支持文本的会话中将图像读取任务委托给具备视觉能力的模型,并通过 paste-to-path 让粘贴的图像以文件路径形式传递给子代理。
dsh-voice-call
dsh-voice-call — 让代理拥有自己的声音:代理决定何时说话(offer_call),人类掌握接听按键(接听/拒接/稍后)。通过 CrispASR + Qwen3-TTS CustomVoice 优先使用本地 TTS,将普通音频文件存放在 ~/.dsh/voice/ 下。dsh-voice 的分支,带有一个
@maxwell-feng/dsh-tesseract-ocr
dsh 插件:使用 Tesseract OCR 在本地识别附加图像,并仅将识别出的文本发送给模型。文本模型永远不会接收图像字节;视觉直通需主动选择启用。
@dsh-extension/dsh-vision-bridge
适用于纯文本 DSH 会话的按需视觉功能:图像会变为标记,并由 vision_describe 工具仅将图像和问题发送到兼容 OpenAI 的视觉模型
dsh-vision-proxy
DeepSeek 大脑 + DeepSeek Harness 的自动图像转录:一个 deepseek-vision 提供商路由,会通过任何兼容 OpenAI 的 VLM 将附加图像转录为文本,然后交给仅支持文本的 DeepSeek 适配器。使用密钥的付费快速路径(Da
dsh-model-capability
DeepSeek Harness Web UI 的模型输入模态明确选择
dsh-video-gen
为 DeepSeek Harness 带来文生视频和图生视频生成功能 — DashScope Wanx、Volcengine/Doubao Seedance、Google Veo、OpenAI Sora 和兼容中继。
dsh-deepseek-vision
树外 dsh provider 插件:一个 DeepSeek 网关路由,声明支持图像输入,并通过配置的视觉语言模型(例如 Qwen-VL)透明地描述粘贴的图像,然后再将其交给仅支持文本的 DeepSeek wire。
dsh-vision-free-eyes
DeepSeek Harness 插件:面向模型的 `vision` 工具,通过直接调用免费的 Zhipu GLM 视觉 API 描述图像文件并进行 OCR(无需外部 CLI)。
dsh-voice-kit
DeepSeek Harness 网页 GUI 的语音输入(Web Speech API)和朗读(speechSynthesis)— DSH 语音输入 + 回复朗读套件
dsh-tool-visual-primitives
DSH 视觉原语工具:参考 DeepSeek《Thinking with Visual Primitives》论文,将图片路由到外部视觉模型并返回带视觉基元的文本分析。纯文本循环,对话模型无需原生视觉能力即可'看见'图片。
dsh-vision-fallback
DSH 静默视觉增强:主模型照常选择,图片自动交给固定视觉模型后以隐藏上下文返回主模型。
dsh-mindseye
MindsEye:模型驱动的视觉工具、结构化证据和精确缓存,适用于 DeepSeek Harness