CATEGORY
该分类下经过 manifest 校验、精确版本的插件。
dsh-ppt-master
适用于 DeepSeek Harness 的 PPT Master 技能:用于生成可编辑 PPTX 演示文稿、SVG 快照、填充原生模板以及增强 PPTX 的 AI 驱动演示文稿工作流。
dsh-v4flash-tiler
DSH 插件:将超大聊天图片自动切分为带标签的网格块(包含行/列元数据、支持重叠处理、隔离多图片组),使 DeepSeek 视觉模型保留精细细节,而不是缩小至约 ~800px。
dsh-voco
DSH 插件 dsh-voco
dsh-anydoc-markdown
通过 Rust firecrawl-anydoc crate 将文档(Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV、PDF)转换为简洁的 Markdown,并使用视觉模型描述每张嵌入的图片。提供公开 `convert_document` 工具的宿主插件;转换与批量视觉引擎是捆绑的 Python wra
dsh-llm-vision
面向模型的 describe_image + extract_text 工具,适用于 DeepSeek Harness Web GUI:通过兼容 OpenAI 的视觉端点,为仅支持文本的模型提供可靠的图像理解和 OCR,并支持关键检查提示、自动预处理、重试以及持久化答案缓存。
dsh-live-voice
DeepSeek Harness 实时语音预览,包含精确会话同意、本地合成演示和一次受限的手动交互
dsh-tool-imagegen
通过 OpenRouter 的统一 Image API 为 DeepSeek Harness 提供文本到图像生成功能,支持按能力控制参数并将文件输出到工作区
@difimim/dsh-voice-input
DeepSeek Harness 语音输入插件:在输入框加入麦克风按钮,用浏览器 Web Speech API 把语音实时转成文字填入输入框。
dsh-screenshot-review
截图审阅 dsh skill: 模型自己截图、自己看图、自己改代码,迭代优化前端效果
dsh-inline-media-viewer
DeepSeek Harness Web 对话中的持久化内联图像、视频和音频预览,支持受工作区限制的本地读取和可配置的 ComfyUI 代理。
@lijian-ui/dsh-vision-toggle
DeepSeek Harness (dsh) 的按模型视觉(图像输入)开关:列出所有已配置的模型,并切换开关以启用或禁用图像支持,无需手动编辑 settings.yaml。
dsh-video-player
适用于 DeepSeek Harness 的浮动、可拖动、可调整大小的视频场景播放器。播放来自 Stash-style 场景服务器的每场景一个 MP4 剪辑,并尽力支持 YouTube / Twitch / Jellyfin / 自定义链接。
phone-eye
让您的 AI 智能体能够查看并操作真实的 Android 手机——通过 adb 实现视觉与 UI 树融合,适用于任何 MCP 客户端
dsh-voice-input
使用当前会话模型为 DeepSeek Harness 提供语音听写和转录文本清理。
@hackerfish/dsh-voice-input
语音输入:对话框麦克风按钮,浏览器内置 Web Speech API(zh-CN)识别,结果填入输入框草稿
@zenk/vision
DSH 本地视觉能力:macOS Vision OCR + ollama qwen3-vl 语义描述 + 上传图片桥接(图片块转文本,text-only 通道可用)
dsh-deepseek-model-router
为 DeepSeek Harness 自动切换 DeepSeek 模型:有图像时将每个模型请求路由至视觉模型,复杂任务路由至专业模型,否则路由至快速模型;包含用于按会话手动覆盖设置的 switch_model 工具。
dsh-funasr-voice
DSH Web 本地离线语音输入插件:浏览器采集麦克风 → host 拉起本地 FunASR (SenseVoiceSmall) 识别 → 文字填入输入框。
dsh-imggen
DeepSeek Harness 插件:文本生成图像输出,支持聊天内图像卡片、下载按钮、历史记录图库和提供商选择标签页
dsh-attachment-downscale
附件自动降级:DSH 图片准入(单边 ≤2000px / ≤3.5MB / ≤4000万像素)超限图片不再拒绝,用 sharp 自动缩小/重编码后入库,用户上传手机原图不再踩线。
dsh-text2img-compress
将长文本渲染成图片发送,以压缩 LLM 输入 token(DeepSeek 视觉模型,每张图片最多 384 token)— 基于图片的文本 token 压缩,适用于 DeepSeek Harness
dsh-computer-use-vision
DeepSeek Harness 的 Windows 计算机使用能力:屏幕截图 → 视觉模型 → 模拟鼠标/键盘输入,并配备自我演进的知识库。
@dsh-extension/dsh-generation-image
DeepSeek Harness (DSH) 的按需图像生成:generate_image 工具调用您自己的 OpenAI-compatible 图像 URL + API 密钥,并将图像传送到会话中
dsh-image-vision-bridge
DSH 主机插件:自动将用户消息中的图像发送给视觉模型(默认使用 opencode-go 上的 mimo-v2.5),并将返回的文本描述传递给主文本模型(例如 deepseek-v4-pro),不会修改可见的聊天记录。
@dsh-external/dsh-image-tiler
DSH agent 工具:将大型图像切分为带标签的约 800x800 图块,并生成一张概览缩略图,为视觉模型保留细节。
dsh-media-gen
通过在 Model 设置中配置的兼容 OpenAI 的提供商,在 DSH 聊天中生成图像和视频;提供专用的 Settings 菜单和工作区 media_gen 输出。
@local/dsh-image-describe
DeepSeek Harness 宿主插件:让不支持图片输入的纯文本主模型也能"看图"(describe_image 工具 + 图片标记替换)
dsh-pro-vision
让 DeepSeek-V4-Pro(仅文本)使用 V4-Flash-Vision-Exp 处理附件图片。Mac/Windows/Linux。
dsh-official-vision
DeepSeek 官方视觉 API 与 DeepSeek Harness 的直连桥接:将 deepseek-v4-flash-vision-exp 多模态模型注册为提供商路由,并支持通过 base64 内联数据和 Files API 输入图像。DSH 插件
dsh-vision-api-localorweb
DSH 插件:可接入识图模型 API(本地大模型识图工具 + 设置界面)。配置 OpenAI 兼容的识图接口(LM Studio / vLLM / Ollama 等),接口留空即不启用识图模型。