DeepSeek Harness Plugin Hub

发布与管理完整 Harness Profiles,发现适合你的插件。

探索

插件目录环境预设文档中心动态

社区

发布插件联系我们报告问题

相关链接

Plugin Hub GitHubDeepSeek Harness 官方项目系统状态隐私说明
© 2026 DeepSeek Harness Plugin HubPowered byPaxTech

独立、非官方社区项目,与 DeepSeek 官方无隶属、授权或背书关系。

Tool Vision — DeepSeek Harness 插件(DSH Plugin)
← Plugins

@aalongaa/dsh-tool-vision

Tool Vision

面向模型的 DeepSeek Harness 视觉工具:通过任何兼容 OpenAI 的视觉 API 分析图像。

插件会安装到这里;不确定时保持 web。

npx -y @deepseek-ai/dsh plugin --profile web add @aalongaa/dsh-tool-vision@2.1.0
README兼容性版本

兼容性与来源证明

Tool Vision 以 @aalongaa/dsh-tool-vision 发布,当前版本为 2.1.0。Plugin Hub 会校验它的 manifest,并保存精确安装来源,便于复现安装结果。

DSH 兼容范围
*
运行环境
web
发布来源
npm
Registry 更新时间
2026/9/20

版本

2.1.0stable
2026/8/16
2.0.0stable
2026/8/16
1.1.1stable
2026/8/16
查看其余 11 个版本收起版本
1.1.0stable
2026/8/16
1.0.0stable
2026/8/15
0.1.19stable
2026/8/15
0.1.18stable
2026/8/15
0.1.17stable
2026/8/15
0.1.16stable
2026/8/15
0.1.15stable
2026/8/15
0.1.14stable
2026/8/15
0.1.7stable
2026/8/15
0.1.6stable
2026/8/15
0.1.5stable
2026/8/15

相关插件

正在加载相关插件…

最新版
2.1.0
DSH
*
HMR
重启进程
Tree shaking
未声明可安全裁剪
解包体积
89.5 kB
文件数
18
Surface
web
许可证
MIT
发布源
npm
GitHub
★ 0
周下载
28
最近提交
2026/8/16
查看源码 ↗项目主页 ↗
README Badge

点击下方 Badge 复制 Markdown,粘贴到 README 即可。

这是你的 Plugin?认领权益 · 优先安全扫描

验证 package.json 声明的 GitHub 仓库,即可管理这个公开页面。认领后,Hub 会优先安排当前版本的安全扫描,并在通过后公开展示结果。

认领这个 Plugin →
报告问题
DeepSeek Harness Plugin Hub
ProfilesPlugins分类动态文档登录管理 Profiles
ProfilesPlugins分类动态文档登录

相关插件

继续浏览 vision-media 分类下经过校验的插件。

Tool Describe Image@linxin666/dsh-tool-describe-image面向模型的 describe_image 工具,用于 dsh Web GUI:通过在兼容 OpenAI 的端点调用视觉语言模型,为文本模型提供图像理解能力,以描述一张图像(本地路径、http(s) URL 或附件引用)。可热插拔 —Modlens@liustack/modlens面向仅支持文本的 LLM 的插件视觉能力,由免费的 Antigravity CLI 提供支持Deepseek Ivideodeepseek-ivideoiPolloWork HyperFrames Video Studio,以及 27 个可编辑视频模板,以原生 DeepSeek Harness 对话视图呈现。Image Gendsh-image-gen将类似 ChatGPT 的图像生成功能带到 DeepSeek Harness——支持 Gemini、OpenAI、Seedream、DashScope、本地 ComfyUI 等。

README

🖼️ dsh-tool-vision

给 DeepSeek Harness 装上"眼睛"的 OpenAI 兼容视觉理解插件。 智能体终于不用再靠猜了——虽然它猜得也不差。

@aalongaa/dsh-tool-vision 为 DeepSeek Harness 注册一个 vision 工具:把本地图片或远程图片丢给任意 OpenAI 兼容的视觉模型,拿回一句人话描述。

它帮你做三件事

  1. 看 —— 单图 / 多图一次分析,本地文件或 URL 都行。
  2. 省 —— 图片自动缩放压缩(默认 1024px、JPEG 85%),token 省下来,钱包谢谢你。
  3. 记 —— 结果缓存,同一张图问第二遍不花钱。AI 也怕重复劳动。

安装

# 装进 dsh 的 web profile(装之前记得先停掉正在跑的 dsh)
npx @deepseek-ai/dsh plugin --profile web add @aalongaa/dsh-tool-vision

# 启动
npx @deepseek-ai/dsh web

装完打开 Web 设置 → 插件 → 视觉理解,就能看到配置卡片和智能检测到的配置文件路径。

不想用了?先停掉 dsh,然后卸载:

npx @deepseek-ai/dsh plugin --profile web remove @aalongaa/dsh-tool-vision

配置

配置从哪里来?

插件会从三个地方读取配置,优先级从低到高(高优先级的会覆盖低优先级的同名项):

优先级来源说明
1(最低)cordis.yml插件的 schema 默认值。一般不用管,放着就行
2.dsh-tool-vision.json项目级配置文件,放在项目根目录(可用环境变量 DSH_TOOL_VISION_CONFIG 指定路径)
3(最高)~/.dsh/settings.yamldsh 的全局设置文件,Web 设置页里改的就是它

推荐做法:日常在 Web 设置页里改(第 3 层),想跟着项目走就写 .dsh-tool-vision.json(第 2 层)。两种都不配时,插件用默认值也能跑,只是会指向 OpenAI 官方接口。

完整配置项

字段类型默认值说明
apiKeystring无视觉接口的 API 密钥(如 sk-xxx)
baseUrlstringhttps://api.openai.com/v1OpenAI 兼容的接口地址。用本地推理服务(如 LM Studio / Ollama / vLLM)就填 http://127.0.0.1:1234/v1
modelstringgpt-4o-mini视觉模型名称,如 minicpm-v-4_6
maxTokensnumber1024每次请求的最大输出 token 数
preprocess.enabledbooleantrue是否自动缩放压缩图片
preprocess.maxWidth / preprocess.maxHeightnumber1024缩放上限(像素)
preprocess.qualitynumber85JPEG 压缩质量(1–100)
preprocess.formatstringjpeg压缩格式:jpeg / png / webp / avif
cache.enabledbooleantrue是否缓存分析结果
cache.dirstring.cache/dsh-tool-vision缓存目录
cache.ttlnumber无(不过期)缓存有效期(毫秒)
artifactsDirstring.dsh-tool-vision/artifacts视觉工具产物目录(标注图 / 裁剪图 / 热力图)
liftProvidersstring[]["deepseek-official"]哪些 provider 被"声明支持图片"(解除发图限制)。只放行列出的 provider,不污染第三方;["*"] 恢复全局放行
rewriteImagesbooleantrue图片块在进模型前被改写成"调用 vision_describe"的文本标记——图片字节永不发给文本模型。用原生多模态模型做会话模型时建议关掉
providersobject[][]vision_describe 的降级链:按顺序尝试,前面的挂了自动换下一个。每项 { baseUrl, apiKey?, model?, maxTokens? },apiKey 缺省继承顶层

配置示例

在 ~/.dsh/settings.yaml 或 .dsh-tool-vision.json 里写:

tool-vision:
  apiKey: sk-xxx
  baseUrl: http://127.0.0.1:1234/v1
  model: minicpm-v-4_6
  maxTokens: 8192
  # 主端点挂了自动切到这个(本地 → 云端兜底)
  providers:
    - baseUrl: https://api.siliconflow.cn/v1
      apiKey: sk-cloud
      model: Qwen/Qwen2.5-VL-72B-Instruct

.dsh-tool-vision.json 支持 JSONC(带注释)。保存后每个字段上方自动带一行中英双语注释,不用猜"这行是干嘛的":

{
  // apiKey —— 在这里填写 API 密钥(例如 sk-xxx) / put your API key here (e.g. sk-xxx)
  // baseUrl —— 在这里填写接口地址(OpenAI 兼容) / OpenAI-compatible endpoint base URL
  "baseUrl": "http://127.0.0.1:1234/v1",
  // model —— 在这里填写视觉模型名称 / vision model name
  "model": "minicpm-v-4_6"
}

常见坑

  • 请求一直失败? 检查 baseUrl 是不是默认的 https://api.openai.com/v1——如果你的网络访问不了 OpenAI,就把地址换成本地/可达的 OpenAI 兼容服务。插件启动时会打印一行诊断日志([tool-vision] config: ...),一眼就能看到最终生效的配置。
  • apiKey 是占位符? 插件会警告配置里的 key 疑似是 test / placeholder / example 之类的测试值,说明真实密钥没配上去。
  • 配置改完没生效? 第 3 层(settings.yaml)是实时读取的,改完立即生效;第 2 层(JSON 文件)在插件启动时加载,改完需要重启 dsh。

使用

装好插件后,即使底层模型本身不支持图片输入,聊天框也可以直接粘贴/上传图片——插件自动放行图片附件,并遵守一条铁律:图片字节永不发给 DeepSeek。发图的那一轮,图片会被改写成一段"这里有一张图,请调用 vision_describe 查看"的标记,视觉工具链会自动挂载,DeepSeek 只负责基于工具读回来的文字继续干活,不会因为"模型不支持图片"而翻车。

插件默认只暴露一个零参工具 vision_activate,发图或首次调用后挂载完整的视觉工具链(保持工具面最小):

工具作用
vision_describe看图问答 / 多图对比,返回文字描述(带缓存 + 多端点降级)
vision_ground定位目标 → 返回原图像素坐标框 + 标注 PNG
vision_crop按坐标裁剪出图,返回 PNG 路径
vision_diff两图逐像素对比:差异率 + 最差区域 + 热力图 PNG

它们组成一个可验证的闭环:

vision_ground   source=ref.png target="发送按钮"     → {x1,y1,x2,y2} + 标注图
vision_crop     source=ref.png x1=.. y1=.. x2=.. y2=..  → 裁剪 PNG
vision_describe source=crop.png prompt="里面是什么?"    → 描述
vision_diff     original=ref.png candidate=impl.png      → 差异率 + 热力图

三个值得知道的细节:

  1. 上传的图片可以直接用附件 id 喂工具:聊天框里发的图,各工具的 source 参数可以直接传 sha256:... 形式的附件 id,插件会从会话里把图读出来——不用先把它落到磁盘再找路径。
  2. 主端点挂了自动降级:配置了 providers 后,vision_describe 会按顺序尝试,前面的失败自动换下一个,全部失败时返回每一家的原因。
  3. 产物自动落盘:标注图、裁剪图、热力图默认保存在 .dsh-tool-vision/artifacts/,返回绝对路径,可继续喂给下一个工具。

提示:想完全离线,本地部署一个视觉模型

如果不想把图片交给云端 API,可以在自己电脑上跑一个 OpenAI 兼容的视觉模型,把 baseUrl 指到本地即可,零成本、不泄露图片、断网也能用。

部署方式二选一:

工具特点地址
LM Studio图形界面,下载模型一键启动,最省心https://lmstudio.ai
llama.cpp命令行 / 服务端,轻量高效,适合折腾https://github.com/ggml-org/llama.cpp

推荐模型:MiniCPM-V 4.6 Thinking(OpenBMB,Apache 2.0)

面壁智能联合清华 NLP 实验室开源的端侧多模态模型——专门以手机配置为标准训练,能同时理解图像和视频,给 DeepSeek 充当"眼睛"再合适不过:

  • 仅 1.3B 参数,约 6GB 内存即可流畅运行,普通笔记本无压力
  • 基于 SigLIP2-400M 视觉编码器 + Qwen3.5-0.8B 语言模型,支持 4x/16x 混合视觉 token 压缩
  • 长思维链推理变体,复杂多模态推理、OCR、数学题表现更稳
  • 官方适配 llama.cpp / Ollama / vLLM / SGLang 等推理框架

模型下载: Hugging Face · 项目主页

本地服务起好后,把 baseUrl 指向本地 OpenAI 兼容地址即可:LM Studio 用 http://127.0.0.1:1234/v1,llama.cpp 用 http://127.0.0.1:8080/v1,model 填模型名,其他照常。

开发

npm install
npm test          # 跑测试,全绿就对了
npm run build     # tsup 打包
npm publish       # 发版(记得先改 version)

License

MIT —— 随便用。但如果你的智能体靠它写出了论文,记得在致谢里提一嘴。 (开玩笑的,不提也行,它不会记仇。)