DeepSeek Harness Plugin Hub

发布与管理完整 Harness Profiles,发现适合你的插件。

探索

插件目录环境预设文档中心动态

社区

发布插件联系我们报告问题

相关链接

Plugin Hub GitHubDeepSeek Harness 官方项目系统状态隐私说明
© 2026 DeepSeek Harness Plugin HubPowered byPaxTech

独立、非官方社区项目,与 DeepSeek 官方无隶属、授权或背书关系。

Dsvu — DeepSeek Harness 插件(DSH Plugin)
← Plugins

@svenyu/dsvu

Dsvu

dsvu(DeepSeek-Powered Video Understanding)低成本视频理解工具:B站链接/BV/本地视频 → 信息层(ASR+场景+对象轨迹+YOLO)→ 摘要+问答。基于 deepseek-v4-flash-vision-exp 同源即看即答 + grid 密集抽帧。问题驱动动态路由分层(L0/L1/L2)、语义层复用、预算上限。引擎自包含,无需外部依赖。

插件会安装到这里;不确定时保持 web。

npx -y @deepseek-ai/dsh plugin --profile web add @svenyu/dsvu@0.6.7
README兼容性版本

兼容性与来源证明

Dsvu 以 @svenyu/dsvu 发布,当前版本为 0.6.7。Plugin Hub 会校验它的 manifest,并保存精确安装来源,便于复现安装结果。

DSH 兼容范围
*
运行环境
any
发布来源
npm
Registry 更新时间
2026/9/20

版本

0.6.7stable
2026/8/23
0.6.6stable
2026/8/23
0.6.5
stable
2026/8/22
查看其余 2 个版本收起版本
0.6.4stable
2026/8/22
0.6.3stable
2026/8/22

相关插件

正在加载相关插件…

最新版
0.6.7
DSH
*
HMR
重启进程
Tree shaking
未声明可安全裁剪
解包体积
6.9 MB
文件数
39
Surface
any
许可证
MIT
发布源
npm
GitHub
★ 0
周下载
47
最近提交
2026/8/24
查看源码 ↗项目主页 ↗
README Badge

点击下方 Badge 复制 Markdown,粘贴到 README 即可。

这是你的 Plugin?认领权益 · 优先安全扫描

验证 package.json 声明的 GitHub 仓库,即可管理这个公开页面。认领后,Hub 会优先安排当前版本的安全扫描,并在通过后公开展示结果。

认领这个 Plugin →
报告问题
DeepSeek Harness Plugin Hub
ProfilesPlugins分类动态文档登录管理 Profiles
ProfilesPlugins分类动态文档登录

相关插件

继续浏览 vision-media 分类下经过校验的插件。

Tool Describe Image@linxin666/dsh-tool-describe-image面向模型的 describe_image 工具,用于 dsh Web GUI:通过在兼容 OpenAI 的端点调用视觉语言模型,为文本模型提供图像理解能力,以描述一张图像(本地路径、http(s) URL 或附件引用)。可热插拔 —Modlens@liustack/modlens面向仅支持文本的 LLM 的插件视觉能力,由免费的 Antigravity CLI 提供支持Deepseek Ivideodeepseek-ivideoiPolloWork HyperFrames Video Studio,以及 27 个可编辑视频模板,以原生 DeepSeek Harness 对话视图呈现。Image Gendsh-image-gen将类似 ChatGPT 的图像生成功能带到 DeepSeek Harness——支持 Gemini、OpenAI、Seedream、DashScope、本地 ComfyUI 等。

README

dsvu

低成本视频理解插件:给 dsh agent 注册 video_understand 工具——B站链接 / BV 号 / 本地视频 → AVIS 信息层(ASR 转写 + 场景结构 + 运动对象轨迹 + YOLO 语义)→ 摘要+问答。引擎自包含,无需外部依赖。

dsvu 与 dsh-video-understand 的差异(v0.6.0,fork 自 0.5.2):

  • DeepSeek 视觉模型:DEEPSEEK_API_KEY 配对时,视觉与主模型用 deepseek-v4-flash-vision-exp(2026-08-21 上线,单图≤384 token,与 V4-Flash 同价)
  • 同源即看即答:回答轮把抽帧画面与 ASR 信息层同一条消息直送视觉模型,消除"VLM 转述→文本→主 LLM"两段式损耗(DSVU_DIRECT_VISION=0 关闭)
  • L2 grid 密集拼图:一窗密集帧拼成一张大图单次 VLM(≤384 token),30s 时间线证据链成本≈看一帧(visual_level.py l2 ... --grid 6x6)
  • 信息层前缀缓存 + 结果缓存:同视频追问缓存命中 96.6%,边际成本降至 ~1/5;同参数二次调用秒回
  • 模型方案收敛:默认全程 DeepSeek(主模型=视觉模型同源);MiMo 组合降为回退选项(见"模型方案对比")
  • 包名/命令/缓存独立:dsvu / npx dsvu / ~/.cache/dsvu

安装

# npm 安装
npm install @svenyu/dsvu

# 或 dsh plugin add @svenyu/dsvu

装完即用:首次调用 video_understand 时自动创建插件本地隔离环境(.venv)并安装核心依赖(优先 uv,回退 venv+pip 清华镜像)——无需手动执行任何命令,不污染系统 Python。

引擎已内含,无需额外克隆外部仓库。

环境自检

npx dsvu doctor        # 逐项检测 + 给出修复命令
npx dsvu doctor --fix  # 一键自动修复(建环境 + 装依赖)

前置条件仅两个:ffmpeg(macOS brew install ffmpeg / Ubuntu sudo apt install ffmpeg)和一个 LLM API key(见下表)。语义层依赖(torch/CLIP/YOLO,约 2GB)为可选,仅建完整语义层时再装:pip install -r engine/requirements-layer.txt。

⚠️ 数据流披露

级别数据流向说明
L0(默认)完全本地ASR + 场景分类 + 运动检测,不上传任何数据
L1DeepSeek/MiMo API视频帧发送至 VLM 服务器进行视觉分析(DeepSeek key → deepseek-v4-flash-vision-exp;MiMo key → mimo-v2.5)
L2DeepSeek/MiMo API视频帧发送至 VLM 服务器进行视觉分析
  • L0 级别(默认)仅使用本地 ASR + 场景分类 + 运动检测,不涉及云服务
  • L1/L2 级别会将视频帧(JPEG 编码)发送至 VLM API 进行视觉理解(DeepSeek 时含回答轮的"即看即答"直看帧)
  • 帧数据仅用于单次 VLM 推理,不会被存储或用于训练

环境变量

变量必需说明
DEEPSEEK_API_KEY✅*默认推荐:只设这一个即可——主模型/定位器/视觉/回答轮统一用 deepseek-v4-flash-vision-exp(同源即看即答)
LLM_API_KEY❌备选(回退):设小米/自定义 key 时按 LLM_API_URL/LLM_MODEL 走对应模型(如 mimo-v2.5)
LLM_API_URL❌自定义 API endpoint(默认 https://api.xiaomimimo.com/v1/chat/completions,仅 LLM_API_KEY 模式用)
LLM_MODEL❌自定义模型名(仅 LLM_API_KEY 模式用)
VISION_MODEL❌视觉模型名(默认 deepseek-v4-flash-vision-exp,DeepSeek key 配对时用)
VLM_DETAIL❌视觉图片 detail 档位(low/high/original/auto,默认 high)
DSVU_DIRECT_VISION❌同源即看即答开关(默认 1 开;0 退回"VLM 描述→文本"旧链路)
DSVU_VISUAL_GRID❌L2 密集拼图开关(默认 1 开;0 用独立帧逐帧发,读小字更保真)
DSVU_WAIT_OFFPEAK❌峰时自动等谷时再跑(默认关;批量任务设 1 省钱,DeepSeek 工作日谷时半价、周末全天低价)
VIDEO_UNDERSTAND_PYTHON❌Python 解释器路径(自动检测有依赖的 Python)
BILI_DOWNLOAD_SCRIPT❌bilibili-downloader 脚本路径(下载 B站视频用)

* 未设置显式 key 时自动读 ~/.dsh/.credentials.yaml,DeepSeek 优先(主模型=视觉模型,同源)。一个 key 搞定。 仅 DeepSeek 不可用时才走备选:export LLM_API_KEY=<小米key> → 全程 mimo-v2.5(成本相近但质量低 ~0.9 分,见"模型方案对比")。

工具

video_understand(target, questions?, noDownload?, level?, window?)

参数类型说明
targetstringB站 URL / BV 号 / 本地视频绝对路径
questionsstring[]可选,自定义问题(默认 3 问)
noDownloadboolean本地文件置 true
levelstringl0(默认) / l1(+3-5帧VLM视觉摘要) / l2(+时间窗密集帧证据)
windowstringL2 时间窗,如 10-30 或秒数(auto=轨迹最活跃30s)
budgetCnynumber单次问题预算上限(元),视觉成本估算超预算自动降级(拦截 L2 用 L0/L1 回答)

返回 JSON:video / duration_s / token_compression_pct / cost_cny / answers[]。

结构

dsvu/
├── package.json
├── cordis.patch.yml
├── dsh/
│   └── index.js          # host 端:注册 video_understand 工具
├── engine/               # 自包含引擎(无需外部依赖)
│   ├── understand_video.py
│   ├── avis.py
│   ├── visual_level.py
│   ├── frame_prep.py
│   └── livestream-highlight/
│       └── asr.py
└── skills/
    └── video-understand/SKILL.md

模型方案对比(2026-08-22 实测:3 视频 × 10 题)

方案配置质量(盲评 1-5)成本(3 视频,谷时)耗时
全程 DSV(推荐)deepseek-v4-flash-vision-exp 主模型+视觉4.770.089 元209s
纯 mimomimo-v2.5 主模型+视觉3.830.074 元1310s
mimo+qwenmimo 主模型 + qwen3-vl-flash 视觉~3.8(估算)~0.09 元(估算)~1000s+

结论:成本同一量级(0.07-0.09 元),全程 DSV 精度最高(+0.9 分)、速度最快(快 6.3 倍)。 额外优势:单模型简化(无双模型维护);信息层前缀缓存命中 96.6% → 同视频追问边际成本降至 ~1/5;谷时(工作日非 9-12/14-18,以及周末全天)再半价。 因此模型方案收敛为全程 DSV;MiMo 组合保留为回退(exp 模型不可用时的保险丝),不参与默认与基准。详见 docs/blog-dsvu-vs-mimo-对比实验-2026-08-22.md。

分级实测(2026-08)

层级内容数据流向成本(估算*)
L0 信息层ASR+场景+轨迹+YOLO → 摘要/问答本地仅 LLM 文本成本
L1 视觉级3-5 帧 VLM → 颜色/姿态/衣着DeepSeek API+数帧 VLM 成本
L2 证据级时间窗密集帧(可 grid 拼图)→ 时间线DeepSeek API按窗长(grid=单图)

* 成本按 engine/pricing.py 官方价目 + 峰谷时段核算(可配置输入),实际随厂商定价变化。详见 docs/blog-视频理解性价比实验(方法 + 实测)。

实测:电影解说 L1 补出「白色立领衬衫/神情凝重/暗色调诊室」(L0 完全给不出);舞蹈 L2 逐帧「头部转 15-20°→45°、口型开口→闭合→微笑」。

已知边界

  • 短视频快剪/变身合集(非主流):3-5 秒高速切换 + BGM 无语音 + 角色细节密集,模型抽帧易漏、识别不全(2026-08-22 实测 3:21 变身混剪识别约 5/8)。主流场景(解说/教程/直播/长片段纯视觉)不受影响,实测质量 4.5-4.9/5。

设计背景

本插件的核心目标是低成本视频理解:用信息层代替逐帧像素喂 LLM,单视频 LLM 调用仅需几千 token(具体成本取决于所选模型定价,见上)。

  • LLM 选型:默认全程 DeepSeek(deepseek-v4-flash-vision-exp)——主模型与视觉同源,单模型简化 + 前缀缓存,性价比与精度最优;MiMo 保留为回退(见"模型方案对比")
  • 视觉级(L1/L2):DeepSeek 原生多模态,同源即看即答(帧图直进回答轮)+ grid 密集拼图(单图≤384 token);L0 仍可纯本地

原理

引擎把视频压缩成信息层(ASR 转写 + 场景结构 + 运动对象轨迹 + YOLO 语义,约 1k token)再喂 LLM;同一视频重复理解时信息层缓存复用(内容哈希,二次提问跳过 ASR)。成本与 token 对比的具体测量见 docs/blog-视频理解性价比实验。

License

MIT