DeepSeek Harness Plugin Hub

发布与管理完整 Harness Profiles,发现适合你的插件。

探索

插件目录环境预设文档中心动态

社区

发布插件联系我们报告问题

相关链接

Plugin Hub GitHubDeepSeek Harness 官方项目系统状态隐私说明
© 2026 DeepSeek Harness Plugin HubPowered byPaxTech

独立、非官方社区项目,与 DeepSeek 官方无隶属、授权或背书关系。

Text2img Compress — DeepSeek Harness 插件(DSH Plugin)
DeepSeek Harness Plugin Hub
ProfilesPlugins分类动态文档登录管理 Profiles
ProfilesPlugins分类动态文档登录
← Plugins

dsh-text2img-compress

Text2img Compress

将长文本渲染成图片发送,以压缩 LLM 输入 token(DeepSeek 视觉模型,每张图片最多 384 token)— 基于图片的文本 token 压缩,适用于 DeepSeek Harness

插件会安装到这里;不确定时保持 web。

npx -y @deepseek-ai/dsh plugin --profile web add dsh-text2img-compress@0.1.3
README兼容性版本

兼容性与来源证明

Text2img Compress 以 dsh-text2img-compress 发布,当前版本为 0.1.3。Plugin Hub 会校验它的 manifest,并保存精确安装来源,便于复现安装结果。

DSH 兼容范围
*
运行环境
web
发布来源
npm
Registry 更新时间
2026/8/22

版本

0.1.3stable
2026/8/22
0.1.2stable
2026/8/22
0.1.1stable
2026/8/22
查看其余 1 个版本收起版本
0.1.0stable
2026/8/22

相关插件

正在加载相关插件…

最新版
0.1.3
DSH
*
HMR
重启进程
Tree shaking
未声明可安全裁剪
解包体积
45.9 kB
文件数
15
Surface
web
许可证
MIT
发布源
npm
GitHub
★ 1
周下载
0
最近提交
2026/8/22
查看源码 ↗
README Badge

点击下方 Badge 复制 Markdown,粘贴到 README 即可。

这是你的 Plugin?认领权益 · 优先安全扫描

验证 package.json 声明的 GitHub 仓库,即可管理这个公开页面。认领后,Hub 会优先安排当前版本的安全扫描,并在通过后公开展示结果。

认领这个 Plugin →
报告问题

README

dsh-text2img-compress

一个 DeepSeek Harness(DSH)插件: 输入框右侧出现「图」开关,开启后,超过阈值的长消息在发送给模型前会被自动渲染为 文字图片(每张 800×800,恰好吃掉 384 token 上限);模型看到的输入从上万 token 降到 几百到几千,而内容一字不差(所有文字都在图里)。由此带来两点直接收益:

  • ① 输入 token 大幅下降(中文约 2~2.5×、小字号更高),成本随之降低——消息之前的对话前缀逐字节不变, 而缓存命中不会因此降低;
  • ② 上下文窗口占用大幅压缩——同样的窗口能装下几十倍内容,为指令、推理步骤与工具结果 留足空间,长文档场景不再轻易被截断,模型表现更稳定。

English · npm

效果示例

下图即 DeepSeek 官网中文写作示例《端午咸》(news250528), 1,036 字 = 804 token(DeepSeek-V3 tokenizer 实测),默认 18px 渲染为单张 800×800 = 384 token:

text2img 渲染示例页(18px)

内容文本 token13px18px
中文《端午咸》8041 页 = 384(2.1×)1 页 = 384(2.1×)
英文论文引言(DeepSeek-OCR 2,arXiv 2601.20552,3,873 字符)7671 页 = 384(2.0×)2 页 = 768(0.96×,无收益)
中文长篇:鲁迅《故乡》全文3,4093 页 = 1,152(3.0×)5 页 = 1,920(1.8×)

中文长篇《故乡》13px 示例页(第 1/3 页):

鲁迅《故乡》13px 示例页

同是中文,4,974 字的长篇在 13px 下比 18px 再省 40%(1,920 → 1,152 token)—— 因为一篇短文往往连一页都填不满(此时 13px 与 18px 同为 1 页、无差别),而篇幅一长,页面容量才开始真正决定压缩比。

说明:

  • 英文大于等于 18px 压缩几乎无收益——英文每 token ≈ 5 字符,与 18px 图片每 token 约 5.9 字符相当; 英文建议 13px(约 2×)或直接用文本;
  • 中文 18px 约 2.1~2.5×,且字数越长、字号越小,中文优势越大;

原理

DeepSeek 视觉 API 对输入图片有固定计费规则(官方文档):

  • 每张图片进入模型前自动缩放:更大图片等比缩到总像素约 800×800 等效;
  • 每张图片 token 数存在上限:384 个 —— 2000×2000 和 5000×5000 的图,缩放后一样是 384;
  • 多张图每张独立计费。

对长文本:按文本发 → N 个 token;渲染成 800×800 的图 → 每 384 token/[页]。

实测(deepseek-v4-flash-vision-exp,18px):以《端午咸》(见上方示例图)为例—— 1,036 字 = 804 token(DeepSeek-V3 tokenizer 实测)→ 1 页 = 384 token(约 2.1×)。 真实增益取决于字号与语言:中文 18px 约 22.5×、1213px 约 4.66×(每页约 2,3002,900 字); 英文正文约 1~2×(每 token ≈ 5 字符 vs 图片每 token 约 5.9 字符)。页数上限默认 10 (可在设置中调为 1–20)。

安装

# 有 DSH CLI:
dsh plugin --profile web add dsh-text2img-compress@0.1.3

# 或直接 npm 安装:
npm install dsh-text2img-compress

然后重启 DSH、打开/刷新页面:输入框右侧、发送按钮左边出现「图」按钮。

需要当前模型是视觉模型(如 deepseek-v4-flash-vision-exp);模型名不含 vision 时 插件自动跳过转换(避免给纯文本模型发图片块导致报错)。

使用

  1. 点击「图」→ 变为「图·开」(状态持久化,重启不丢);
  2. 旁边可选字号 12–22px(1px 步进;越小越易读上限降低、每页字数越少,10 页上限内最省 token);
  3. 发送 ≥ 默认 600 字 的文本 —— 聊天里显示一条提示 + 文字图片;
  4. 模型直接读取图片内容(图中包含全部原文,含你写的指令,如"复述以下内容:")。

设置项(settings 命名空间 text2img,也可在 DSH 设置面板 →「文本转图压缩」页 编辑):

字段默认范围含义
enabledfalse布尔总开关(等价于输入框右侧「图」按钮)
fontPx1812–22(1px 步进)字号:越大越易读、每页字数越少
threshold600≥100最小字符数:更短的消息保持纯文本
maxPages101–20最多图片页数(DSH 附件上限 20 张/消息);超出自动回退纯文本

适用 / 不适用

✅ 适用("读懂大意/高保真阅读"):

  • 长文档/论文/手册/更新日志的理解、总结、检索;
  • 长上下文窗口的预算压缩(100KB 文档从 3 万+ token 降到几千);
  • 需要大致还原内容的场景(日期、数字、段落大意)。

⚠️ 不适用(需要逐字精确):

  • 代码、配置、SQL、JSON(一个字符错就全错)—— 请用文本发送;
  • 超长文本(超过 maxPages 默认 10 页 ≈ 约 13,000 字 @18px;可在设置中调到 1–20):插件会自动回退纯文本,绝不截断;
  • 小图/极小字号下的复杂排版(表格、公式)。

准确率提示:通用视觉模型不是 OCR 专用模型。建议根据实测选择字号—— 18px 是压缩与可读性的折中;对精度要求高用 22px,对预算极端敏感用 12px。

工作原理(实现)

  • Host:监听 agent/pre-step(官方 waterfall),把进入模型的用户消息中 单个文本块、≥ 阈值、当前模型为视觉模型的,用 @napi-rs/canvas 渲染成 800×800 PNG 页, 经 attachments.saveImages 落盘为 ImageBlock 后替换原文本块; 任何失败都回退纯文本,绝不丢内容、不中断会话。
  • Client:conversation.input.right 槽位注入「图」开关 + 字号下拉; 状态通过 DSH settings(ctx.settingsScope.bind)持久化,与 Host 共享同一命名空间。
  • 零自定义 RPC:开关/字号走 settings;渲染/替换走宿主事件与附件服务。

开发

pnpm install
pnpm build       # tsc (host+types) + tsdown (client bundle)
pnpm typecheck

结构:

src/index.ts      Host 插件(settings + agent/pre-step 替换)
src/render.ts     文本 → 800×800 PNG 页(@napi-rs/canvas,词边界换行)
src/ui/index.ts   Client 插件(「图」开关 + 字号下拉)
cordis.patch.yml  组合补丁(一行 insert)

License

MIT

相关插件

继续浏览 vision-media 分类下经过校验的插件。

Tool Describe Image@linxin666/dsh-tool-describe-image面向模型的 describe_image 工具,用于 dsh Web GUI:通过在兼容 OpenAI 的端点调用视觉语言模型,为文本模型提供图像理解能力,以描述一张图像(本地路径、http(s) URL 或附件引用)。可热插拔 —Modlens@liustack/modlens面向仅支持文本的 LLM 的插件视觉能力,由免费的 Antigravity CLI 提供支持Deepseek Ivideodeepseek-ivideoiPolloWork HyperFrames Video Studio,以及 27 个可编辑视频模板,以原生 DeepSeek Harness 对话视图呈现。Imagegen@dickpy/dsh-imagegendsh Web GUI 的 AI 图像生成插件:通过可配置的提供商渠道实现文生图和图生图(gpt-image-2 / grok-imagine-image / nanobanana series / seedream-5.0-pro / dall-e-3,支持原生 xAI Grok Imagine、Google Nano Banana a