CATEGORY
该分类下经过 manifest 校验、精确版本的插件。
dsh-voice-control
DSH web 的语音控制:通过 Web Speech API 将语音转为文本输入编辑器(支持自动发送),并播放助手回复
dsh-photos
DeepSeek Harness 编辑器的照片上传功能——通过原生选择器接入内置粘贴流程
dsh-multimodal-runtime
Mogu Multimodal Runtime - DeepSeek Harness 统一多模态能力运行时(Comfy Local Provider V1)
dsh-speech-input
用于 DeepSeek Harness 的麦克风按钮,可将浏览器语音识别结果写入编写器草稿。
dsh-maclens
将 Apple 的设备端 Vision framework(macOS)接入 DeepSeek Harness:提供 OCR、图像分类、人脸检测和文档布局分析作为本地 dsh 工具。无需网络、API 密钥或守护进程。
dsh-tu4-inline-images
对话内联图片 DSH 插件 — 输入框/用户消息/LLM 回复中的本地图片路径直接渲染为图片(回环路由 + 强 token + 多根白名单 + 尺寸三档)。Inline local images in DSH web conversations.
dsh-model-auto-hot-switch
DeepSeek Harness (dsh) 按任务自动切换模型:包含图像的任务自动路由至视觉模型,其他任务继续使用默认模型。不增加额外 token,不干扰上下文。
xby-obb
检测图像中的旋转目标,输出旋转边界框、角度、置信度和类别标签。支持15个目标类别:飞机、船、储罐、棒球场、网球场、篮球场、田径场、港口、桥梁、大型车辆、小型车辆、直升机、环形交叉路口、足球场和游泳池。
xby-ocr-bank-card
识别银行卡号、发卡银行和卡类型,使用 Luhn 算法校验卡号有效性。
xby-ocr-captcha
输入常见验证码图片,返回验证码文本内容。
xby-ocr-driver-license
识别驾驶证主页(证号、姓名、性别、国籍、住址、出生日期、准驾车型、初次领证日期、有效期限)和副页(档案编号)。
xby-ocr-handwriting
输入包含手写文本的图像,自动检测文本行并识别内容。适用于手写笔记、签名、手写表单等。
xby-ocr-id-card
识别身份证正面(姓名、性别、民族、出生日期、住址、身份证号)和背面(签发机关、有效期限),自动判断正反面并校验身份证号有效性。
xby-ocr-pass
识别港澳通行证、台湾通行证的通行证号码、姓名、性别、出生日期、有效期、签发地点等信息,支持MRZ机读码解析。
xby-ocr-passport
识别护照号码、中文姓名、英文姓名、性别、国籍、出生日期、签发日期、有效期至、签发地点等信息,支持MRZ机读码解析。
xby-ocr-pro
高精度文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。
xby-ocr-vehicle-license
识别机动车行驶证的号牌号码、车辆类型、所有人、住址、品牌型号、发动机号码、车辆识别代号等信息,支持自动方向检测和主副页过滤。
xby-ocr
兼顾速度与精度的文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。
xby-pedestrian
输入一张图像,检测图像中的行人,输出所有目标的检测框、置信度和标签。
xby-pet-detect
识别宠物面部表情,输出 4 类情绪: Angry / Happy / Relaxed / Sad。
xby-pic
包括通用文本识别、手写识别、车牌识别、身份证识别、日常物体检测、昆虫识别、植物识别、护照识别、港澳台通行证识别、银行卡识别、营业执照识别、驾驶证识别、行驶证识别、动物识别、电动自行车检测、手机检测、手势检测、火焰检测、香烟检测、人头人体检测、野生动物检测、鸟类识别、宠物情绪识别、菜品识别、安全帽人体检测、行人检测、反光衣检测、车辆检测、图像分类、目标检测、旋转目标检测、人体姿态估计和万物识别。
xby-plant-recognition
识别植物名称(或所属科, 属, 种或亚种)。
xby-plate-recognition
识别车牌号、车牌颜色、单/双层车牌、位置框。
xby-pose
检测图像中的人物,输出边界框和关键点坐标。每人有 17 个关键点,每个点代表人体不同的部位,依次为鼻子、左眼、右眼、左耳、右耳、左肩、右肩、左肘、右肘、左腕、右腕、左髋、右髋、左膝、右膝、左脚踝、右脚踝。
xby-read-pdf
一个支持AI助手读取和分析PDF文件的MCP服务器,提供PDF元数据提取、页面范围阅读和关键词搜索等功能。
xby-recog
包括通用文本识别、手写识别、车牌识别、身份证识别、护照识别、港澳台通行证识别、银行卡识别、营业执照识别、驾驶证识别、行驶证识别。
xby-reflective-vest
输入一张图像,检测人员是否穿戴反光衣,输出图片中所有目标的检测框、置信度和标签(safe/unsafe)。
xby-seg
实例分割比目标检测更进一步,不但要识别图像中的单个对象,还要将其从图像的其余部分中分割出来。对图像中的80类COCO目标进行实例分割,输出边界框、掩膜、置信度和类别标签。
xby-smoking-detection
输入一张图像,对其中的香烟目标进行检测,输出图片中所有目标的检测框、置信度和标签。
xby-speech-synthesis
一个集成了Microsoft Edge高质量语音合成能力的MCP服务器,支持多语言语音生成、音频合并和云端存储。