DeepSeek Harness 插件
DeepSeek Harness 插件Manifest 有效

dsh-vision-skill

DeepSeek Harness 标准识图技能与工具包,支持图像分析、OCR、目标定位及贴图直转路径。

视觉与图像UI 与效率终端与 TUI开发者工具Skills 与工作流
2GitHub Stars0Fork 数更新于2026-09-18

安装

$ dsh plugin --profile web add github:DDDFXYqiming/dsh-vision-skill

插件能力与用途

基于公开仓库快照由 AI 辅助整理,内容必须有源码依据;它不等同于兼容性验证或安全验证。

源码有据
dsh-vision-skill 是专为 DeepSeek Harness(DSH)打造的原生视觉技能插件。它结合了 Qwen 动态分辨率预处理、多 Provider 故障转移与 429 退避机制、渐进式工具暴露、本地 Tesseract 优先的长图分块 OCR 以及零补丁 paste-to-path 贴图支持,使纯文本大模型能够安全高效地处理图像输入。

核心能力

  • 多模式图像分析(支持通用、OCR、表格、代码、报错以及结构化证据提取)
  • 目标定位与元素检测,返回归一化坐标与像素坐标框
  • 基于本地像素算法的主色分析,无需消耗 API Token
  • 超长截图分块 OCR(本地 Tesseract 优先,VLM 兜底)
  • Web 端 paste-to-path 贴图直传工作区,避免模型图像块报错
  • 基于 SHA-256 的图像记忆缓存与剪贴板截图兜底识别
  • 渐进式工具暴露机制,降低 Agent 初始上下文开销
  • 多 Provider 故障转移、429 自动退避与工作区路径安全围栏

适用场景

  • 在 DSH 对话与工作流中识别架构图、报错截图、代码及表格内容
  • 对长聊天记录或长截图进行混合 OCR 文本提取
  • UI 自动化测试与界面元素定位(获取像素与边界框坐标)
  • 在 DSH Web 客户端中直接粘贴图片并无缝交由模型分析

适合谁

  • 需要在纯文本模型环境下扩展识图与视觉定位能力的 DeepSeek Harness 用户
  • 构建自动化视觉工作流与 UI 识别 Agent 的 DSH 开发者
  • 需要高效长图 OCR 与本地图片分析工具的工程师

文档中可确认的限制

  • 依赖本地 Python 环境及相关依赖(Pillow、可选 Tesseract)运行底层识别脚本
  • VLM 识别功能需配置有效的 OpenAI 兼容多模态模型 API 与 Credential 密钥
  • 若在用户层或项目层存在同名 'vision' 技能可能会产生加载优先级覆盖

DSH 兼容性

DSH Plugin 针对具体版本记录的运行验证证据。没有结果只代表我们尚未测试,不代表不兼容。

尚未测试目前还没有发布运行兼容性测试结果。

安全信号

来自包元数据和源码检查的客观信号。这些信息用于辅助判断,不代表绝对安全保证。

目前还没有发布自动安全检查信号。

来源与 Registry 记录

展示此条目的公开来源、Registry 分类与最近一次源码检查信息,并与运行验证结果明确分开。

源码仓库
DDDFXYqiming/dsh-vision-skill
Registry 来源
GitHub · dsh-plugin topic
Registry 分类
Plugin
源码检查
6fe7fc1 · 2026-09-19

本页面基于公开源码信息独立收录。DSH Plugin 与 DeepSeek 及插件作者均无隶属关系;安装前请始终以作者仓库中的最新说明为准。

仓库活跃度

GitHub Stars
2GitHub stars
Fork 数
0
未关闭 Issue
0
最近提交
2026-09-18
最近发布
未发现 Release
插件维护者

你在维护这个插件吗?

此条目根据公开仓库数据生成。如果你维护该项目,可以检查页面信息;如果你认为这个条目对用户有帮助,也可以在 README 或项目资源中引用它。

添加到 README
已收录于 DSHPlugin.app