← DeepSeek Harness 插件
DeepSeek Harness 插件Manifest 有效
dsh-vision-skill
DeepSeek Harness 标准识图技能与工具包,支持图像分析、OCR、目标定位及贴图直转路径。
视觉与图像UI 与效率终端与 TUI开发者工具Skills 与工作流
2GitHub Stars0Fork 数更新于2026-09-18
安装
$ dsh plugin --profile web add github:DDDFXYqiming/dsh-vision-skill插件能力与用途
基于公开仓库快照由 AI 辅助整理,内容必须有源码依据;它不等同于兼容性验证或安全验证。
dsh-vision-skill 是专为 DeepSeek Harness(DSH)打造的原生视觉技能插件。它结合了 Qwen 动态分辨率预处理、多 Provider 故障转移与 429 退避机制、渐进式工具暴露、本地 Tesseract 优先的长图分块 OCR 以及零补丁 paste-to-path 贴图支持,使纯文本大模型能够安全高效地处理图像输入。
核心能力
- 多模式图像分析(支持通用、OCR、表格、代码、报错以及结构化证据提取)
- 目标定位与元素检测,返回归一化坐标与像素坐标框
- 基于本地像素算法的主色分析,无需消耗 API Token
- 超长截图分块 OCR(本地 Tesseract 优先,VLM 兜底)
- Web 端 paste-to-path 贴图直传工作区,避免模型图像块报错
- 基于 SHA-256 的图像记忆缓存与剪贴板截图兜底识别
- 渐进式工具暴露机制,降低 Agent 初始上下文开销
- 多 Provider 故障转移、429 自动退避与工作区路径安全围栏
适用场景
- 在 DSH 对话与工作流中识别架构图、报错截图、代码及表格内容
- 对长聊天记录或长截图进行混合 OCR 文本提取
- UI 自动化测试与界面元素定位(获取像素与边界框坐标)
- 在 DSH Web 客户端中直接粘贴图片并无缝交由模型分析
适合谁
- 需要在纯文本模型环境下扩展识图与视觉定位能力的 DeepSeek Harness 用户
- 构建自动化视觉工作流与 UI 识别 Agent 的 DSH 开发者
- 需要高效长图 OCR 与本地图片分析工具的工程师
文档中可确认的限制
- 依赖本地 Python 环境及相关依赖(Pillow、可选 Tesseract)运行底层识别脚本
- VLM 识别功能需配置有效的 OpenAI 兼容多模态模型 API 与 Credential 密钥
- 若在用户层或项目层存在同名 'vision' 技能可能会产生加载优先级覆盖
DSH 兼容性
DSH Plugin 针对具体版本记录的运行验证证据。没有结果只代表我们尚未测试,不代表不兼容。
尚未测试目前还没有发布运行兼容性测试结果。
安全信号
来自包元数据和源码检查的客观信号。这些信息用于辅助判断,不代表绝对安全保证。
目前还没有发布自动安全检查信号。
来源与 Registry 记录
展示此条目的公开来源、Registry 分类与最近一次源码检查信息,并与运行验证结果明确分开。
- 源码仓库
- DDDFXYqiming/dsh-vision-skill
- Registry 来源
- GitHub · dsh-plugin topic
- Registry 分类
- Plugin
- 源码检查
- 6fe7fc1 · 2026-09-19
本页面基于公开源码信息独立收录。DSH Plugin 与 DeepSeek 及插件作者均无隶属关系;安装前请始终以作者仓库中的最新说明为准。
仓库活跃度
- GitHub Stars
- 2GitHub stars
- Fork 数
- 0
- 未关闭 Issue
- 0
- 最近提交
- 2026-09-18
- 最近发布
- 未发现 Release
相关 DSH 插件
综合核心能力、适用场景、插件类型、分类和 DSH Profile 进行相关性排序。