DeepSeek Harness 插件
DeepSeek Harness 插件Manifest 有效

c-vision

为 DeepSeek Harness 智能体提供屏幕/窗口视觉、OCR 识别与键鼠操作能力的 DSH 视觉组合包插件。

视觉与图像终端与 TUI开发者工具Skills 与工作流
0GitHub Stars0Fork 数更新于2026-09-17

安装

$ dsh plugin --profile tmp add github:cczzyy-cn/c-vision # 作为 bundle 自动挂载

插件能力与用途

基于公开仓库快照由 AI 辅助整理,内容必须有源码依据;它不等同于兼容性验证或安全验证。

源码有据
c-vision(Vision)是专为 DeepSeek Harness 设计的视觉与电脑使用(computer-use)组合包插件。通过结合内置的 Python cvision 后端与 DSH 附件服务,为 AI 智能体赋予窗口列举、非侵入式后台窗口截图、局部区域 OCR 文本识别以及模拟鼠标键盘操作等能力,构建完整的“看-操作-看”自动化闭环。

核心能力

  • 基于 Windows Graphics Capture (WGC) 与 macOS screencapture 的原生窗口/全屏截图
  • 基于系统原生 OCR 及 Tesseract 回退机制的屏幕与窗口文字识别
  • 枚举所有可见桌面窗口信息的 list_windows 工具
  • 支持绝对坐标单击、双击、光标移动及滚轮滚动的鼠标控制
  • 模拟焦点文本输入与组合快捷键触发的键盘操作
  • 通过窗口标题子串进行窗口置顶聚焦
  • 针对 Harness 附件尺寸限制自动进行图像裁剪与降采样适配

适用场景

  • 构建基于视觉反馈循环的桌面端 Agent 自动化操作流程
  • 快速读取终端、文档或应用界面中的文本以节省图像 Token
  • 实现浏览器及桌面端软件的跨窗口自动化点击与表单填写
  • 在不抢占前台焦点的情况下对后台或被遮挡窗口进行静默视觉巡检

适合谁

  • 在 DeepSeek Harness 上开发 Computer-Use 智能体的开发者
  • 需要利用 DeepSeek 视觉模型执行桌面 RPA 自动化任务的工程师
  • 希望赋予 AI 桌面观察与操作协助能力的个人用户

文档中可确认的限制

  • 依赖目标机器预装 Python 3 并通过 pip 安装 requirements.txt 中的依赖
  • Linux 捕获后端当前处于规划占位阶段(Phase 2)
  • macOS 平台需在系统设置中手动开启“屏幕录制”隐私权限
  • 键鼠工具会真实触发物理操作,坐标计算错误可能导致误触

DSH 兼容性

DSH Plugin 针对具体版本记录的运行验证证据。没有结果只代表我们尚未测试,不代表不兼容。

尚未测试目前还没有发布运行兼容性测试结果。

安全信号

来自包元数据和源码检查的客观信号。这些信息用于辅助判断,不代表绝对安全保证。

目前还没有发布自动安全检查信号。

来源与 Registry 记录

展示此条目的公开来源、Registry 分类与最近一次源码检查信息,并与运行验证结果明确分开。

源码仓库
cczzyy-cn/c-vision
Registry 来源
GitHub · dsh-plugin topic
Registry 分类
Plugin Bundle
源码检查
c8a002f · 2026-09-20

本页面基于公开源码信息独立收录。DSH Plugin 与 DeepSeek 及插件作者均无隶属关系;安装前请始终以作者仓库中的最新说明为准。

仓库活跃度

GitHub Stars
0GitHub stars
Fork 数
0
未关闭 Issue
0
最近提交
2026-09-17
最近发布
2026-09-17
插件维护者

你在维护这个插件吗?

此条目根据公开仓库数据生成。如果你维护该项目,可以检查页面信息;如果你认为这个条目对用户有帮助,也可以在 README 或项目资源中引用它。

添加到 README
已收录于 DSHPlugin.app