← DeepSeek Harness 插件
DeepSeek Harness 插件已收录
dsh-eval
用于通过 YAML 定义测试用例对 DeepSeek Harness 智能体运行进行基准测试和评估的插件。
UI 与效率终端与 TUI开发者工具安全与策略Skills 与工作流远程执行
安装
$ dsh plugin --profile eval add dsh-eval仓库智能解读
基于公开仓库快照由 AI 辅助整理,内容必须有源码依据;它不等同于兼容性验证或安全验证。
dsh-eval 是一个可安装的 DeepSeek Harness 评估插件,可通过无头 dsh 配置运行基准测试用例,将会话日志采集为追踪数据,计算运行指标,并生成 JSON 与 Markdown 报告。它还支持成对运行对比、LLM 评审、已记录日志回放,以及导入 Codex 或 Claude Code 日志。
核心能力
- 通过无头 dsh 子进程跨测试用例和试验次数运行 YAML 定义的基准测试
- 将持久化会话日志采集为试验追踪数据,并合并子智能体日志
- 计算任务、工具、工具选择、步骤、令牌、上下文、延迟、成本、重试和无效工具调用指标
- 支持脚本化任务检查和预期工具匹配
- 支持通过可选 LLM 评审配置进行最终答案评分和幻觉标记
- 生成 JSON 运行结果和 Markdown 报告
- 通过带符号的 B 减 A 差值以及胜/负/平统计比较两次运行
- 支持回放已记录日志,以及导入 Codex 或 Claude Code 会话日志
适用场景
- 对 DeepSeek Harness 智能体或技能进行回归测试
- 比较两种智能体、提示词、模型或配置变体
- 使用已记录日志在 CI 中运行可重复的基准测试套件
- 分析工具选择、任务完成率、延迟、令牌使用量和估算成本
- 将 Codex 或 Claude Code 会话日志转换为评估运行结果
适合谁
- DeepSeek Harness 插件和智能体开发者
- 维护智能体基准测试套件的团队
- 评估智能体配置或模型变更的工程师
文档中可确认的限制
- 该包面向官方 @deepseek-ai 发行版,并使用 0.1.0-rc.6 对等依赖。
- 执行基准测试需要 dsh 启动器,并且每个测试用例和试验都会运行一个无头 dsh 子进程。
- 任务成功率和工具选择指标依赖于基准测试中的 expected.check 与 expected.tool 配置。
- 基于 LLM 的最终答案评分和幻觉标记需要配置 judge。
- 并行试验执行和 Web 仪表板被列为路线图项目,并非当前功能。
DSH 兼容性
DSH Plugin 针对具体版本记录的运行验证证据。没有结果只代表我们尚未测试,不代表不兼容。
尚未测试目前还没有发布运行兼容性测试结果。
安全信号
来自包元数据和源码检查的客观信号。这些信息用于辅助判断,不代表绝对安全保证。
未发现 package.json
最新 GitHub 快照中未获取到仓库根目录的 package.json。
已声明许可证
GitHub 报告该仓库许可证为 MIT。
源码可用
本次 Registry 快照已获取公开 GitHub 源码元数据。
来源与 Registry 记录
展示此条目的可追溯源码与 Registry 元数据,并与运行验证结果明确分开。
- 源码仓库
- hccccc01333/dsh-eval
- Registry 数据源
- 公开 GitHub 仓库
- 源码快照
- 8c04b327d06a
- 项目类型
- plugin
- AI 整理
- gpt-5.6-terra · 2026-08-14
- Prompt 版本
- dsh-plugin-enrichment-v3
本页面基于公开源码信息独立收录。DSH Plugin 与 DeepSeek 及插件作者均无隶属关系;安装前请始终以作者仓库中的最新说明为准。
仓库活跃度
- GitHub Stars
- 0
- Fork 数
- 0
- 未关闭 Issue
- 0
- 最近提交
- 2026-08-14
- 最近发布
- —
相关 DSH 插件
综合核心能力、适用场景、插件类型、分类和 DSH Profile 进行相关性排序。