前言¶
让一个 DSH agent 跑完一个已有基准,技术上说并不难;难的是跑完之后留下可校验的证据:结果是不是按固定协议、固定种子和固定参数跑出来的,JSON artifact 的字段对不对,最后写出的报告有没有把运行数字偷偷说成交易能力。ml-quant-trading 仓库把这些问题定义得很清楚——确定性合成输入、固定的 protocol v1 命令、适合自动检查的 JSON artifact、公开的 issue 模板,以及一条明确边界:基准吞吐量不等于交易表现。
要把「运行 → 校验 → 总结 → 起草报告」这条链路交给 agent 稳定执行,需要把每一步注册成工具。下面介绍的 dsh-plugin-mlquant-benchmark 就是做这件事的。
这是什么¶
dsh-plugin-mlquant-benchmark 是 initial-d 维护的 DeepSeek Harness 插件,一句话定位:用于复现 ml-quant-trading protocol v1 基准的 DSH 工具集。许可证为 MIT,当前版本 0.1.0。
它解决的问题很窄:让 DSH agent 能够运行现有 benchmark、读取机器可读的 artifact、对照基准协议做校验,并起草一份可以直接提交的 issue 报告。边界同样明确:不添加交易 agent,不调用行情数据 API,也不配置任何模型提供方。
README 把挑战写成一句话:DeepSeek Harness 能不能端到端复现一个量化基准、保住证据包,并且不把运行数字变成 alpha 声明。这个插件就是对这个问题的回答。
核心功能¶
插件注册四个 DSH 工具:
mlquant_benchmark_v1_cpu:运行固定的 protocol v1 CPU benchmark,结果写入artifacts/benchmark-v1.json。mlquant_read_benchmark_json:读取 JSON artifact,渲染成紧凑的 Markdown 结果表。mlquant_validate_benchmark_json:校验 protocol v1 字段、预期用例、固定参数和方差警告。mlquant_draft_github_issue:从 JSON artifact 起草 DeepSeek Harness benchmark issue 正文,它不会发布到 GitHub。
四个工具对应报告链路的四步:先跑,再读,再校验,最后起草。发布这一步留给人工。
安装与启用¶
在 DeepSeek Harness 的 profile 或 preset 环境里执行安装命令:
dsh plugin --profile web add github:initial-d/dsh-plugin-mlquant-benchmark
包声明了一个 dsh.bundle manifest(patch: ./cordis.patch.yml),bundle id 为 mlquant-benchmark,会插入下面这行:
- id: mlquant-benchmark
name: dsh-plugin-mlquant-benchmark
两点需要知道:这个包刻意尚未发布到 npm,目前只通过 GitHub 分发;依赖为 @deepseek-ai/dsh-tools ^0.1.0-rc.7(同时出现在 peerDependencies 和 devDependencies 中)。
典型用法¶
经过上面的安装与配置,典型的使用路径是 README 里的 Run-To-Report Path,一共四步:
- 从 GitHub 安装插件。
- 在 DSH 中打开一个
initial-d/ml-quant-tradingcheckout。 - 让 DSH 运行、校验、总结并起草 benchmark 报告。
- 通过专用 issue 模板提交草拟的报告。
这条路径刻意保持很小。具体执行时,README 建议的 DSH prompt 是:
Read AGENTS.md, docs/benchmarking.md, and docs/reality_check.md.
Use the mlquant benchmark tools to run the protocol v1 CPU benchmark, validate
and read the JSON artifact, and draft a DeepSeek Harness benchmark report. Keep
the result as an engineering reproducibility benchmark, not a trading-performance
claim.
注意 prompt 结尾那句要求:把结果保持为工程可复现性基准,而不是交易性能声明。
公开报告路径走主仓库的专用模板:
https://github.com/initial-d/ml-quant-trading/issues/new?template=deepseek_harness_benchmark.yml
种子示例见 https://github.com/initial-d/ml-quant-trading/issues/61。想了解背景和面向 agent 的护栏,可以读主仓库的 DeepSeek Harness Recipe 与 Quant Agent Reproducibility Target 两份文档。
本地开发¶
如果用本地 checkout 开发,在 manifest 中手动添加同一行:
- id: mlquant-benchmark
name: file:/path/to/dsh-plugin-mlquant-benchmark
开发命令是:
npm install
npm test
测试会用 mock 的 ctx.tools.register 加载插件,验证四个工具都能注册,读取并校验示例 artifact,并起草一份 issue 正文。
适用场景与注意¶
适合的人:想验证 agent harness 能否端到端复现一个量化基准、并把证据包完整保留下来的 DSH 开发者。这个插件不提供投资建议,不声明回测性能,artifact 中不含私有数据或 API key,工具也不会向 GitHub 发布任何内容——提交报告始终是人工动作。
另外几点提醒:
- 插件以当前 dsh 进程的权限运行,安装前应检查源码与许可证(本项目为 MIT)。
- 插件没有任何隐藏的模型提供方配置。
- 它不是交易系统的一部分,只负责基准复现这条链路。
结尾¶
dsh-plugin-mlquant-benchmark 的价值在于把一条容易走样的链路固定下来:DSH 的注意力被引导到运行、校验、读取和起草上,产出一份可复现的工程基准报告,而不是投资或排行榜声明。插件已列入 awesome-dsh-plugin(via PR #2573)。
- 社区目录页:https://www.skillhub.cn/plugins/initial-d/dsh-plugin-mlquant-benchmark
- GitHub:https://github.com/initial-d/dsh-plugin-mlquant-benchmark