dsh-skill-eval:用 LLM judge 量化 DSH 技能触发可靠性的评测插件
# 前言 在 DSH(DeepSeek Harness)里,一个技能能不能被用上,很大程度取决于它的 description:模型根据技能目录提示词里的 description,决定要不要调用某个技能。description 写得过窄,匹配的查询不会触发该技能(欠触发);写得过宽,不相关的查询也会被触发(过触发)。 这两种问题平时只能手工试几条查询,凭感觉判断,结果既不可复现,也难以比较。dsh-skill-eval 把这件事变成可复现的评测:用一个 LLM judge 完整复现官方技能目录提示词,逐条判断测试查询是否应触发目标技能,再汇总成指标。 #
阅读全文