dsh-skill-eval:用 LLM judge 量化 DSH 技能觸發可靠性的評測插件

# 前言 在 DSH(DeepSeek Harness)裏,一個技能能不能被用上,很大程度取決於它的 description:模型根據技能目錄提示詞裏的 description,決定要不要調用某個技能。description 寫得過窄,匹配的查詢不會觸發該技能(欠觸發);寫得過寬,不相關的查詢也會被觸發(過觸發)。 這兩種問題平時只能手工試幾條查詢,憑感覺判斷,結果既不可復現,也難以比較。dsh-skill-eval 把這件事變成可復現的評測:用一個 LLM judge 完整復現官方技能目錄提示詞,逐條判斷測試查詢是否應觸發目標技能,再彙總成指標。 #

閱讀全文