Agent 評估與回歸閘門
為 Agent 系統設計結果導向、可重跑且能阻擋回歸的評估套件。
逐篇公開審查紀錄
桌面審查結論
evaluation 已通過四項桌面門檻。實用性評為 high:內容包含可操作流程與具體範例,能降低查找規則、重建步驟或漏掉檢查項的成本。
通過完整來源審查、三類合成任務測試與八項通用性品質門檻,依本次委託重審列入固定 30 席。
- 它完成什麼工作
- 為 Agent 系統設計結果導向、可重跑且能阻擋回歸的評估套件。
- 實質幫助
- 高 — 內容包含可操作流程與具體範例,能降低查找規則、重建步驟或漏掉檢查項的成本。
- 應該啟用
- 任務明確需要:This skill should be used when building agent evaluation systems: deterministic checks, regression suites, multi-dimensional rubrics, quality gates, production monitoring, baseline comparison, and outcome measurement for agent pipelines.
- 不該啟用
- 需求不屬於「evaluation」的工作範圍,或只是名稱相近但交付物不同。
- 無法提供必要輸入、適用技術棧或可隔離的測試環境。
- 任務要求直接執行 financial 外部動作,且沒有 dry-run 或人工確認。
- 輸入
- 與「evaluation」工作直接相關的需求、現有素材、限制與完成條件
- 輸出
- 依原始 Skill 工作流程產生的「evaluation」專用成果、步驟或決策建議
來源、授權與依賴
來源:原始來源:https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering/tree/main/skills/evaluation;於 2026-08-08T15:34:07.434Z 取得 285 行,SHA-256 1f31cda0910dfd48d928e1485b303b739608ceeb0babca0e9a6f821cbf4320ff。
授權:上游授權檔檢出 MIT;本館 catalog 欄位依 README 正式授權章節維持 MIT。
依賴:原文未明示需另行安裝的套件;仍須依實際執行環境確認工具可用性。
快照:開啟審查來源 · 285 行 · SHA-256 1f31cda0910d… · 2026-08-08T15:34:07.434Z
安全測試邊界
使用合成、非敏感的與「evaluation」工作直接相關的需求、現有素材、限制與完成條件,只評估依原始 Skill 工作流程產生的「evaluation」專用成果、步驟或決策建議;不連線到正式環境,不提交或發布結果。
- 不得在測試中直接執行 financial 類外部動作
這是可安全執行的測試方案;只有固定 30 席推薦 Skill 另有三類實測通過證據。
價值證據
- 285 行內容、12 個主要小節
- 4 個程式碼區塊、25 個編號步驟、0 個檢查項
- 1 個明示附檔
限制
桌面審查未發現額外限制;仍不等同推薦或正式環境保證。
必要附檔:1/1 可取得
references/metrics.md— 可取得
公開策展紀錄
為什麼推薦
- 明確工作
- 為 Agent 系統設計結果導向、可重跑且能阻擋回歸的評估套件。
- 應該啟用
- 需要比較 prompt、model、tool 或 Agent 版本,或建立發布品質閘門。
- 不該啟用
- 只有一次性主觀示範,沒有可重跑任務集、baseline 或要比較的變更。
- 輸入
- 任務與成功定義
- baseline
- 正常、邊界與已知失敗樣本
- 輸出
- 分層測試集
- 決定性檢查與 rubric
- 分維指標
- 回歸閘門與失敗切片
- 和現有 Skill 的差異
- 先比對可機器驗證結果,再使用多維 rubric;不以單一平均分掩蓋特定失敗。
- 來源、授權與依賴
-
- 來源:已確認。原始來源:https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering/tree/main/skills/evaluation;於 2026-08-08T15:34:07.434Z 取得 285 行,SHA-256 1f31cda0910dfd48d928e1485b303b739608ceeb0babca0e9a6f821cbf4320ff。
- 授權:已確認。上游授權檔檢出 MIT;本館 catalog 欄位依 README 正式授權章節維持 MIT。
- 依賴:已確認。無額外依賴
- 完成條件
- 所有關鍵維度都有 baseline、可重跑案例與獨立閘門,回歸不會被平均分掩蓋。
- 最小必要脈絡
- Agent 任務與成功定義
- 可比較 baseline
- 可組合的工作
- 新鮮度與下次複審
- 變動風險:中;最晚於 2027-02-09 前複審。
- 證據層級
- 合成任務測試。已通過隔離式合成任務 evaluator;目前未蒐集採用率或真實使用成功率,不把測試通過冒充社群採用證據。 合成測試通過只代表在隔離案例中符合預期,不等於真實採用率、使用成功率或社群背書。
三類測試證據
提示:替客服 Agent 建立可比較 prompt v1/v2 的 regression eval。
預期:應啟用:為 Agent 系統設計結果導向、可回歸比較的評估套件與品質閘門。
結論:此提示明確要求比較客服 Agent 的 prompt v1/v2 並建立可重跑的 regression eval,直接符合 Skill 的 baseline comparison、regression suite 與 quality gate 職責。
Codex isolated evaluator;read-only sandbox;合成、非敏感輸入;無外部副作用 · 2026-08-09
提示:只幫我挑一個看起來最好的回答,不需要重跑。
預期:不應啟用;邊界:只有一次性主觀示範,沒有可重跑任務集、baseline 或要比較的變更。
結論:此提示只要求一次性主觀挑選,沒有可重跑任務集、baseline 或版本回歸目標,因此不應啟用此 Skill;若要嚴謹比較,應先補上成功標準、baseline 與代表性案例。
Codex isolated evaluator;read-only sandbox;合成、非敏感輸入;無外部副作用 · 2026-08-09
提示:設計十個合成客服案例,分開量測正確性、拒答、格式與 tool routing,並定義 release gate。
預期:有基線、案例分層、可重跑 evaluator、失敗切片及明確門檻。
結論:依 Skill 的結果導向、分維評分、決定性檢查、baseline 比較及獨立閘門方法,設計了十案合成 smoke regression suite。十案不足 Skill 建議的 50 案可靠訊號,因此閘門僅能作為合成發布檢查,不能宣稱生產成功率。
Codex isolated evaluator;read-only sandbox;合成、非敏感輸入;無外部副作用 · 2026-08-09
啟用時機
當你需要建置 evaluation frameworks 用於 agent systems時使用。
適合使用情境
- 需要建置 evaluation frameworks 用於 agent systems。
- 想使用 muratcankoylan/evaluation 這類已整理好的 Agent Skill,而不是從零撰寫 prompt。
- 需要從 awesome-agent-skills 索引快速找到 Context Engineering 相關 Skill。
Skill 檔案
awesome-agent-skills README catalog entry
工作流程
- 先開啟原始來源,確認該 Skill 的安裝方式、支援工具與限制。
- 把 Skill 放到對應 agent 或 IDE 的 skills 目錄。
- 用一個小型真實任務測試 Skill 是否會在正確時機啟用。
- 確認輸出符合原始 Skill 的工作契約,再匯入日常工作流。
使用注意事項
- 這筆是 awesome-agent-skills 的索引項,本 workspace 未包含完整 SKILL.md。
- 實際安裝前請回到原始來源確認最新內容、授權與目錄結構。
來源
來源頁標題:Evaluation 設計 Skill
來源識別名稱:muratcankoylan/evaluation
Build evaluation frameworks for agent systems
software-engineering-prompt-repos/awesome-agent-skills/README.md
開啟來源這個 Skill 在做什麼
建置 evaluation frameworks 用於 agent systems。這筆資料來自 awesome-agent-skills 的索引清單,原始專案是 muratcankoylan/evaluation。
為什麼值得收錄
它屬於 Context Engineering 相關的 Agent Skill,可作為尋找、安裝或評估同類 Skill 的入口。因為來源 repo 本身沒有把完整 Skill 檔案放在本地,所以此頁保留 catalog 資訊與原始連結,避免把索引項誤認為完整 SKILL.md。
來源 Skill
這筆資料來自 awesome-agent-skills 的上游索引清單;本 workspace 沒有下載完整 SKILL.md。請開啟來源連結檢視或安裝原始 Skill。
開啟原始 Skill