Evaluate RAG retrieval runs against a versioned golden query set using Hit@K, Recall@K, MRR, nDCG and no-answer correctness; compare a candidate run with a baseline, block critical regressions, and create a source-level repair queue. Use before changing chunking, embeddings, metadata filters, hybrid search, rerankers or knowledge-base versions.
Test whether a RAG or enterprise knowledge assistant still retrieves the right evidence before the generated answer hides a retrieval failure.
golden_queries.json with expected source document IDs, critical cases, no-answer cases and tags. Export the ranked document IDs returned by the current baseline and a candidate configuration.CODEBLOCK0
Outputs:
rag_eval_report.json: baseline, candidate, deltas and per-query evidence.Read references/usage.md for schemas and recovery. Read references/metrics.md before changing thresholds.
请通过上方所属套餐查看交付内容与下载方式。
下载不等于安装成功,运行环境、平台适配和外部服务需按说明准备。
此处不单独展示技能价格,请以上方所属套餐价格为准。