RAG 评估与防幻觉验证
v1.1.0RAG 问答系统的质量评估与防幻觉验证方法论。当用户需要对基于本地知识库的 AI 问答系统(RAG)做上线前验收、语料变更后回归、模型更换后复测,或想量化'知识库答得好不好''会不会胡编'时使用。覆盖:正向评估集(区域×主题矩阵+关键词命中)、负面测试集(知识库外问题+拒答信号表)、防幻觉三机制(低相似度拒答/引用兜底/条文级引用要求)、幂等服务守护、评估脚本模式、本地零积分检索评测与阈值扫描选优。触发词:RAG 评估、评估集、负面测试、防幻觉、知识库答得准不准、引用验证、eval_runner、eval_negative、检索层评测、阈值扫描拒答、能力评测套件、run_suite、零积分评测。
0· 0·0 当前·0 累计
下载技能包
License
MIT-0
运行时依赖
无特殊依赖
安装命令
点击复制官方npx clawhub@latest install rag-eval-harness
镜像加速npx clawhub@latest install rag-eval-harness --registry https://cn.longxiaskill.com镜像同步中