知识库测试不能只选答案最明显的问题。要证明系统在真实工作中可用,测试集至少应覆盖六类情况。 第一类是标准问题,验证主要制度、产品和流程能够正确找到。第二类是不同说法,同一个问题用简称、口语和错别字表达,检查检索是否稳定。 第三类是条件问题,例如不同地区、版本或客户类型对应不同规则,回答必须保留条件。第四类是资料不足,系统应明确无法确认,而不是自行补全。 第五类是冲突与过期。故意加入旧版和新版资料,检查系统是否优先权威版本并提示差异。第六类是权限问题,普通员工不能通过换一种问法获得无权查看的内容。 每道题提前写出可接受答案、必须包含、不能出现和允许引用的来源。测试时记录完整回答、引用、版本和人工评分。 上线后把真实失败加入回归集。每次更新文档、切换模型或调整检索参数,都重新运行同一批问题。测试集不是一次验收文件,而是知识库持续维护的基础设施。 本文在提纲整理和初稿撰写中使用了AI辅助,发布前已人工复核事实与表达。