AI 试点结束时,团队最容易展示的是调用次数、生成字数和几段优秀回答。这些数据能说明系统被使用过,却不能单独证明项目值得继续。 质量指标要基于版本化样本。统计一次通过、需要修改、拒绝和严重错误,并按任务类型分别计算。平均分不能掩盖少数高影响失败。 效率指标要比较完整流程。记录从接收任务到批准结果的总时间,包括等待、人工修改、复核和返工,而不是只记录模型响应的几秒钟。 成本指标应包含 API、检索、存储、工程维护、人工审核和失败重做。用总成本除以合格交付数量,比单看 Token 价格更接近业务实际。 风险指标包括隐私事件、越权、错误动作、无法解释的结果、投诉和撤回。严重事件即使数量很少,也可能触发暂停,不能被平均收益抵消。 使用指标要看用户能否在真实流程中完成任务。采纳率低可能来自结果差,也可能来自入口复杂、等待太久或责任不清,需要结合访谈判断。 最终决策不只有“全面上线”和“彻底停止”。企业可以缩小范围、更换模型、补充数据、调整人工门禁或继续观察。试点的价值,是把原来的想象变成可比较证据,让下一步投入建立在真实结果上。 本文在提纲整理和初稿撰写中使用了AI辅助,发布前已人工复核事实与表达。