开发人员用一个问题测试模型,答案正确、速度也快,但上线后却出现超时、限流、格式错误和成本失控。原因通常不是模型突然变差,而是单次测试没有覆盖生产条件。 测试输入往往短而整洁,生产输入可能包含长文档、乱码、空字段、重复请求和恶意内容。系统需要为长度、格式和文件类型设置边界。 单人测试没有并发,上线后多个任务同时请求,容易触发账户限流、连接耗尽或队列积压。并发和每分钟请求量应按账户限制与服务器能力逐步压测。 测试时网络正常,生产中会出现超时和部分失败。重试必须有上限、退避和幂等,避免一次失败变成多次计费或重复业务动作。 模型回答也不保证始终符合 JSON 等固定格式。程序需要做结构校验,失败时要求修复、降级或转人工,不能把解析异常当成空结果继续运行。 此外,模型版本、账户权限和接口能力可能变化。生产配置要记录版本,建立健康检查和回归任务,出现 403、404、429 等错误时区分权限、模型不存在和限流,而不是统一重试。 上线验收应模拟真实长度、并发、失败和预算条件。一次调用成功是开始,持续稳定地得到合格结果才是生产系统需要证明的能力。 本文在提纲整理和初稿撰写中使用了AI辅助,发布前已人工复核事实与表达。