企业选大模型时,容易陷入两种比较:只看排行榜,或者只看每百万 Token 价格。更可靠的起点不是模型,而是任务。 先写清输入是什么、输出给谁、错误会造成什么影响。例如,内部摘要、客户回复、合同审查和自动执行工具,对准确性、隐私和人工复核的要求完全不同。 能力比较要使用自己的样本。公开榜单可以帮助筛选候选,但企业文档长度、术语、语言和格式可能与榜单不同。用同一套版本化任务,逐条记录正确性、遗漏、格式和拒答,才能看到真实差异。 成本也不只是输入输出单价。还包括检索、工具调用、重试、人工修改、失败返工、并发限制和响应时间。便宜模型如果需要多次重试,单次合格交付成本可能更高。 风险决定验收强度。低风险草稿可以允许人工修改,高风险决定应要求来源、权限控制和明确接管。模型能力再强,也不能取代业务授权。 最终可以按任务分层使用模型:简单分类和格式处理选择稳定低成本方案;复杂推理使用更强候选;高影响动作增加人工批准。企业需要的不是“最强模型”,而是在具体任务上质量、成本和风险能够被验证的组合。 本文在提纲整理和初稿撰写中使用了AI辅助,发布前已人工复核事实与表达。