新模型发布后,参数、上下文上限和公开榜单很容易占据讨论,但它们不能直接回答模型是否适合当前业务。一次问答看起来更聪明,也无法说明批量结构化输出是否稳定、长任务是否超时,或最终需要多少人工修改。综合测评需要把能力、速度和成本拆成不同证据:能力由任务验收决定,速度来自同环境端到端测量,成本来自实际用量和账单,再把失败重试与人工返工纳入任务结果。本文给出可复现的首轮评估框架。
测试前冻结模型身份
记录请求使用的模型标识、接口、账号环境、调用时间和响应中的实际模型标识。若服务只提供可变别名,应在报告中说明,不能把别名当作固定版本。
同时从当前官方资料核对支持的输入类型、工具调用、结构化输出和限制。尚未验证的能力不进入结论。
从真实任务而不是演示题采样
按业务分层选择脱敏任务:
| 任务 | 输入 | 硬性验收 |
|---|---|---|
| 事实抽取 | 文档与字段定义 | 字段与原文一致 |
| 冲突分析 | 两份相互冲突的材料 | 冲突被明确列出 |
| 结构化输出 | 边界输入与 Schema | 能解析且字段合法 |
| 代码修复 | 固定仓库和失败测试 | 目标与回归测试通过 |
| 工具任务 | 工具白名单与停止条件 | 无越权和重复副作用 |
任务集中同时包含信息完整、信息缺失和输入冲突的样例。信息不足时正确停止,不应被简单记为失败。
能力只看可验证结果
每个任务预先写完成条件。自动验证优先:Schema、测试、字段对照和引用存在性。需要人工判断的内容使用固定量表,并让评审者不知道候选标签。
至少区分:
硬性通过:所有阻断条件满足
部分通过:产物可用但需要明确修正
失败:关键事实、权限或格式不合格
不可判定:输入或环境不完整
“回答更长”或“语气更专业”不能替代验收。
速度测端到端而不是单一字段
记录请求发出到完整可用结果返回的端到端时间。若使用流式响应,可以同时记录首个可见内容时间和完整响应时间,但要明确两者含义。
测试时固定客户端、网络位置、并发、输入和输出上限。交错运行候选模型,减少某个时间段服务波动对单一候选的影响。分别报告成功请求与失败重试,不把超时样本从结果中静默删除。
成本使用实际账单口径
接口用量字段用于关联请求,最终费用应与同期账单核对。若渠道包含额外费用,分项记录,不推测未知计费。
任务成本可以报告:
模型请求费用
失败与重试费用
检索或工具费用
人工审查和返工分钟
人工时间无法可靠折算时,单独保留分钟数。不要用假定时薪制造精确总价。
使用单位成功任务指标
只有通过硬性验收的任务进入成功数。可以计算:
单位成功调用费用 = 全部纳入实验的调用费用 / 成功任务数
同时报告成功率和样本量。若某候选调用便宜但格式失败和人工返工较多,这些差异不会被单次价格掩盖。
记录最小实验数据
experiment_id
task_id
task_type
model_requested
model_returned
prompt_version
input_snapshot
started_at
first_output_at
completed_at
usage_fields
retry_count
error_category
automatic_validation
human_review
human_edit_minutes
billed_cost
input_snapshot 使用受控存储中的版本标识,不把敏感输入直接放进分析表。
比较时一次只改一个变量
模型比较保持提示词、工具、输入文件、超时和验收不变。若还想测试不同推理参数,先固定模型单独比较。否则无法区分结果来自模型、参数还是上下文变化。
对于非确定性输出,可以按预先确定的次数重复运行。不要看到结果后增加或删除样本,也不要只保留最好的响应。
将结论限制在任务类型
报告可以写:
在本次文档抽取样例中,候选 A 的 Schema 通过数更高。
在本次代码任务中,两者样本不足,暂不替换现有方案。
工具任务出现越权阻断项,候选 B 不进入该路由。
不能从某类任务的结果推出“全面领先”。同一模型可以在文档任务进入候选,在外部工具任务保持禁用。
空白表格不是实测结果
评测方案可以发布为方法,但标题和正文必须明确尚未运行。所有示例结果加上“示意”标记,不能预先填写成功、延迟或成本。完成实验后附上任务集版本、原始记录位置和限制,才能称为测评报告。
结论与限制
新模型综合测评需要把能力、速度和成本分开采证,再以成功任务关联起来。固定真实任务、使用硬性验收、保留失败样本并核对实际账单,能够形成条件化选型结论,而不是聊天观感。
本文只提供评估协议,没有对任何模型给出实际结果。结论会受模型版本、任务集、网络、工具、提示词和人工评分影响;这些条件变化后需要重新测试。