JEV / 决策工程手册
Jev 置信度:阈值、复核与失败样本
如何把概率用于路由,又不把它误当成“答案正确的保证”。
先定义错误成本
把任务分为可自动处理、需要补充信息和必须人工检查。阈值不是模型的通用常数,应在你的标注数据上调节。
做一套边界样本
至少覆盖候选重叠、信息不足、否定句、多语言输入和从未见过的类别。记录每个样本的真实标签、模型输出和最终处置。
看流程指标
除了单次准确率,还看误分到高风险动作的次数、转人工比例、处理时间与总成本。模型更新后重新检查阈值。
概率分布、confidence、准确率是三回事
Choice/Score 的 probabilities 是一次请求在候选上的分布;confidence 是官方从分布形状计算的单值;准确率则要拿许多带人工标签的样本统计。一个结果的 0.9 不能证明十次会对九次。Noul 没有 confidence 字段,只有陈述的 noul 值。
给不同动作设不同门槛
自动给工单加标签是可撤销动作;自动退款影响资金。前者可以在自己的验证集上选一个阈值,后者还必须有订单、身份、政策和明确授权。相同 confidence 对不同动作不意味着相同风险。阈值下的工单可以先补信息,也可以交人工。
用误分案例调,而不是凭感觉调
把样本按语言、业务类别和错误成本分组。每调一个阈值,同时记录覆盖率、人工复核比例及高代价错误;在独立样本上验证后才上线。模型、候选集或客户构成变化时,原阈值可能失效。
一个可检查的处理规则
例如先把低 confidence 的 Choice 结果转人工,再对已通过阈值的选项执行只读或可撤销动作。阈值需要在带人工标签的数据上调节。Noul 没有 confidence 字段,需根据 noul 概率与陈述方向另定规则。
学习进度仅保存在当前浏览器