JEV / 决策工程手册
Jev 与 LLM 分类任务怎么公平比较?
比较同一个工作流的质量、端到端延迟和总成本,而不是复制宣传倍数。
先固定任务与样本
使用同一批真实且已脱敏的输入,人工标注正确处置,区分简单样本和边界样本。不要只挑 Jev 擅长的二元分类。
把两端都做成可用流程
LLM 应使用合理的结构化输出与校验;Jev 则需包含 state 构造、阈值、复核及后续动作。两者都计入网络和预处理时间。
发布完整结果
报告正确率、误分成本、p50/p95、并发、单位输入长度、每千件总费用、人工复核比例。官方展示的极高速度和成本倍数来自特定评测,不能视为所有场景的承诺。
最低限度的测试报告
公布样本来源与数量、人工标签规则、每个模型和版本、地区、并发数、p50/p95、每千件总费用、错误案例,以及“拒绝自动处理”的比例。若没有自有 API 实测,就只引用官方或原作者数据并写清范围。