三条线路的口径与关键事实
本报告按三条线路展开。
- 线路一为 Jev 本体(闭源 API)
- 线路二为大模型复现(解码器 + 并行约束打分)
- 线路三为 Encoder 复现(编码器 + 决策头,代表项目 Laya)
| 线路 | 代表实现 | 延迟 | 事实与关键约束 |
|---|---|---|---|
| 一:Jev 本体 | TypeSafe AI jev-1.13.0闭源 | 70–500 ms | 厂商口径 86.6% 不可微调;中文偏弱 服务在美西,未对大陆开放 |
| 二:大模型复现 | openjev-sglang、NanoJev 等 | 0.4–2 s | 最好复现落后 Jev 约 13 个点 质量要 7B+,接近 Jev 要 27B/35B 成本最难追 |
| 三:Encoder 复现 | convaiinnovations/laya421M | 32.8 msp50 / T4 | 自报 0.766 在自身训练集上微调 必须微调;出箱校准差(ECE 0.466) 选项数 >50 时崩 |
五条关键结论
-
大模型复现慢,根因是推理形态
Jev 是纯 prefill、共享 state 前缀、读出头预枚举选项,全程不做解码。复现线路若按「逐问调用 + 生成 JSON」必然退化到秒级。
更本质的矛盾:1.5B 模型主字段准确率仅 58%,要到 7B 才达 96%,而 7B 的 prefill 又重——开源侧拿不到「又快又准」。
-
准确率落后 13 个点不是普适结论
差距集中在 Jev 擅长的特定任务上,换任务即可收窄甚至反超。
如 Banking77 上微调 BERT 93.66% vs Jev 92.40%;且该差距衡量的是与闭源模型的一致率,而非真值。
-
「不微调泛化好」成立,但对照对象是 Encoder
准确排序Jev 零样本> 大模型零样本> 微调前 Encoder> 随机干净版 DeBERTa-v3 零样本在多个评测集上全面输给 Jev。
-
Laya 零样本接近随机,且错误不可观测
官方自曝零样本 0.362,低于多数类基线。
更危险的是误判时自报置信度仍高达 0.95+(如英文 checkpoint 跑高棉语准确率 0.000)。
根因:MLM 预训练不提供「按业务口径回答」的能力,决策头随机初始化,必须微调才有用。
-
Laya 微调后与 BERT 同梯队,真增量在校准与形态
两者准确率无数量级差异。Laya 真正的增量在三处:
- 校准(传统 softmax 系统性过度自信)
- 一次前向回答多个问题(33 ms 摊薄)
- 选项集推理时可替换
边界:选项数超 50 时失效。
大模型分类 vs 传统 BERT 分类
大模型的净优势落在标注成本与变更成本上,不在准确率上。
它不是「更好的分类器」,是「更省标注的分类器」。
A固定标签 + 有标注
微调 encoder 更优
- 准确率持平或更好
- 速度快 5–20 倍
- 成本低 1–2 个数量级
- 输出稳定可控
B零样本 / 规则常变
大模型明显更高
- 迭代改 prompt 即可迭代
- 风险格式波动与非法标签风险
回到 Jev 场景
Jev 的主张就是不要用生成式大模型做判断。用大模型替代 BERT 分类,等于回到 Jev 想解决的起点。
真正有优势的是三件事的组合
- 01大模型级预训练表征
- 02决策读出头(工程可复制)
- 03以校准为目标的训练(RLCD)
第 ③ 项是 Jev 唯一真正的壁垒,也是所有开源复现最弱的一环——开源方案的置信度无法可靠标出错误答案。