Stardust · Jev

对照

把 Stardust · Jev 的跑分放到同一张桌面上

左侧选题,右侧看分。金色条是 Stardust · Jev。倍率广告和实测不是一回事,文末单独拆。

档案方自跑样本 1,0002026-09
中文 held-out 集一致率
自建中文评测集 · 官方 API 标注 · 1,000 条 held-out
stardust-Jev96.4%
stardust-Jev 线上回放抽测99%

怎么测:同一批中文输入分别喂给官方 jev-latest 与 stardust-Jev,统计 top-1 判定一致率,官方输出作为参照标签。

读分时要注意:这是「与官方输出的一致率」,不是人类标注正确率。常规业务分布内约 96%;刁钻语用题(反讽、隐晦不满)会降到约 45–50%。

那些「快几百倍」从哪来

与官方一致率 ~96%
自建 held-out 集实测
常规业务分布内的实测值;刁钻语用题上差距仍大(约 45–50%)。
服务端 p50 ~100ms
持续负载实测
2 核 2G CPU 推理实测;端到端受网络影响约 300–850ms。
支持主动弃权
模型设计
证据不足时返回 __insufficient_evidence__,不硬猜;阈值可用环境变量调。
完全离线 / 私有
部署方式
无外部依赖、无按次计费,数据不出服务器。

延迟:演示数字和实测数字

服务端推理 p50(2 核 2G)

持续负载 150 次请求实测的中位推理耗时。

98 ms

端到端 p50(跨网实测)

含网络往返;题型与 prompt 长度影响明显。

276–845 ms

长上下文分块

超过 1024 token 自动切块串行推理,换完整性换时间。

~5 s/块

单次成本

私有部署 CPU 推理,无 API 计费。

$0