Stardust · Jev

跑分档案

公开数字,按出处分开摆

没有「Stardust · Jev 总分」。同一套题、同一套协议,才能并排看。厂商表、档案方自跑、第三方测试,三类不混合排名。

档案方自跑样本 1,000
中文 held-out 集一致率
自建中文评测集 · 官方 API 标注 · 1,000 条 held-out
stardust-Jev96.4%
stardust-Jev 线上回放抽测99%

怎么测:同一批中文输入分别喂给官方 jev-latest 与 stardust-Jev,统计 top-1 判定一致率,官方输出作为参照标签。

读分时要注意:这是「与官方输出的一致率」,不是人类标注正确率。常规业务分布内约 96%;刁钻语用题(反讽、隐晦不满)会降到约 45–50%。

档案方自跑样本 200
英文 held-out 集一致率
自建英文评测集 · 官方 API 标注 · 200 条 held-out
stardust-Jev95%
弃权题命中93.3%

怎么测:英文 held-out 回放,统计与官方 jev-latest 的 top-1 一致率;同时记录弃权命中率。

读分时要注意:样本量较小(200)。弃权题 15 题命中 14 题,弃权语义保留完好。

档案方自跑样本 177
分题型一致率(线上实测)
中文 held-out 分题型抽样 · 每种约 60 题
choice 多选一96.7%
noul 是非判断98.3%
score 分级评分94.7%

怎么测:对大陆线上服务直接发 HTTP 请求,三种题型各约 60 题,统计与官方标注的一致率。

读分时要注意:端到端延迟含网络往返;服务端推理本身约 100ms。

档案方自跑样本 6
选项乱序稳定性
同一题 6 种选项排列
stardust-Jev100%
历史批量测试91.7%

怎么测:同一道题打乱选项顺序连测 6 次,统计答案是否翻转。

读分时要注意:样本 6 组排列;更早的批量乱序测试翻转率约 8%。

档案方自跑样本 10
弃权机制(中文)
证据不足样本集 · 10 题
stardust-Jev90%

怎么测:官方标注为 __insufficient_evidence__ 的题,看模型是否正确弃权。

读分时要注意:样本仅 10 题。超短模糊输入下弃权阈值 0.40 会把弱答案转成弃权。

档案方自跑样本 150
持续负载测试
连续 150 次真实 HTTP 请求
成功率100%
p95 延迟0%

怎么测:2 核 2G 服务器上连续打 150 次请求,记录成功率与推理时延漂移。

读分时要注意:CPU 推理;长上下文会触发分块、耗时明显上升。

档案方自跑
批量问题吞吐
单请求 1–8 题

怎么测:一个 /v1/systemone 请求内塞 1–8 个问题,测端到端耗时。

读分时要注意:题数越多耗时线性上升;服务端串行推理。

档案方自跑样本 15
难题实测(诚实披露)
反讽/隐晦不满/成语/中英混写等刁钻题 · 15 题
stardust-Jev46.7%

怎么测:人工挑选官方答对的刁钻中文题,测一致率。

读分时要注意:这是最差场景。网络梗、阴阳怪气、委婉不满仍是短板,不建议全信。