跑分档案
公开数字,按出处分开摆
没有「Stardust · Jev 总分」。同一套题、同一套协议,才能并排看。厂商表、档案方自跑、第三方测试,三类不混合排名。
档案方自跑样本 1,000
中文 held-out 集一致率
自建中文评测集 · 官方 API 标注 · 1,000 条 held-out
档案方自跑样本 200
英文 held-out 集一致率
自建英文评测集 · 官方 API 标注 · 200 条 held-out
档案方自跑样本 177
分题型一致率(线上实测)
中文 held-out 分题型抽样 · 每种约 60 题
choice 多选一96.7%
noul 是非判断98.3%
score 分级评分94.7%
怎么测:对大陆线上服务直接发 HTTP 请求,三种题型各约 60 题,统计与官方标注的一致率。
读分时要注意:端到端延迟含网络往返;服务端推理本身约 100ms。
档案方自跑样本 6
选项乱序稳定性
同一题 6 种选项排列
档案方自跑样本 10
弃权机制(中文)
证据不足样本集 · 10 题
stardust-Jev90%
怎么测:官方标注为 __insufficient_evidence__ 的题,看模型是否正确弃权。
读分时要注意:样本仅 10 题。超短模糊输入下弃权阈值 0.40 会把弱答案转成弃权。
档案方自跑样本 150
持续负载测试
连续 150 次真实 HTTP 请求
档案方自跑
批量问题吞吐
单请求 1–8 题
档案方自跑样本 15
难题实测(诚实披露)
反讽/隐晦不满/成语/中英混写等刁钻题 · 15 题