decision.host
首页 / 模型 / NeoHorse Jev 4B

NeoHorse Jev 4B

TokenRhythm ChoiceNoulScore图像 开源权重 4.5B(活跃 3.9B) 手工收录Decision IndexDecision Index VisionS1MB

4.5B 级决策模型,在 S1MB 与 Vision 两个榜上都有成绩。

S1MB Task Avg
43.6
第 28 名 · 覆盖 137/137(100%)
Decision Index Full
38.0
第 59 名 · public 37.0
Vision Full
50.7
第 11 名 · public 57.2
校准 ECE
0.104
越低越好 · Brier 0.513

模型信息

厂商
TokenRhythm
类别
开源权重
参数规模
4.5B(活跃 3.9B)
基座模型
Qwen/Qwen3.5-4B-Base
权重
可下载(开源)
许可证
未标注 许可不明
输入模态
文本 图像
决策原语
ChoiceNoulScore
可微调
未确认
训练方式
head / adapter

数据来源与链接

本站聚合自: 手工收录、Decision Index、Decision Index Vision、S1MB。 分数与链接均指向原始出处。

Decision Index 领域得分

知识与推理
54.5
语言理解
67.0
检索与分类
70.6
工具与自动化
85.9
艺术与人类品味
39.9

S1MB · 137 个基准

基准类型该模型全场最佳 全场均值对比来源
open jev / browser control v1 Choice 100.0 100.0 67.7 来源 ↗
open jev / mailroom control v1 Choice 100.0 100.0 83.1 来源 ↗
s1mb generalization contextual choice Choice 100.0 100.0 82.8 来源 ↗
dbpedia Choice 97.8 98.9 83.7 来源 ↗
arc Choice 94.1 98.5 64.7 来源 ↗
open jev / drone control v1 Noul 94.1 100.0 50.7 来源 ↗
open jev / sponsor segment control v1 Choice 93.6 100.0 52.7 来源 ↗
bbq Choice 91.7 98.3 54.2 来源 ↗
open jev / phone extraction control v1 Noul 90.9 100.0 50.9 来源 ↗
s1mb generalization diverse noul Noul 90.0 100.0 59.5 来源 ↗
s1mb generalization diverse choice Choice 89.4 100.0 69.8 来源 ↗
open jev / vizdoom basic v1 Noul 88.2 100.0 39.6 来源 ↗
s1mb generalization contextual noul Noul 88.0 98.0 62.3 来源 ↗
followir robust04 Noul 87.8 90.9 47.2 来源 ↗
sdoh nli Noul 84.0 92.0 61.0 来源 ↗
snli Choice 83.9 98.4 46.4 来源 ↗
laya / ag news Choice 83.6 94.0 75.5 来源 ↗
massive Choice 83.5 96.7 64.8 来源 ↗
banking77 Choice 83.2 93.7 55.0 来源 ↗
mtop Choice 82.3 87.4 58.9 来源 ↗
laya / enron spam Noul 82.0 100.0 55.0 来源 ↗
miqa Choice 81.8 95.5 62.3 来源 ↗
open jev / email selection control v1 Noul 80.8 100.0 41.3 来源 ↗
scitail Noul 78.0 98.0 53.2 来源 ↗
open jev / mailroom control v1 Noul 76.9 100.0 62.9 来源 ↗
hwu64 Choice 76.6 92.5 57.1 来源 ↗
clinc Choice 76.5 99.3 57.7 来源 ↗
open jev / amount extraction control v1 Choice 76.5 100.0 55.2 来源 ↗
open jev / amount extraction control v1 Noul 75.0 100.0 33.7 来源 ↗
quartz Choice 73.8 88.1 49.4 来源 ↗
lonli Choice 73.8 86.9 39.6 来源 ↗
openbookqa Choice 73.6 97.2 54.1 来源 ↗
open jev / vizdoom basic v1 Score 72.7 100.0 30.2 来源 ↗
s1mb generalization contextual score Score 71.9 92.7 42.4 来源 ↗
open jev / customer control v1 Choice 69.6 82.6 64.4 来源 ↗
hatecheck Noul 68.0 98.0 47.8 来源 ↗
open jev / ir control v1 Choice 68.0 88.0 45.1 来源 ↗
s1mb generalization diverse score Score 67.7 95.3 43.1 来源 ↗
open jev / citation control v1 Choice 66.7 100.0 41.5 来源 ↗
canttalk Noul 66.0 86.0 44.1 来源 ↗
gretel pii Choice 64.9 94.5 43.5 来源 ↗
open jev / customer control v1 Noul 64.7 100.0 58.4 来源 ↗
open jev / entity alignment control v1 Noul 64.1 100.0 36.5 来源 ↗
impli Noul 64.0 88.0 47.0 来源 ↗
paws Noul 64.0 88.0 45.9 来源 ↗
hans Noul 62.0 100.0 43.6 来源 ↗
scone Choice 62.0 92.0 34.5 来源 ↗
synthetic relevance / nanobeir / nanonq Noul 61.7 67.2 39.7 来源 ↗
scicite Choice 61.3 71.0 44.1 来源 ↗
few nerd Choice 60.9 86.4 44.2 来源 ↗
open jev / workflow controls v1 / security incidents Noul 60.4 100.0 38.2 来源 ↗
qasper Noul 60.0 88.0 41.9 来源 ↗
synthetic relevance / nanocoir Noul 58.8 73.0 33.9 来源 ↗
open jev / painting geometry v1 Choice 57.9 100.0 46.7 来源 ↗
arct Choice 57.5 89.4 39.6 来源 ↗
open jev / ir control v1 Noul 57.1 100.0 47.6 来源 ↗
contract nli Choice 55.9 78.5 32.3 来源 ↗
synthetic relevance / nanobeir / nanomsmarco Noul 55.0 62.5 37.5 来源 ↗
aegis2 Noul 54.4 62.3 33.0 来源 ↗
creak Noul 54.0 88.0 39.0 来源 ↗
open jev / phone extraction control v1 Choice 52.2 100.0 33.0 来源 ↗
winobias Choice 52.2 91.3 30.5 来源 ↗
ethos Noul 52.0 76.0 44.0 来源 ↗
go emotions Noul 51.3 61.3 38.5 来源 ↗
argument quality Choice 51.0 95.9 37.8 来源 ↗
ethics Choice 50.0 83.3 21.2 来源 ↗
open jev / reasoning control v1 Choice 50.0 95.0 28.8 来源 ↗
open jev / reasoning control v1 Score 48.8 90.7 28.1 来源 ↗
synthetic relevance / nanobeir / nanohotpotqa Noul 48.7 70.8 28.3 来源 ↗
synthetic relevance / nanobeir / nanodbpedia Noul 48.3 52.1 29.1 来源 ↗
defeasible nli Choice 47.8 80.4 33.2 来源 ↗
open jev / customer control v1 Score 47.4 99.3 36.9 来源 ↗
open jev / painting geometry v1 Noul 46.7 100.0 27.8 来源 ↗
babi nli Noul 46.0 84.0 37.3 来源 ↗
synthetic relevance / nanobeir / nanotouche2020 Score 41.5 44.3 20.9 来源 ↗
open jev / workflow controls v1 / invoice processing Noul 41.2 100.0 34.8 来源 ↗
laya / typed decisions Score 40.8 67.0 26.9 来源 ↗
synthetic relevance / nanobeir / nanofiqa2018 Noul 40.0 54.0 28.7 来源 ↗
synthetic relevance / nanobeir / nanonfcorpus Noul 39.1 46.2 25.1 来源 ↗
synthetic relevance / nanobeir / nanotouche2020 Noul 37.6 47.0 26.8 来源 ↗
gsm8k Choice 37.1 78.6 23.9 来源 ↗
open jev / workflow controls v1 / agent trace observability Noul 36.6 100.0 28.3 来源 ↗
patent similarity Score 36.1 48.3 17.9 来源 ↗
open jev / context retention control v1 Noul 36.0 100.0 19.7 来源 ↗
synthetic relevance / nanobeir / nanodbpedia Score 35.6 44.9 17.8 来源 ↗
robust lr Choice 35.0 66.7 19.1 来源 ↗
synthetic relevance / nanobeir / nanofiqa2018 Score 33.5 46.7 15.4 来源 ↗
ruletaker Noul 32.0 96.0 28.0 来源 ↗
synthetic relevance / nanobeir / nanohotpotqa Score 32.0 63.6 14.1 来源 ↗
winowhy Noul 32.0 62.0 19.0 来源 ↗
wiqa Choice 31.8 58.7 19.5 来源 ↗
ethics Noul 31.7 68.6 24.1 来源 ↗
followir news21 Noul 30.7 42.7 14.9 来源 ↗
open jev / workflow controls v1 / customer service Noul 30.5 100.0 42.1 来源 ↗
lexcomp Noul 30.0 52.0 22.7 来源 ↗
boardgameqa Choice 29.7 62.5 15.8 来源 ↗
laya / typed decisions Noul 29.1 47.8 24.6 来源 ↗
followir core17 Noul 27.2 46.6 21.3 来源 ↗
crows pairs Choice 27.1 70.8 30.7 来源 ↗
open jev / email selection control v1 Choice 27.0 100.0 24.2 来源 ↗
laya / typed decisions Choice 26.8 34.5 19.1 来源 ↗
synthetic relevance / nanobeir / nanomsmarco Score 26.5 52.6 18.1 来源 ↗
stepgame Choice 26.2 82.1 18.0 来源 ↗
logical entailment Noul 26.0 72.0 12.3 来源 ↗
sgd Choice 25.4 96.6 24.4 来源 ↗
synthetic relevance / nanobeir / nanoscidocs Noul 24.4 41.7 17.4 来源 ↗
civil comments Noul 24.4 36.7 21.5 来源 ↗
temporal nli Choice 24.2 80.7 18.5 来源 ↗
synthetic relevance / nanobeir / nanoscidocs Score 22.9 36.7 7.3 来源 ↗
synthetic relevance / nanobeir / nanonfcorpus Score 22.7 38.6 10.9 来源 ↗
synthetic relevance / nanobeir / nanoarguana Score 22.6 36.0 7.6 来源 ↗
cladder Noul 20.0 94.0 18.3 来源 ↗
esci Choice 19.2 46.6 13.3 来源 ↗
tracie Noul 18.0 34.0 8.8 来源 ↗
open jev / reasoning control v1 Noul 16.2 100.0 25.5 来源 ↗
synthetic relevance / nanobeir / nanoarguana Noul 14.7 48.2 15.7 来源 ↗
fol nli Choice 13.1 54.1 10.4 来源 ↗
ud ewt Choice 12.7 56.7 13.4 来源 ↗
open jev / drone control v1 Choice 12.3 100.0 5.1 来源 ↗
aqua rat Choice 8.4 77.5 11.0 来源 ↗
spartqa Choice 8.1 38.7 4.5 来源 ↗
plane Noul 8.0 100.0 11.1 来源 ↗
argument quality Noul 3.1 23.9 5.4 来源 ↗
open jev / painting geometry v1 Score 1.0 100.0 15.9 来源 ↗
corr2cause Choice 0.0 91.7 3.8 来源 ↗
hh rlhf Choice 0.0 23.1 3.1 来源 ↗
nlsat Noul 0.0 22.0 2.2 来源 ↗
open jev / drone control v1 Score 0.0 99.2 1.3 来源 ↗
open jev / entity alignment control v1 Score 0.0 100.0 8.5 来源 ↗
open jev / ir control v1 Score 0.0 98.6 10.6 来源 ↗
open jev / silent failure control v1 Noul 0.0 100.0 38.8 来源 ↗
open jev / snake v1 Choice 0.0 83.5 8.4 来源 ↗
open jev / snake v1 Noul 0.0 100.0 9.1 来源 ↗
open jev / tic tac toe v1 Choice 0.0 48.5 3.5 来源 ↗
poem sentiment Choice 0.0 57.1 3.9 来源 ↗
synthetic relevance / nanobeir / nanonq Score 0.0 49.4 9.5 来源 ↗
synthetic relevance / nanocoir Score 0.0 44.3 4.3 来源 ↗

Decision Index · 42 个基准

基准类型该模型全场最佳 全场均值对比来源
ARC-Easy 混合(Choice 96.3 99.5 87.3 来源 ↗
BFCL 混合(Choice 96.2 98.8 80.3 来源 ↗
ARC-Challenge 混合(Choice 89.2 98.2 79.1 来源 ↗
BANKING77 混合(Choice 83.8 94.1 69.1 来源 ↗
FinEntity 混合(Choice 81.9 97.1 73.8 来源 ↗
RouterBench 混合(Choice 79.5 80.1 73.2 来源 ↗
CLINC150 混合(Choice 78.1 97.4 68.2 来源 ↗
NLI4CT 混合(Choice 75.0 86.2 69.2 来源 ↗
ContractNLI 混合(Choice 72.6 86.5 60.3 来源 ↗
HellaSwag 混合(Choice 72.2 98.5 72.9 来源 ↗
WinoGrande 混合(Choice 68.7 97.5 69.7 来源 ↗
RAGTruth 混合(Choice 68.5 86.0 51.7 来源 ↗
MMLU 混合(Choice 67.9 91.9 64.1 来源 ↗
API-Bank 混合(Choice 66.1 93.1 56.2 来源 ↗
CLadder 混合(Choice 64.9 97.7 62.3 来源 ↗
ToolRet 混合(Choice 64.5 69.1 54.9 来源 ↗
BBH 混合(Choice 63.7 92.9 58.2 来源 ↗
SGD 混合(Choice 59.9 73.4 47.8 来源 ↗
HoVer 混合(Choice 59.3 89.4 63.7 来源 ↗
cfcolor 混合(Choice 57.2 70.2 57.8 来源 ↗
MuSR 混合(Choice 56.1 86.2 55.8 来源 ↗
PhishNChips 混合(Choice 53.8 99.9 61.7 来源 ↗
New Yorker 混合(Choice 52.6 82.0 52.8 来源 ↗
ANLI 混合(Choice 51.9 98.6 53.7 来源 ↗
When2Call 混合(Choice 51.8 91.7 57.9 来源 ↗
Humicroedit 混合(Choice 51.8 75.1 57.2 来源 ↗
BPoMP 混合(Choice 50.5 97.0 73.5 来源 ↗
CRUXEval 混合(Choice 49.6 87.9 50.3 来源 ↗
VAST 混合(Choice 47.4 82.0 50.2 来源 ↗
MMLU-Pro 混合(Choice 45.4 82.7 42.0 来源 ↗
Amazon ESCI 混合(Choice 44.4 61.6 40.7 来源 ↗
BRIGHT 混合(Choice 40.8 50.9 35.9 来源 ↗
iSarcasmEval 混合(Choice 38.0 71.0 38.2 来源 ↗
Habermas 混合(Choice 33.8 71.8 42.3 来源 ↗
GSM8K 混合(Choice 33.7 83.5 35.7 来源 ↗
GPQA Diamond 混合(Choice 32.1 78.3 37.5 来源 ↗
Home appliances 混合(Choice 30.7 98.9 23.1 来源 ↗
SATA-Bench 混合(Choice 21.6 37.2 20.2 来源 ↗
ChessBench 混合(Choice 11.0 40.2 14.1 来源 ↗
HLE 混合(Choice 10.8 20.4 12.3 来源 ↗
POP909 混合(Choice 6.3 74.6 12.5 来源 ↗
ACOS 混合(Choice 5.4 57.3 14.6 来源 ↗

Decision Index · Vision · 20 个基准

基准类型该模型全场最佳 全场均值对比来源
InfographicVQA 图像 89.6 98.7 77.3 来源 ↗
KIE (CORD+FUNSD) 图像 89.1 92.7 80.0 来源 ↗
Winoground 图像 84.0 93.0 70.7 来源 ↗
KIE (CORD+FUNSD) 图像 82.1 92.7 80.0 来源 ↗
Winoground 图像 76.5 93.0 70.7 来源 ↗
InfographicVQA 图像 76.0 98.7 77.3 来源 ↗
CV-Bench 图像 74.1 76.6 49.1 来源 ↗
Mind2Web 图像 73.0 79.7 49.7 来源 ↗
CharXiv 图像 64.2 79.7 48.5 来源 ↗
RealWorldQA 图像 58.7 75.3 41.1 来源 ↗
Mind2Web 图像 54.0 79.7 49.7 来源 ↗
CharXiv 图像 37.8 79.7 48.5 来源 ↗
CV-Bench 图像 35.3 76.6 49.1 来源 ↗
MMMU-Pro vision 图像 23.8 40.7 22.3 来源 ↗
RealWorldQA 图像 22.0 75.3 41.1 来源 ↗
Moderation (Hateful Memes) 图像 19.9 54.0 28.6 来源 ↗
R-Bench-M 图像 13.6 35.4 19.0 来源 ↗
Moderation (Hateful Memes) 图像 7.0 54.0 28.6 来源 ↗
BLINK 图像 -2.1 63.0 32.0 来源 ↗
BLINK 图像 -33.3 63.0 32.0 来源 ↗