decision.host
首页 / 评估 / japanese nanojmteb nlpjournal abs intro

japanese nanojmteb nlpjournal abs intro

S1MB 公开 NLP 数据集 Score 0 个模型参评

这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-nlpjournal-abs-intro 子集。按作者给定的有序标准档位打分,返回每个档位的概率分布,主指标是归一化期望值 MAE,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。

这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-nlpjournal-abs-intro 子集。按作者给定的有序标准档位打分,返回每个档位的概率分布,主指标是归一化期望值 MAE,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。

评估集信息

所属套件
S1MB
分组
公开 NLP 数据集
决策类型
Score · 打分
样本量
100 个 case
判断数
100
主指标
normalized_expected_score_mae
优化方向
越高越好
参评模型
0 个

这个评估集测什么

这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-nlpjournal-abs-intro 子集。按作者给定的有序标准档位打分,返回每个档位的概率分布,主指标是归一化期望值 MAE,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。

在该评估集上的模型成绩(0 个)

暂无模型在该评估集上的公开成绩。