japanese nanojmteb mintaka ja
这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-mintaka-ja 子集。按作者给定的有序标准档位打分,返回每个档位的概率分布,主指标是归一化期望值 MAE,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-mintaka-ja 子集。按作者给定的有序标准档位打分,返回每个档位的概率分布,主指标是归一化期望值 MAE,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
评估集信息
- 所属套件
- S1MB
- 分组
- 公开 NLP 数据集
- 决策类型
- Score · 打分
- 样本量
- 100 个 case
- 判断数
- 100
- 主指标
- normalized_expected_score_mae
- 优化方向
- 越高越好
- 参评模型
- 0 个
这个评估集测什么
这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-mintaka-ja 子集。按作者给定的有序标准档位打分,返回每个档位的概率分布,主指标是归一化期望值 MAE,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
在该评估集上的模型成绩(0 个)
暂无模型在该评估集上的公开成绩。