japanese nanojmteb nlpjournal title intro
这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-nlpjournal-title-intro 子集。判断作者定义的一个真/假条件是否成立,返回两个类别的概率,主指标是 Brier 分数,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-nlpjournal-title-intro 子集。判断作者定义的一个真/假条件是否成立,返回两个类别的概率,主指标是 Brier 分数,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
评估集信息
- 所属套件
- S1MB
- 分组
- 公开 NLP 数据集
- 决策类型
- Noul · 是否
- 样本量
- 100 个 case
- 判断数
- 100
- 主指标
- Brier 分数(越低越好)
- 优化方向
- 越低越好
- 参评模型
- 0 个
这个评估集测什么
这是 S1MB 英文套件中的一个基准,取自 japanese-nanojmteb-nlpjournal-title-intro 子集。判断作者定义的一个真/假条件是否成立,返回两个类别的概率,主指标是 Brier 分数,越低越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。
在该评估集上的模型成绩(0 个)
暂无模型在该评估集上的公开成绩。