decision.host
首页 / 评估 / japanese llm jp kuci

japanese llm jp kuci

S1MB 公开 NLP 数据集 Choice 0 个模型参评

这是 S1MB 英文套件中的一个基准,取自 japanese-llm-jp-kuci 子集。从作者给出的若干备选里选一个,返回每个备选的概率分布,主指标取「选中项上的目标概率质量」,越高越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。

这是 S1MB 英文套件中的一个基准,取自 japanese-llm-jp-kuci 子集。从作者给出的若干备选里选一个,返回每个备选的概率分布,主指标取「选中项上的目标概率质量」,越高越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。

评估集信息

所属套件
S1MB
分组
公开 NLP 数据集
决策类型
Choice · 选择
样本量
100 个 case
判断数
100
主指标
选中项的目标概率质量(越高越好)
优化方向
越高越好
参评模型
0 个

这个评估集测什么

这是 S1MB 英文套件中的一个基准,取自 japanese-llm-jp-kuci 子集。从作者给出的若干备选里选一个,返回每个备选的概率分布,主指标取「选中项上的目标概率质量」,越高越好。该基准包含 100 个 case、100 个判断。评测协议:S1MB 把原始任务改写为类型化决策问题,模型必须输出概率分布,分数经过「忽略输入的基线」校正后折算到 0–100(50 分代表补上了一半差距,不是答对一半)。

在该评估集上的模型成绩(0 个)

暂无模型在该评估集上的公开成绩。