🔍

CMMLU是中文大规模多任务语言理解基准,包含67个学科的中文知识题,特别侧重中华文化相关知识的测试,用于评估大模…

CMMLU模型评测包含67个学科的中文知识题中文大规模多任务语言理解基准中文大规模多任务理解中华文化知识侧重学科覆盖广开源基准

产品介绍

CMMLU是中文大规模多任务语言理解基准,包含67个学科的中文知识题,特别侧重中华文化相关知识的测试,用于评估大模型在中文文化语境下的知识掌握和推理能力。

面向模型评测工具场景,CMMLU 把"包含67个学科的中文知识题"这类环节打包到一起,省去在多款工具之间来回切换。

核心功能

中文大规模多任务理解:67个学科的中文知识测试,评估中文大模型能力。

中华文化知识侧重:特别覆盖中国历史、地理、文学等文化相关知识。

学科覆盖广:从理工科到人文社科,全面测试中文知识。

开源基准:公开数据集,结果可复现、可比较。

官网地址github.com