🔍
C

C-Eval是中文大模型综合评测基准,包含13948道多项选择题,覆盖52个学科和4个难度级别,从STEM、人文、社会科学到其他领域全面评估中文大模型的综合能力。

C-Eval模型评测包含13948道多项选择题52个学科和4个难度级别中文大模型综合评测基准从STEM中文综合评测多学科覆盖

产品介绍

C-Eval是中文大模型综合评测基准,包含13948道多项选择题,覆盖52个学科和4个难度级别,从STEM、人文、社会科学到其他领域全面评估中文大模型的…

面向模型评测工具场景,C-Eval 把"包含13948道多项选择题"这类环节打包到一起,省去在多款工具之间来回切换。

核心功能

中文综合评测:13948道多项选择题,覆盖52个学科,评估中文大模型综合能力。

多学科覆盖:涵盖STEM(科学、技术、工程、数学)、人文、社会科学、其他等领域。

4个难度级别:题目分为4个难度级别,考察不同层次的认知能力。

评测榜单:提供模型排名,直观对比主流中文大模型的综合表现。

标准化答案:采用多项选择形式,结果可重复、可比较。

官网地址cevalbenchmark.com