🔍
A

AGI-Eval是通用人工智能(AGI)评测基准,从中文通用能力出发,评估大模型在知识、推理、创作、指令遵循等多维度的表…

AGI-Eval模型评测从中文通用能力出发评估大模型在知识推理创作中文通用能力评测多维度任务

产品介绍

AGI-Eval是通用人工智能(AGI)评测基准,从中文通用能力出发,评估大模型在知识、推理、创作、指令遵循等多维度的表现,提供能力评估和排名。

面向模型评测工具场景,AGI-Eval 把"通用人工智能(AGI)评测基准"这类环节打包到一起,省去在多款工具之间来回切换。

核心功能

中文通用能力评测:评估大模型在中文场景下的通用能力。

多维度任务:覆盖知识、推理、创作、指令遵循等维度。

能力评估与排名:提供模型的综合能力评估和排名。

任务标准化:采用标准化任务,结果可比较。

官网地址agi-eval.cn