🔍

HELM是斯坦福CRFM推出的开源大模型评测框架,在多个基准上从准确性、鲁棒性、公平性、毒性、效率等维度透明评估…

HELM模型评测在多个基准上从准确性鲁棒性公平性毒性多基准评测多维度评估

产品介绍

HELM是斯坦福CRFM推出的开源大模型评测框架,在多个基准上从准确性、鲁棒性、公平性、毒性、效率等维度透明评估模型,强调可复现和全面性。

面向模型评测工具场景,HELM 把"斯坦福CRFM推出的开源大模型评测…"这类环节打包到一起,省去在多款工具之间来回切换。

核心功能

多基准评测:在多个评测基准上评估模型,避免单一基准偏差。

多维度评估:覆盖准确性、鲁棒性、公平性、毒性、效率等多个维度。

透明可复现:强调评测透明和可复现,结果可信。

开源框架:开源评测工具,支持自定义。

综合排行榜:发布模型的综合评估结果。

官网地址crfm.stanford.edu