SuperCLUE最新评测：山海通用能力跻身国内大模型Top10，长文本能力位列全国三甲

2024年05月08日 16:30:16 来源：快讯

　　4月30日，国内权威大模型评测机构SuperCLUE发布《中文大模型基准测评2024年度4月报告》，报告选取国内外具有代表性的32个大模型在4月份的版本，通过多维度综合性测评，真实反映大模型通用能力。报告显示，云知声山海大模型在4月评测中取得总分69.51的优异成绩，跻身国内大模型Top10;与GPT-4的对战中，山海综合胜率与和率为75.55%，超越MiniMax、讯飞星火等大模型。

　　SuperCLUE作为国内权威通用大模型综合性测评基准，其前身可追溯至第三方中文语言理解评估基准CLUE(The Chinese Language Understanding Evaluation)。自2019年成立以来，CLUE基准一直致力于提供科学、客观、中立的语言模型评测，其先后推出了CLUE、FewCLUE、KgCLUE、DataCLUE等多个被广泛认可的评估标准。根据CLUE多年测评经验，SuperCLUE基于通用大模型在学术、产业与用户侧的广泛应用，构建了多层次、多维度的综合性测评基准。

　　作为一个完全独立的第三方评测机构，SuperCLUE采用自动化评测技术，有效消除人为因素带来的不确定性，确保提供无偏倚的客观评测结果。为确保与真实用户体验一致，SuperCLUE纳入了开放主观问题的测评，通过多维度多视角多层次的评测体系以及对话的形式，真实模拟大模型应用场景，真实有效考察模型生成能力。同时，通过构建多轮对话场景，更深层次考察大模型在真实多轮对话场景的应用效果，对大模型的上下文、记忆、对话能力全方位评测。

　　本次评测题目为多轮开放式简答题，评测集共2194题，涵盖计算、逻辑推理、代码、工具使用、知识百科、语言理解、长文本、角色扮演、生成与创作、安全十大基础任务。

　　评测数据显示，云知声山海大模型总分为69.51，跻身国内大模型Top10。值得一提的，在具有产业落地意义的长文本能力上，山海大模型取得了68.2分的优异成绩，位列全球大模型第四、国内大模型第三。

　　此外，为真实反应通用大模型与产业应用之间的差距，引导大模型提升技术落地效果，在通用能力基础上更好进行垂直领域的应用，SuperCLUE基于基础能力和应用能力两个维度，构建了大模型四个象限，分别代表潜力探索者、技术领跑者、实用主义者、卓越领导者，以此区分大模型所处的不同阶段与定位。象限图显示，山海大模型被归类为实用主义者，这意味着其在场景应用上处于领先地位。