4月30日,国内权威大模型评测机构SuperCLUE发布《中文大模型基准测评2024年度4月报告》,报告选取国内外具有代表性的32个大模型在4月份的版本,通过多维度综合性测评,真实反映大模型通用能力。
SuperCLUE作为国内权威通用大模型综合性测评基准,其前身可追溯至第三方中文语言理解评估基准CLUE(The Chinese Language Understanding Evaluation)。自2019年成立以来,CLUE基准一直致力于提供科学、客观、中立的语言模型评测,其先后推出了CLUE、FewCLUE、KgCLUE、DataCLUE等多个被广泛认可的评估标准。根据CLUE多年测评经验,SuperCLUE基于通用大模型在学术、产业与用户侧的广泛应用,构建了多层次、多维度的综合性测评基准。
作为一个完全独立的第三方评测机构,SuperCLUE采用自动化评测技术,有效消除人为因素带来的不确定性,确保提供无偏倚的客观评测结果。为确保与真实用户体验一致,SuperCLUE纳入了开放主观问题的测评,通过多维度多视角多层次的评测体系以及对话的形式,真实模拟大模型应用场景,真实有效考察模型生成能力。同时,通过构建多轮对话场景,更深层次考察大模型在真实多轮对话场景的应用效果,对大模型的上下文、记忆、对话能力全方位评测。
本次评测题目为多轮开放式简答题,评测集共2194题,涵盖计算、逻辑推理、代码、工具使用、知识百科、语言理解、长文本、角色扮演、生成与创作、安全十大基础任务。
评测数据显示,云知声山海大模型总分为69.51,跻身国内大模型Top10。值得一提的,在具有产业落地意义的长文本能力上,山海大模型取得了68.2分的优异成绩,位列全球大模型第四、国内大模型第三。
此外,为真实反应通用大模型与产业应用之间的差距,引导大模型提升技术落地效果,在通用能力基础上更好进行垂直领域的应用,SuperCLUE基于基础能力和应用能力两个维度,构建了大模型四个象限,分别代表潜力探索者、技术领跑者、实用主义者、卓越领导者,以此区分大模型所处的不同阶段与定位。象限图显示,山海大模型被归类为实用主义者,这意味着其在场景应用上处于领先地位。
自山海大模型发布以来,云知声一边保持大模型能力高速迭代,一边不断探索大模型场景落地应用。
在大模型能力提升上,目前山海大模型通用能力持续演进,于3月OpenCompass大模型评测中排名全球大模型厂商第六、国产大模型厂商第四, 跻身通用大模型第一梯队;医疗专业能力在2023年6月的MedQA任务中取得87.1%的优异成绩,在临床执业医师资格考试中得分523(总分600分),超过99%的考生水平,并在MedBench评测中以综合得分54.7的优异成绩登顶榜首,其基于山海大模型孵化的医疗大模型也在CCKS 2023 PromptCBLUE医疗大模型评测中夺得通用赛道一等奖。
在大模型场景落地探索上,云知声基于过往实践经验,将山海大模型应用于熟悉的医疗、座舱、交通等行业场景——在医疗领域,云知声基于山海大模型打造的门诊病历生成系统已落地北京友谊医院,有效提升了病历撰写效率与质量;在政务领域,云知声率先开发出深圳首个政务大模型“龙知政”,全场景赋能提升政府治理水平;在座舱领域,云知声通过山海大模型赋能吉利睿蓝汽车打造情感型虚拟助手,为用户带来全车全场景的情感化智能交互体验;在交通领域,云知声山海大模型“入驻”南宁火车东站,打造更具人性化的智能客服,为乘客带来更快捷、更便利的出行体验,相关案例也于近期被央视《焦点访谈》栏目报道。
随着技术进步和应用场景拓展,大模型市场竞争将更加激烈,也将进一步推动技术创新和产业升级。作为大模型赛道的积极参与者与创新者,未来云知声将持续深耕大模型技术创新与研发,增强大模型实用性、适应性,通过与行业伙伴紧密合作,共同推动大模型技术向更高水平发展,为产业升级和经济增长注入新的动力。
(免责声明:此文内容为广告,相关素材由广告主提供,广告主对本广告内容的真实性负责。本网发布目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,请自行核实相关内容。广告内容仅供读者参考。)
最新评论